8 篇
基准与榜单
SWE-bench、Terminal-Bench 等公开基准的成绩与它们实际能说明什么。
Terminal-Bench 3.0 完整解读
TB 3.0 vs 2.1 区别、当前榜单与在售模型对应
更新于 2026-08-27
Artificial Analysis 智能指数解读
9 项子测试权重全解析与常见误解
更新于 2026-08-27
Terminal-Bench 2.1 榜单解读
三份榜单三个第一:官方 83.8 / AA 89.5 / vals 85.77 差异全解
更新于 2026-08-22
SWE-bench Pro 三个第一口径全解
80.3 / 80.0 / 官方榜:数据切分与 scaffold 的真相
更新于 2026-08-22
Ornith-1.5 的自评估方法
不依赖公开跑分,自己判断新模型是否适合你的活。
更新于 2026-08-20
Claude Fable 5 SWE-Bench Pro 分数解读
80.3% 分数来源、官方口径 vs 独立复现的争议,以及参考价值与局限
更新于 2026-08-08
从 SWE-Bench 到生产:2026 基准如何(不)转化为交付速度
SWE-Bench 88% 听起来很酷,但在你的私有仓库里经常只有 30%。理解差距,构建自己的验证 harness 才是王道。
更新于 2026-07-13
SWE-Bench Pro 2026 编程模型排行:Opus 4.7 vs GPT-5.5 vs GPT-5.3-Codex
SWE-Bench Pro 2026 编程模型横评:GPT-5.3-Codex 56.8% SOTA、GPT-5.5 58.6%、GPT-5.2-Codex 56.4%/80% Verified、Claude Opus 4.8 Fast Mode 默认。本指南讲基准本身、Q1-Q2 分数演进、业务场景选型、通过 QCode 接入统一通路。
更新于 2026-05-16