Terminal-Bench 3.0
比 2.1 难得多,榜首刚过 40%
TB 3.0 于 2026-08-19 上线,目标是把基线模型的首次通过率压到 30% 以下;当前榜首 Claude Opus 5 只拿到 42.7%,而 2.1 的榜首已经卡在 88% 附近饱和。
四个关键事实
当前榜首得分
Claude Opus 5 以 42.7% 位居 TB 3.0 榜首,是目前唯一过 40% 的模型。
2.1 榜首得分(已饱和)
TB 2.1 的榜首 Grok 4.6 得分 88.4%,前四名都挤在 86%-89% 区间,区分度已经很低。
3.0 的设计目标
开发方(Harbor、Laude Institute、Snorkel AI、Turing)明确把基线模型首次通过率的设计目标定在 30% 以下。
任务域覆盖
3.0 覆盖 7 个任务域,引入 GPU 沙箱(最高 H100)、多容器拓扑、真实微服务与更严格的判定逻辑。
3.0 和 2.1 到底差在哪
TB 2.1 的头部模型已经普遍逼近 90% 分,区分度不足以再看出模型之间的真实差距,这是基准测试常见的「饱和」问题。TB 3.0 不是简单加题,而是从基础设施层面提高难度:引入最高配置 H100 的 GPU 沙箱、多容器拓扑结构、接入真实运行的微服务,并采用更严格的「当且仅当」判定逻辑(不是模糊近似打分)。开发方公开表示,3.0 的任务难度目标是让基线模型的首次通过率压到 30% 以下,这也是为什么榜首 Claude Opus 5 只有 42.7% 分——不是模型变弱了,是尺子变严了。
最新进展
TB 3.0 于 2026-08-19 上线,首个版本(v0.1)包含 74 道题,覆盖 7 个任务域。当前榜单前 8 名依次是 Claude Opus 5(42.7%)、GPT-5.6 Sol(34.6%)、Claude Fable 5(34.0%)、GLM-5.3(32.4%)、Grok 4.6(26.5%)、Claude Opus 4.8(21.1%)、GPT-5.6 Terra(20.8%)、Cognition 的 SWE-1.7 Lightning(18.6%)。
时间线
Terminal-Bench 3.0 上线,v0.1 包含 74 道题,覆盖 7 个任务域。
首批榜单公布,Claude Opus 5 以 42.7% 位居榜首,成为目前唯一过 40% 的模型。
作为早期版本,题库与榜单预计会持续扩充,具体排名会随版本演进变化。
已确认 vs 需要持续关注
已确认
TB 3.0 于 2026-08-19 上线、由 Harbor、Laude Institute、Snorkel AI、Turing 联合开发,当前榜首是 Claude Opus 5(42.7%);TB 2.1 榜首 Grok 4.6 为 88.4%,前四名集中在 86%-89% 区间。
需要持续关注
3.0 目前仍是早期版本(v0.1、74 题),题库和榜单大概率会持续扩充与调整,具体排名会随版本演进变化,不要把某次抓取的排名当成长期不变的结论。
TB 3.0 vs TB 2.1
TB 2.1(趋于饱和)
头部模型集中在 86%-89%,区分度低;仍在广泛使用,但已经很难看出模型间的真实差距。
TB 3.0(拉开差距)
GPU 沙箱 + 多容器 + 真实微服务 + 严格判定,榜首刚过 40%,更能反映当前模型的真实上限。
怎么看这份榜单
先看任务域覆盖是否匹配你的实际场景(3.0 覆盖 7 个域,不是所有任务都和你的用例相关);再看具体分差而不是名次——TB 3.0 头部几个模型的分差本身就不小(42.7% vs 34.6% vs 34.0%),比 2.1 那种挤在几个百分点内更有参考价值。版本仍在早期,建议定期回看而不是只看一次快照。
在 QCode 上怎么办
TB 3.0 当前榜单前 8 名里,Claude Opus 5、GPT-5.6 Sol、Claude Fable 5、GLM-5.3、Claude Opus 4.8 这 5 个都在 QCode 的在售模型阵容里,一把密钥即可按官方价 × 服务费率调用;Grok 4.6 与 SWE-1.7 Lightning 目前不在 QCode 在售范围内。
常见问题
为什么 TB 3.0 的分数普遍比 2.1 低这么多?
不是模型变弱,是评测标准变严了。3.0 引入了 GPU 沙箱、多容器拓扑、真实微服务和更严格的判定逻辑,开发方明确把基线模型首次通过率的设计目标定在 30% 以下,分数自然普遍走低。
TB 2.1 还有参考价值吗?
有,但头部模型已经普遍逼近饱和(86%-89% 区间),区分度变低;如果只是横向比较头部几个模型,3.0 的参考价值更高。
TB 3.0 现在覆盖多少道题?
首个版本(v0.1)包含 74 道题,覆盖 7 个任务域;作为早期版本,题库预计会持续扩充。
Grok 4.6 在 TB 2.1 是第一,为什么在 3.0 排名靠后?
两个版本的任务难度和基础设施要求差异很大,3.0 更强调真实、复杂的多容器/微服务场景,不同模型在这类新场景下的表现明显不同于 2.1 那套题,排名变化是正常的。
QCode 上能调用榜单里的所有模型吗?
不能。TB 3.0 前 8 名里 Grok 4.6、SWE-1.7 Lightning 目前不在 QCode 在售范围内;其余 5 个(Claude Opus 5、GPT-5.6 Sol、Claude Fable 5、GLM-5.3、Claude Opus 4.8)都可以通过 QCode 一把密钥调用。
TB 3.0 的判定逻辑「当且仅当」是什么意思?
指更严格的自动化判定——任务要被判定为完成,必须精确满足预设条件,而不是模糊近似打分,这样能减少「看起来做对了但其实没完全对」这类误判。
信息来源
TB 3.0 的上线日期(2026-08-19)、开发方(Harbor、Laude Institute、Snorkel AI、Turing)、任务域数量、设计目标(基线模型首次通过率 <30%)与当前榜单分数,均来自 Terminal-Bench 3.0 官方榜单页面与相关技术媒体报道;TB 2.1 榜单分数来自同一系列榜单的 2.1 版本页面。本页内容于 2026-08-27 核对。
相关阅读
SWE-bench Pro 2026 排行榜
另一个头部代码能力榜单的最新情况。
Artificial Analysis 智能指数怎么算的
另一个综合性榜单的计算方法,TB 2.1 正是它的一个组成部分。
AI 模型雷达 2026
站内自建的模型综合对比。
本页榜单数据来自 Terminal-Bench 官方榜单页面,不代表 QCode 官方立场;具体分数以榜单页面实时数据为准,我们不做自建排名。