榜单解读 · Terminal-Bench 3.0

Terminal-Bench 3.0
比 2.1 难得多,榜首刚过 40%

TB 3.0 于 2026-08-19 上线,目标是把基线模型的首次通过率压到 30% 以下;当前榜首 Claude Opus 5 只拿到 42.7%,而 2.1 的榜首已经卡在 88% 附近饱和。

#TB 3.0#2026-08-19 上线#42.7% 榜首#GPU 沙箱

四个关键事实

42.7%

当前榜首得分

Claude Opus 5 以 42.7% 位居 TB 3.0 榜首,是目前唯一过 40% 的模型。

88.4%

2.1 榜首得分(已饱和)

TB 2.1 的榜首 Grok 4.6 得分 88.4%,前四名都挤在 86%-89% 区间,区分度已经很低。

<30%

3.0 的设计目标

开发方(Harbor、Laude Institute、Snorkel AI、Turing)明确把基线模型首次通过率的设计目标定在 30% 以下。

7 大类

任务域覆盖

3.0 覆盖 7 个任务域,引入 GPU 沙箱(最高 H100)、多容器拓扑、真实微服务与更严格的判定逻辑。

3.0 和 2.1 到底差在哪

TB 2.1 的头部模型已经普遍逼近 90% 分,区分度不足以再看出模型之间的真实差距,这是基准测试常见的「饱和」问题。TB 3.0 不是简单加题,而是从基础设施层面提高难度:引入最高配置 H100 的 GPU 沙箱、多容器拓扑结构、接入真实运行的微服务,并采用更严格的「当且仅当」判定逻辑(不是模糊近似打分)。开发方公开表示,3.0 的任务难度目标是让基线模型的首次通过率压到 30% 以下,这也是为什么榜首 Claude Opus 5 只有 42.7% 分——不是模型变弱了,是尺子变严了。

最新进展

TB 3.0 于 2026-08-19 上线,首个版本(v0.1)包含 74 道题,覆盖 7 个任务域。当前榜单前 8 名依次是 Claude Opus 5(42.7%)、GPT-5.6 Sol(34.6%)、Claude Fable 5(34.0%)、GLM-5.3(32.4%)、Grok 4.6(26.5%)、Claude Opus 4.8(21.1%)、GPT-5.6 Terra(20.8%)、Cognition 的 SWE-1.7 Lightning(18.6%)。

时间线

2026-08-19

Terminal-Bench 3.0 上线,v0.1 包含 74 道题,覆盖 7 个任务域。

上线当周

首批榜单公布,Claude Opus 5 以 42.7% 位居榜首,成为目前唯一过 40% 的模型。

持续中

作为早期版本,题库与榜单预计会持续扩充,具体排名会随版本演进变化。

已确认 vs 需要持续关注

已确认

TB 3.0 于 2026-08-19 上线、由 Harbor、Laude Institute、Snorkel AI、Turing 联合开发,当前榜首是 Claude Opus 5(42.7%);TB 2.1 榜首 Grok 4.6 为 88.4%,前四名集中在 86%-89% 区间。

需要持续关注

3.0 目前仍是早期版本(v0.1、74 题),题库和榜单大概率会持续扩充与调整,具体排名会随版本演进变化,不要把某次抓取的排名当成长期不变的结论。

TB 3.0 vs TB 2.1

TB 2.1(趋于饱和)

头部模型集中在 86%-89%,区分度低;仍在广泛使用,但已经很难看出模型间的真实差距。

TB 3.0(拉开差距)

GPU 沙箱 + 多容器 + 真实微服务 + 严格判定,榜首刚过 40%,更能反映当前模型的真实上限。

怎么看这份榜单

先看任务域覆盖是否匹配你的实际场景(3.0 覆盖 7 个域,不是所有任务都和你的用例相关);再看具体分差而不是名次——TB 3.0 头部几个模型的分差本身就不小(42.7% vs 34.6% vs 34.0%),比 2.1 那种挤在几个百分点内更有参考价值。版本仍在早期,建议定期回看而不是只看一次快照。

在 QCode 上怎么办

TB 3.0 当前榜单前 8 名里,Claude Opus 5、GPT-5.6 Sol、Claude Fable 5、GLM-5.3、Claude Opus 4.8 这 5 个都在 QCode 的在售模型阵容里,一把密钥即可按官方价 × 服务费率调用;Grok 4.6 与 SWE-1.7 Lightning 目前不在 QCode 在售范围内。

常见问题

为什么 TB 3.0 的分数普遍比 2.1 低这么多?

不是模型变弱,是评测标准变严了。3.0 引入了 GPU 沙箱、多容器拓扑、真实微服务和更严格的判定逻辑,开发方明确把基线模型首次通过率的设计目标定在 30% 以下,分数自然普遍走低。

TB 2.1 还有参考价值吗?

有,但头部模型已经普遍逼近饱和(86%-89% 区间),区分度变低;如果只是横向比较头部几个模型,3.0 的参考价值更高。

TB 3.0 现在覆盖多少道题?

首个版本(v0.1)包含 74 道题,覆盖 7 个任务域;作为早期版本,题库预计会持续扩充。

Grok 4.6 在 TB 2.1 是第一,为什么在 3.0 排名靠后?

两个版本的任务难度和基础设施要求差异很大,3.0 更强调真实、复杂的多容器/微服务场景,不同模型在这类新场景下的表现明显不同于 2.1 那套题,排名变化是正常的。

QCode 上能调用榜单里的所有模型吗?

不能。TB 3.0 前 8 名里 Grok 4.6、SWE-1.7 Lightning 目前不在 QCode 在售范围内;其余 5 个(Claude Opus 5、GPT-5.6 Sol、Claude Fable 5、GLM-5.3、Claude Opus 4.8)都可以通过 QCode 一把密钥调用。

TB 3.0 的判定逻辑「当且仅当」是什么意思?

指更严格的自动化判定——任务要被判定为完成,必须精确满足预设条件,而不是模糊近似打分,这样能减少「看起来做对了但其实没完全对」这类误判。

信息来源

TB 3.0 的上线日期(2026-08-19)、开发方(Harbor、Laude Institute、Snorkel AI、Turing)、任务域数量、设计目标(基线模型首次通过率 <30%)与当前榜单分数,均来自 Terminal-Bench 3.0 官方榜单页面与相关技术媒体报道;TB 2.1 榜单分数来自同一系列榜单的 2.1 版本页面。本页内容于 2026-08-27 核对。

榜单之外,一把 key 测遍主流模型

Claude Opus 5、GPT-5.6 Sol、Claude Fable 5、GLM-5.3 等 TB 3.0 头部模型,QCode 一把密钥即可调用。