榜单解读 · 2026-08-22 快照

Terminal-Bench 2.1
三个第一,信哪个

同一个基准,官方榜、Artificial Analysis、vals.ai 给出三个不同的第一名。差异不是谁刷分,是 harness、effort 档位与快照日期。

#terminal-bench-2.1#89 个任务#三份榜单#TB 3.0 已来

三份榜单的第一名

83.8

官方榜 · Claude Code × Fable 5

tbench.ai,agent + 模型组合条目,xhigh 档,2026-06-07 快照,单次成本 $552.67。

89.5

Artificial Analysis · GPT-5.6 Sol

xhigh 推理档。Opus 5 以 89.1 紧随,Grok 4.6 以 88.4 列第三(The Batch 08-21 转引)。

85.77

vals.ai · GPT-5.6 Sol

统一 Terminus 2 harness、pass@1。Opus 5 84.64、Kimi K3 80.90。

89

任务数

从模型训练到系统管理员的终端任务,按难度分级;发布初期无模型在 hard 档超过 50%。

Terminal-Bench 2.1 是什么

Terminal-Bench 是社区开源的终端 agent 基准:模型要在沙箱终端里真实完成任务——比如「用 data/ 里的 yelp 数据训练一个 fasttext 模型,体积小于 150MB 且在私有测试集上达到 0.62 准确率」。2.1 版共 89 个任务,覆盖模型训练、系统管理等类目,pass@1 判定:任务附带的 pytest 全部通过才得分。终端操作是 Claude Code、Codex、Cursor 等 agent 的主战场,这个榜因此成了 agentic coding 的硬指标。

本月为什么又吵起来

08-08 起多家媒体引用 Artificial Analysis 数据:GPT-5.6 Sol 89.5 对 Claude Opus 5 89.1,前两名只差 0.4;08-21 The Batch 报道 Grok 4.6 以 88.4 进前三。与此同时官方 tbench.ai 榜单的第一名是 Claude Code × Fable 5 的 83.8——两套数字都对,只是测的不是同一种「模型」。另外 GLM-5.3 的发布稿已用 Terminal-Bench 3.0 作参照,2.1 正在变成上一代榜单。

时间线

2026-06-07

官方榜当前第一条目:Claude Code × Fable 5(xhigh)83.8。

2026-08-08

「Sol 89.5 vs Opus 5 89.1」的 Artificial Analysis 数据开始被媒体大量引用。

2026-08-21

The Batch:Grok 4.6 88.4 进前三;同期 vals.ai 快照 Sol 85.77 / Opus 5 84.64 / K3 80.90。

已确认 vs 易误读

已确认

三份榜单都真实存在且数字可复核:官方 tbench.ai(agent + 模型组合、harbor 框架)、vals.ai(统一 Terminus 2 harness、pass@1)、Artificial Analysis(模型直测、标注 effort 档)。数字差异来自 harness 与档位,不是数据造假。

易误读

「X 模型 Terminal-Bench 第一」的标题基本都不说用的是哪份榜、哪个 agent、哪个 effort 档。官方榜测的是「agent + 模型」组合(如 Claude Code × Fable 5),不是裸模型;把组合分当成模型分是最常见的误读。

比分数之前先比成本

分数相近

官方榜前二只差 0.7(83.8 vs 83.1),Artificial Analysis 榜前二只差 0.4。2.1 对头部模型已接近饱和。

成本差数倍

官方榜单次运行成本:Fable 5 组合 $552.67,GPT-5.5 组合 $2,059.19。同分段的预算可以差近 4 倍。

怎么自己复测

官方框架是 harbor:harbor run -d terminal-bench/terminal-bench-2-1 -a "<agent>" -m "<model>" -k 5。想横向比模型,固定同一个 agent 和 effort 档再比;想选型 agent,固定模型再比。vals.ai 与 Artificial Analysis 的快照可作旁证。

在 QCode 上

三份榜单前排的模型——Fable 5、Opus 5、Sonnet 5、GPT-5.5、GPT-5.6 全系、Kimi K3、GLM-5.2——在 QCode 用同一把 key 就能逐一复测,官方价乘服务费率,跑一轮的成本远低于在各平台分别充值。Grok 系列 QCode 未接入,需另寻官方渠道。

常见问题

Terminal-Bench 2.1 的第一名到底是谁?

取决于哪份榜:官方 tbench.ai 是 Claude Code × Fable 5(83.8),Artificial Analysis 是 GPT-5.6 Sol(89.5),vals.ai 快照也是 Sol(85.77)。三者的 harness 与统计口径不同。

为什么官方榜的数字低那么多?

官方榜测「agent + 模型」组合且条目带各自快照日期;vals.ai 用统一 Terminus 2 harness 重测,Artificial Analysis 是模型直测并标注 effort 档。harness 越强、档位越高,分数越高。

89 个任务都考什么?

沙箱终端里的真实任务:模型训练、系统管理、数据处理等,按难度分级。pass@1 判定,任务附带的 pytest 全过才得分。

Terminal-Bench 3.0 出了吗?

已被厂商引用:GLM-5.3 发布稿以 TB 3.0 作参照,第三方对比页显示 Opus 5 42.7 / Sol 34.6。难度显著更高,2.1 的头部分数已接近饱和。

复测一轮要多少钱?

官方榜条目带成本列:Fable 5 组合 $552.67、GPT-5.5 组合 $2,059.19 单次。用统一 API 平台按量计费,比在各平台分别订阅便宜得多。

选型该看哪份榜?

选 agent 看官方榜(组合分),选裸模型看 vals.ai(统一 harness),快速横向对比看 Artificial Analysis。任何单一数字都不该是唯一依据。

信息来源

tbench.ai 官方榜(2026-08-22 抓取)、vals.ai Terminal-Bench 2.1 方法说明与快照、Artificial Analysis(经 felloai 与 The Batch 2026-08-21 转引)、BuildApps(2026-08-08)。

一把 key,自己跑出结论

榜单前排模型在 QCode 同端点可调,按官方价乘服务费率,复测成本自己掌控。