旗舰对决 · 2026-08-22

Claude Opus 5 vs GPT-5.6 Sol
半个百分点的战争

Artificial Analysis 的 Terminal-Bench 2.1 上,Sol 89.5 对 Opus 5 89.1——两大 agent 默认模型的差距只剩半个点。选谁,看的是榜单之外的东西。

#claude opus 5#gpt-5.6 sol#terminal-bench#对比

要点

0.4

TB 2.1 分差(AA 口径)

Sol 89.5 vs Opus 5 89.1(Artificial Analysis,xhigh 档)。官方 tbench.ai 榜口径不同,见下文。

$5 / $25

Opus 5 每百万 token(输入/输出)

QCode 目录价。Sol 为 $5/$30——输入同价,输出 Sol 贵 20%。

1M / 400K

上下文窗口

Opus 5 1M token;Sol 400K。超长上下文场景 Opus 占优。

89.1 / 89.5

谁赢取决于口径

AA 榜 Sol 领先 0.4;官方 tbench.ai 榜首是 Claude Code × Fable 5(83.8),两者都不在榜首。

两个模型各自的定位

Opus 5(07-24)是 Anthropic 的现役旗舰,Claude Code 的默认高端模型,1M 上下文,以长程 agent 任务与工具使用见长。GPT-5.6 Sol 是 OpenAI 5.6 系列的旗舰档(Terra/Luna 之上),400K 上下文,07-30 新增了 2.5x 速度的 Fast 模式(2 倍价)。两者分别是 Claude Code 与 Codex 的默认高端模型。

半个点的差距意味着什么

08-08 起「Sol 89.5 vs Opus 5 89.1」的 Artificial Analysis 数据被大量引用,BuildApps 的标题直接写「差距小到基准不再是决策依据」。业界共识:头部两强的 agentic 编码能力已事实打平,决策变量转向上下文长度、价格、生态与配额。注意另有官方 tbench.ai 榜单(agent+模型组合口径),数字体系不同。

时间线

2026-07-24

Claude Opus 5 发布,同日放出两个 beta(含会话中途改工具)。

2026-07-30

GPT-5.6 系列调价:Luna -80%、Terra -20%,Sol 价格不变但新增 Fast 模式。

2026-08-08

AA 口径「Sol 89.5 vs Opus 5 89.1」广泛传播,「基准饱和」成为话题。

已确认 vs 注意

已确认

两者的上下文、定价、榜单分差均有官方页或可复核榜单支撑。两者在 QCode 均有真实调用量(30 天用量 > 0)。

注意

别拿不同榜单的分数互相比:AA(模型直测、xhigh)与 tbench.ai 官方(agent+模型组合)是两套体系。比 Opus 5 和 Sol 时,固定同一份榜。

按场景选

选 Opus 5

超长上下文(1M)、Claude Code 生态、长程 agent 任务。输出每百万 $25,比 Sol 便宜 $5。

选 GPT-5.6 Sol

Codex 生态、需要 Fast 模式(2.5x 速度)、或已有 OpenAI 系工具链。输出每百万 $30。

怎么自己得出结论

拿自己仓库的 5-10 个真实任务,同一 agent、同一 effort 档、两边各跑一遍,比「一次通过率 × token 成本」。榜单差半个点的两个模型,在你的负载上可能差出一个档——只有自己跑过才知道方向。

在 QCode 上

claude-opus-5 与 gpt-5.6-sol 均在售(30 天内有真实调用)。同一把 key、同一个端点,换模型只改一个 id——对比测试的成本就是两轮调用的 token 费。

常见问题

Opus 5 和 GPT-5.6 Sol 哪个更强?

AA 的 Terminal-Bench 2.1 上 Sol 89.5 对 Opus 5 89.1,差 0.4 分,基准层面事实打平。差异在生态、上下文与价格。

价格差多少?

QCode 目录价:Opus 5 $5/$25,Sol $5/$30(每百万 token 输入/输出)。输入同价,输出 Sol 贵 20%。

上下文谁大?

Opus 5:1M token。Sol:400K。超长仓库与长会话场景 Opus 占优。

为什么有的榜单 Opus 5 更高?

榜单体系不同:tbench.ai 官方榜测「agent+模型」组合,vals.ai 用统一 harness 重测,AA 是模型直测。跨榜比分没有意义。

两个都能用 Claude Code / Codex 吗?

Claude Code 默认走 Claude 系,Codex 默认走 OpenAI 系;用支持自定义端点的工具(Cline 等)则可以自由配对。

QCode 上两个都能调吗?

都在售,同一把 key 切换。建议用真实任务各跑一轮再定主力。

信息来源

Artificial Analysis(经 BuildApps 08-08、The Batch 08-21 转引)、tbench.ai 官方榜(08-22 抓取)、Anthropic 官方公告(07-24)、OpenAI 调价公告(07-30)、QCode /models(08-22)。

同一把 key,两个都跑一遍

Opus 5 与 Sol 在 QCode 同端点在售,实测比榜单可靠。