Claude Opus 5 vs GPT-5.6 Sol
半个百分点的战争
Artificial Analysis 的 Terminal-Bench 2.1 上,Sol 89.5 对 Opus 5 89.1——两大 agent 默认模型的差距只剩半个点。选谁,看的是榜单之外的东西。
要点
TB 2.1 分差(AA 口径)
Sol 89.5 vs Opus 5 89.1(Artificial Analysis,xhigh 档)。官方 tbench.ai 榜口径不同,见下文。
Opus 5 每百万 token(输入/输出)
QCode 目录价。Sol 为 $5/$30——输入同价,输出 Sol 贵 20%。
上下文窗口
Opus 5 1M token;Sol 400K。超长上下文场景 Opus 占优。
谁赢取决于口径
AA 榜 Sol 领先 0.4;官方 tbench.ai 榜首是 Claude Code × Fable 5(83.8),两者都不在榜首。
两个模型各自的定位
Opus 5(07-24)是 Anthropic 的现役旗舰,Claude Code 的默认高端模型,1M 上下文,以长程 agent 任务与工具使用见长。GPT-5.6 Sol 是 OpenAI 5.6 系列的旗舰档(Terra/Luna 之上),400K 上下文,07-30 新增了 2.5x 速度的 Fast 模式(2 倍价)。两者分别是 Claude Code 与 Codex 的默认高端模型。
半个点的差距意味着什么
08-08 起「Sol 89.5 vs Opus 5 89.1」的 Artificial Analysis 数据被大量引用,BuildApps 的标题直接写「差距小到基准不再是决策依据」。业界共识:头部两强的 agentic 编码能力已事实打平,决策变量转向上下文长度、价格、生态与配额。注意另有官方 tbench.ai 榜单(agent+模型组合口径),数字体系不同。
时间线
Claude Opus 5 发布,同日放出两个 beta(含会话中途改工具)。
GPT-5.6 系列调价:Luna -80%、Terra -20%,Sol 价格不变但新增 Fast 模式。
AA 口径「Sol 89.5 vs Opus 5 89.1」广泛传播,「基准饱和」成为话题。
已确认 vs 注意
已确认
两者的上下文、定价、榜单分差均有官方页或可复核榜单支撑。两者在 QCode 均有真实调用量(30 天用量 > 0)。
注意
别拿不同榜单的分数互相比:AA(模型直测、xhigh)与 tbench.ai 官方(agent+模型组合)是两套体系。比 Opus 5 和 Sol 时,固定同一份榜。
按场景选
选 Opus 5
超长上下文(1M)、Claude Code 生态、长程 agent 任务。输出每百万 $25,比 Sol 便宜 $5。
选 GPT-5.6 Sol
Codex 生态、需要 Fast 模式(2.5x 速度)、或已有 OpenAI 系工具链。输出每百万 $30。
怎么自己得出结论
拿自己仓库的 5-10 个真实任务,同一 agent、同一 effort 档、两边各跑一遍,比「一次通过率 × token 成本」。榜单差半个点的两个模型,在你的负载上可能差出一个档——只有自己跑过才知道方向。
在 QCode 上
claude-opus-5 与 gpt-5.6-sol 均在售(30 天内有真实调用)。同一把 key、同一个端点,换模型只改一个 id——对比测试的成本就是两轮调用的 token 费。
常见问题
Opus 5 和 GPT-5.6 Sol 哪个更强?
AA 的 Terminal-Bench 2.1 上 Sol 89.5 对 Opus 5 89.1,差 0.4 分,基准层面事实打平。差异在生态、上下文与价格。
价格差多少?
QCode 目录价:Opus 5 $5/$25,Sol $5/$30(每百万 token 输入/输出)。输入同价,输出 Sol 贵 20%。
上下文谁大?
Opus 5:1M token。Sol:400K。超长仓库与长会话场景 Opus 占优。
为什么有的榜单 Opus 5 更高?
榜单体系不同:tbench.ai 官方榜测「agent+模型」组合,vals.ai 用统一 harness 重测,AA 是模型直测。跨榜比分没有意义。
两个都能用 Claude Code / Codex 吗?
Claude Code 默认走 Claude 系,Codex 默认走 OpenAI 系;用支持自定义端点的工具(Cline 等)则可以自由配对。
QCode 上两个都能调吗?
都在售,同一把 key 切换。建议用真实任务各跑一轮再定主力。
信息来源
Artificial Analysis(经 BuildApps 08-08、The Batch 08-21 转引)、tbench.ai 官方榜(08-22 抓取)、Anthropic 官方公告(07-24)、OpenAI 调价公告(07-30)、QCode /models(08-22)。
相关阅读
与 Anthropic / OpenAI 无隶属。榜单数字为 2026-08 快照。