旗艦対決 · 2026-08-22

Claude Opus 5 vs GPT-5.6 Sol
0.4 ポイントの戦争

Artificial Analysis の Terminal-Bench 2.1 で Sol 89.5 対 Opus 5 89.1——2 大 agent デフォルトモデルの差は 0.4 ポイントまで縮まった。どちらを選ぶかは、ランキングの外で決まる。

#claude opus 5#gpt-5.6 sol#terminal-bench#比較

要点

0.4

TB 2.1 の点差(AA 口径)

Sol 89.5 vs Opus 5 89.1(Artificial Analysis、xhigh 設定)。公式の tbench.ai ボードは口径が異なる。詳しくは後述。

$5 / $25

Opus 5 の 100 万トークン価格(入力/出力)

QCode のカタログ価格。Sol は $5/$30——入力は同価格、出力は Sol が 20% 高い。

1M / 400K

コンテキストウィンドウ

Opus 5 は 1M トークン、Sol は 400K。超長コンテキストの場面では Opus が有利。

89.1 / 89.5

勝者はボードによって変わる

AA ボードでは Sol が 0.4 リード。公式 tbench.ai の首位は Claude Code × Fable 5(83.8)で、この 2 モデルはどちらも首位ではない。

2 モデルの位置づけ

Opus 5(07-24)は Anthropic の現行旗艦で、Claude Code のデフォルト上位モデル。1M コンテキストを持ち、長距離 agent タスクとツール使用に強い。GPT-5.6 Sol は OpenAI 5.6 シリーズの旗艦グレード(Terra/Luna の上)で、400K コンテキスト。07-30 に 2.5 倍速の Fast モード(2 倍価格)が追加された。それぞれ Claude Code と Codex のデフォルト上位モデルだ。

0.4 ポイントの差が意味するもの

08-08 以降、「Sol 89.5 vs Opus 5 89.1」という Artificial Analysis の数字が大量に引用され、BuildApps の見出しは「差が小さすぎてベンチマークはもはや決定要因ではない」とまで書いた。業界のコンセンサス:上位 2 強の agentic コーディング能力は事実上互角で、決定変数はコンテキスト長・価格・エコシステム・クォータへ移った。なお公式 tbench.ai ボード(agent+モデルの組み合わせ口径)も存在し、数字の体系が異なる点に注意。

タイムライン

2026-07-24

Claude Opus 5 発表。同日に 2 つのベータ(会話途中のツール変更を含む)を公開。

2026-07-30

GPT-5.6 シリーズが価格改定:Luna -80%、Terra -20%。Sol は価格据え置きで Fast モードを追加。

2026-08-08

AA 口径の「Sol 89.5 vs Opus 5 89.1」が拡散し、「ベンチマーク飽和」が話題に。

確認済み vs 注意点

確認済み

両者のコンテキスト、価格、ランキングの点差は、公式ページか検証可能なリーダーボードで裏付けられる。両者とも QCode で実際の呼び出し量がある(30 日使用量 > 0)。

注意点

異なるリーダーボードのスコアを相互比較しないこと。AA(モデル直測、xhigh)と公式 tbench.ai(agent+モデルの組み合わせ)は別の体系だ。Opus 5 と Sol を比べるときは、同じボードに固定しよう。

シーン別の選択

Opus 5 を選ぶ

超長コンテキスト(1M)、Claude Code エコシステム、長距離 agent タスク。出力は 100 万トークン $25 で、Sol より $5 安い。

GPT-5.6 Sol を選ぶ

Codex エコシステム、Fast モード(2.5 倍速)が必要、あるいは OpenAI 系ツールチェーンが既にある場合。出力は 100 万トークン $30。

自分で結論を出す方法

自分のリポジトリから 5〜10 個の実タスクを取り、同じ agent・同じ effort 設定で両方を走らせ、「初回通過率 × トークンコスト」で比較する。ボードで 0.4 ポイント差の 2 モデルが、あなたの負荷では 1 ランク違うこともある——方向は自分で走らせて初めて分かる。

QCode では

claude-opus-5 と gpt-5.6-sol は両方とも販売中(30 日以内に実呼び出しあり)。同じ key・同じエンドポイントで、モデルの切り替えは id を 1 つ変えるだけ——比較テストのコストは 2 ラウンド分のトークン代だけだ。

よくある質問

Opus 5 と GPT-5.6 Sol はどちらが強い?

AA の Terminal-Bench 2.1 では Sol 89.5 対 Opus 5 89.1 で 0.4 ポイント差。ベンチマークレベルでは事実上互角。違いはエコシステム、コンテキスト、価格にある。

価格差はどれくらい?

QCode カタログ価格:Opus 5 は $5/$25、Sol は $5/$30(100 万トークンあたり入力/出力)。入力は同価格、出力は Sol が 20% 高い。

コンテキストはどちらが大きい?

Opus 5:1M トークン。Sol:400K。巨大リポジトリや長いセッションでは Opus が有利。

なぜボードによって Opus 5 が上なのか?

ボードの体系が違うからだ。公式 tbench.ai は「agent+モデル」の組み合わせを測り、vals.ai は統一 harness で再測し、AA はモデル直測。ボードをまたいだ比較に意味はない。

両方とも Claude Code / Codex で使える?

Claude Code はデフォルトで Claude 系、Codex は OpenAI 系を使う。カスタムエンドポイント対応ツール(Cline など)なら自由に組み合わせられる。

QCode で両方呼べる?

両方販売中で、同じ key で切り替えられる。主力を決める前に、実タスクで 1 ラウンドずつ走らせるのがおすすめだ。

情報源

Artificial Analysis(BuildApps 08-08、The Batch 08-21 経由の引用)、公式 tbench.ai ボード(08-22 取得)、Anthropic 公式発表(07-24)、OpenAI 価格改定の告知(07-30)、QCode /models(08-22)。

同じ key で両方走らせよう

Opus 5 と Sol は QCode で同じエンドポイントから販売中。実測はランキングより信頼できる。