Claude Opus 5 vs GPT-5.6 Sol
0.4 ポイントの戦争
Artificial Analysis の Terminal-Bench 2.1 で Sol 89.5 対 Opus 5 89.1——2 大 agent デフォルトモデルの差は 0.4 ポイントまで縮まった。どちらを選ぶかは、ランキングの外で決まる。
要点
TB 2.1 の点差(AA 口径)
Sol 89.5 vs Opus 5 89.1(Artificial Analysis、xhigh 設定)。公式の tbench.ai ボードは口径が異なる。詳しくは後述。
Opus 5 の 100 万トークン価格(入力/出力)
QCode のカタログ価格。Sol は $5/$30——入力は同価格、出力は Sol が 20% 高い。
コンテキストウィンドウ
Opus 5 は 1M トークン、Sol は 400K。超長コンテキストの場面では Opus が有利。
勝者はボードによって変わる
AA ボードでは Sol が 0.4 リード。公式 tbench.ai の首位は Claude Code × Fable 5(83.8)で、この 2 モデルはどちらも首位ではない。
2 モデルの位置づけ
Opus 5(07-24)は Anthropic の現行旗艦で、Claude Code のデフォルト上位モデル。1M コンテキストを持ち、長距離 agent タスクとツール使用に強い。GPT-5.6 Sol は OpenAI 5.6 シリーズの旗艦グレード(Terra/Luna の上)で、400K コンテキスト。07-30 に 2.5 倍速の Fast モード(2 倍価格)が追加された。それぞれ Claude Code と Codex のデフォルト上位モデルだ。
0.4 ポイントの差が意味するもの
08-08 以降、「Sol 89.5 vs Opus 5 89.1」という Artificial Analysis の数字が大量に引用され、BuildApps の見出しは「差が小さすぎてベンチマークはもはや決定要因ではない」とまで書いた。業界のコンセンサス:上位 2 強の agentic コーディング能力は事実上互角で、決定変数はコンテキスト長・価格・エコシステム・クォータへ移った。なお公式 tbench.ai ボード(agent+モデルの組み合わせ口径)も存在し、数字の体系が異なる点に注意。
タイムライン
Claude Opus 5 発表。同日に 2 つのベータ(会話途中のツール変更を含む)を公開。
GPT-5.6 シリーズが価格改定:Luna -80%、Terra -20%。Sol は価格据え置きで Fast モードを追加。
AA 口径の「Sol 89.5 vs Opus 5 89.1」が拡散し、「ベンチマーク飽和」が話題に。
確認済み vs 注意点
確認済み
両者のコンテキスト、価格、ランキングの点差は、公式ページか検証可能なリーダーボードで裏付けられる。両者とも QCode で実際の呼び出し量がある(30 日使用量 > 0)。
注意点
異なるリーダーボードのスコアを相互比較しないこと。AA(モデル直測、xhigh)と公式 tbench.ai(agent+モデルの組み合わせ)は別の体系だ。Opus 5 と Sol を比べるときは、同じボードに固定しよう。
シーン別の選択
Opus 5 を選ぶ
超長コンテキスト(1M)、Claude Code エコシステム、長距離 agent タスク。出力は 100 万トークン $25 で、Sol より $5 安い。
GPT-5.6 Sol を選ぶ
Codex エコシステム、Fast モード(2.5 倍速)が必要、あるいは OpenAI 系ツールチェーンが既にある場合。出力は 100 万トークン $30。
自分で結論を出す方法
自分のリポジトリから 5〜10 個の実タスクを取り、同じ agent・同じ effort 設定で両方を走らせ、「初回通過率 × トークンコスト」で比較する。ボードで 0.4 ポイント差の 2 モデルが、あなたの負荷では 1 ランク違うこともある——方向は自分で走らせて初めて分かる。
QCode では
claude-opus-5 と gpt-5.6-sol は両方とも販売中(30 日以内に実呼び出しあり)。同じ key・同じエンドポイントで、モデルの切り替えは id を 1 つ変えるだけ——比較テストのコストは 2 ラウンド分のトークン代だけだ。
よくある質問
Opus 5 と GPT-5.6 Sol はどちらが強い?
AA の Terminal-Bench 2.1 では Sol 89.5 対 Opus 5 89.1 で 0.4 ポイント差。ベンチマークレベルでは事実上互角。違いはエコシステム、コンテキスト、価格にある。
価格差はどれくらい?
QCode カタログ価格:Opus 5 は $5/$25、Sol は $5/$30(100 万トークンあたり入力/出力)。入力は同価格、出力は Sol が 20% 高い。
コンテキストはどちらが大きい?
Opus 5:1M トークン。Sol:400K。巨大リポジトリや長いセッションでは Opus が有利。
なぜボードによって Opus 5 が上なのか?
ボードの体系が違うからだ。公式 tbench.ai は「agent+モデル」の組み合わせを測り、vals.ai は統一 harness で再測し、AA はモデル直測。ボードをまたいだ比較に意味はない。
両方とも Claude Code / Codex で使える?
Claude Code はデフォルトで Claude 系、Codex は OpenAI 系を使う。カスタムエンドポイント対応ツール(Cline など)なら自由に組み合わせられる。
QCode で両方呼べる?
両方販売中で、同じ key で切り替えられる。主力を決める前に、実タスクで 1 ラウンドずつ走らせるのがおすすめだ。
情報源
Artificial Analysis(BuildApps 08-08、The Batch 08-21 経由の引用)、公式 tbench.ai ボード(08-22 取得)、Anthropic 公式発表(07-24)、OpenAI 価格改定の告知(07-30)、QCode /models(08-22)。
関連記事
Claude Opus 5 ガイド
旗艦の完全な呼び出し説明。
GPT-5.6 Sol 超高速モード
2.5 倍速 Fast モードの詳細。
Terminal-Bench 2.1 の読み解き
0.4 ポイント差はどのボードから来たか。
Anthropic / OpenAI とは無関係です。ランキングの数字は 2026-08 時点のスナップショットです。