SWE-Bench Pro 2026 — AI コーディングモデルのリアルなベンチマーク
08-18 の集約ボード:Mythos 5 80.3、Fable 5 80.0、Opus 5 79.2 が先行し、オープンソースの Qwen3.8 Max 67.7 が GPT-5.6 Sol 64.6 を逆転。口径に注意:これは集約ボードの数字で、ベンダー自己申告と Scale 公式ボードとは口径が異なります。差異の解説はサイト内「三つの第一位」を参照。
SWE-Bench Pro vs Verified — ベンチマーク仕様
SWE-Bench Verified(2024 年から普及):人手検証済み GitHub issue 修復タスク約 500 問。SWE-Bench Pro(2026 年から主流):Verified より難易度向上——長コンテキスト、複数ファイル変更、実 PR ワークフローに近い。Verified は 80% で飽和(5.2-Codex 達成)、Pro はまだ 40 ポイント余地があり主流ベンチマーク。Terminal-Bench 2.0 はターミナルエージェント、OSWorld は GUI、GDPval は専門知識。
2026 Q1-Q2 スコア推移
初期の変遷:GPT-5.2-Codex(2026-01)Verified 80.0% / Pro 56.4%。GPT-5.3-Codex(2026-02)Pro 56.8%(このモデルは 2026-08 に提供終了)。GPT-5.5 Pro 58.6%。08-18 集約ボード(llm-stats / benchlm 口径):Mythos 5 80.3、Fable 5 80.0、Opus 5 79.2、Qwen3.8 Max 67.7、GPT-5.6 Sol 64.6、GLM-5.2 62.1。注意:Anthropic のシステムカードは Fable 5 を 80.3(Mythos と同点)と自己申告し、集約ボードは 80.0 と記録 —— 2 つの数字が併存しており、違いは評価口径です。
シナリオ別モデル選定
08-18 集約ボードでは:Mythos 5(80.3)> Fable 5(80.0)> Opus 5(79.2)が先行し、Qwen3.8 Max(67.7)が GPT-5.6 Sol(64.6)を逆転。シーン別のモデル選定:1) 長距離 agent / ターミナルタスク → Terminal-Bench 2.1 ボード(サイト内の別ページ)を参照。2) Python の深いリファクタ → Claude 系(Opus 5 / Fable 5)。3) オープンウェイト + コスパ → Qwen3.8 Max / GLM-5.2 / DeepSeek V4 Pro。4) OpenAI エコシステム → GPT-5.6 Sol。口径の混乱については「SWE-bench Pro 三つの第一位」を参照。
QCode 経由で全主要モデルへ統合アクセス
QCode.cc は中国国内から主要コーディングモデルへの透明な統一 API ゲートウェイ——Claude(Opus 4.7 / Sonnet)、GPT(5.5 / Codex 系)、Gemini(3)等。1 つの契約で従量課金。Claude Code、Codex CLI、Cursor、Cline、Continue 等で base URL と model id を変えるだけでモデル切替可能。
FAQ
SWE-Bench Pro 58.6% は高い?どう読む?
Pro は Verified よりはるかに難しい:Verified は飽和済み(80%+)で、Pro ではベンダー自己申告のトップが約 80、Scale 公式の統一フレームワーク口径は一段低い。Pro のスコアを読む前にまず 3 つ確認:どのボードか、どの scaffold か、どの effort ティアか —— 詳しくは「SWE-bench Pro 三つの第一位」。
コード特化の 5.3-Codex を汎用 5.5 が Pro で上回るのはなぜ?
それは 2026 年上半期の口径です。08-18 集約ボードの上位はすでに Claude 系 3 モデル(Mythos 5 / Fable 5 / Opus 5)で、GPT-5.3-Codex は 2026-08 に提供終了(GPT-5.6 の 3 ティアへ移行)。2026-09-03 以降、OpenAI ラインの最上位は GPT-6 Astra です。ただし OpenAI はモデルページにもシステムカードにも SWE-bench Verified の値を出していないため、このボード上で比較できる位置はありません。他所で出回る数字を公式値として扱わないでください。
Opus 4.7 の Pro スコアが未公表ですが?
この 2026-08-18 の集約ボードに Opus 4.7 のメーカー自己申告の Pro スコアはありません。点数で比べないでください。対位はそのあと Opus 5 になり、2026-09-29 時点での Anthropic 最新の Opus は 2026-09-22 公開の Opus 5.5($4 / $20)です。選定は追跡ページ /claude-opus-5-2-status-tracker、仕様と価格は /claude-opus-5-5-guide を見てください。
QCode で全主要コーディングモデルへ一括接続
Mythos 5 は限定提供です。Fable 5 / Opus 5 / GPT-5.6 全系 / GLM-5.3 / Kimi K3 / DeepSeek V4 Pro は QCode の統一経路で呼び出せ、従量課金です。
QCode プランを開始