SWE-Bench Pro における Claude Fable 5:80.3%はどう測定されたのか、信頼できるのか
Claude Fable 5 は SWE-Bench Pro で80.3%を記録し、公表されている中でも最高水準のスコアの一つです。しかし実際にはどう測定されたのか、なぜ独立評価機関が異なる結果を報告しているのか——両方の側面を紹介します。
80.3%は Anthropic 自社の評価スキャフォールディングで測定された公式スコアであり、中立的な第三者テストフレームワークによる独立再現の結果ではありません。techjacksolutions.com をはじめとする独立評価機関の報道は、再現テストで得られたスコアが公式発表の数字と異なることを指摘しています。詳細は下記「重要な補足」セクションを参照し、この数字だけで結論を出さないでください。
最終確認:2026-08-08。
SWE-Bench Pro ランキング比較
Fable 5 発表時に Anthropic が公表した SWE-Bench Pro のスコアを、同時期の他の主要モデルと比較しています。すべての数字は公式・評価機関発表の資料によるものです——「評価者/基準」の列に注目してください。同一の中立的テストで測定されたものではありません。
| モデル | SWE-Bench Pro スコア | 評価者/基準 | — | 備考 |
|---|---|---|---|---|
| Claude Fable 5 | 80.3% | Anthropic 自社の評価スキャフォールディング | — | Mythos 5 と同点 |
| Claude Opus 4.8 | 69.2% | Anthropic 自社の評価スキャフォールディング | — | 前世代の Claude フラッグシップ、比較基準として掲載 |
| GPT-5.5 | 58.6% | Anthropic が公表した比較データ | — | OpenAI のフラッグシップモデル、OpenAI 自身による検証ではない |
| Gemini 3.1 Pro | 54.2% | Anthropic が公表した比較データ | — | Google のフラッグシップモデル、Google 自身による検証ではない |
このスコアを詳しく見る
80.3%はどう測定されたのか
SWE-Bench Pro は実世界のソフトウェアエンジニアリングタスクをベースにしたベンチマークで、実際の開発現場に近いコードベース内でバグ修正やリファクタリングなどのタスクを完了することが求められ、以前のバージョンの SWE-Bench よりも本番環境の複雑さに近い設計になっています。Claude Fable 5 はこのベンチマークで80.3%を記録し、同時期に発表された Mythos 5 と同点でした——これは Anthropic の公式発表資料の中でも目立つ数字の一つです。スコア自体は実在するもので、捏造ではありません。問題はスコアが存在するかどうかではなく、どのような条件下で測定されたかです。
重要な補足:公式評価基準であり、中立的な再現結果ではない
80.3%という数字は、Anthropic 自社の評価スキャフォールディングを使って測定されたものです。つまりこれは公式評価基準によるスコアであり、中立的な第三者テストフレームワークによる独立再現の結果ではありません。この違いは重要です。評価スキャフォールディングは、モデルがタスクをどう読み取るか、ツールをどう呼び出すか、失敗後に再試行できるか、どれだけのコンテキスト予算が与えられるかを左右し、これらの実装details は最終的な通過率に実質的な影響を与えます。そして、テストされるモデルの提供元自身がこのスキャフォールディングを構築・調整する場合、自社モデルに有利になりやすい構造的な余地があります。techjacksolutions.com は、独立評価機関が独自の手法で SWE-Bench Pro を再現したところ、Anthropic の公式発表の数字とは異なるスコアが得られたことを指摘する批判的な報道を発表しています。これは80.3%が偽物や無意味だという意味ではなく、これが「公式評価基準の下でのスコア」であり「中立的な再現結果」とは別物だということです。読者は発表会で示された数字だけでなく、両方の情報を知っておくべきです。
この種のスコアの参考価値と限界
ベンチマークスコアは有用な参考データですが、モデル選定の全てではありません。SWE-Bench Pro が示すのは特定のタスク分布(実世界のコードベースでのバグ修正系タスク)における性能であり、あなた自身のユースケース——ゼロからの構築、複雑なシステム設計、長いコンテキストでの大規模リファクタリングなど——では必ずしも同じ結果にはなりません。さらに、評価基準の不一致(公式スキャフォールディング vs 独立再現)は、同じランキング上の数字が必ずしも同一の公平な条件下で測定されたわけではないことを意味します。実際にモデルを選ぶ際は、ベンチマークスコアだけでなく、具体的なタスクの種類、必要なコンテキスト長、モデル間のコスト差も考慮し、可能であれば自分の実際のタスクで小規模に試してから判断することをおすすめします。
サイト内の他の2記事との関係
この3本は互いに補完し合う内容で、重複を避けそれぞれ異なる論点に焦点を当てています。
全モデルのランキングを見るには
SWE-Bench Pro における主要モデル全体の完全なランキングと横並び比較は、「SWE-Bench Pro 2026 ランキング」ページをご覧ください。本ページは Fable 5 一機種のスコアの出所と論争を深掘りするもので、全体ランキングはここでは繰り返しません。
ベンチマークの方法論的な限界について
SWE-Bench のようなベンチマークが抱える一般的な方法論上の限界(タスク選定のバイアス、スキャフォールディング依存、本番環境の代表性など)は、「SWE-Bench と本番環境の実態ギャップ」ページで体系的に論じています。本ページはその結論を引用するにとどめ、ここで改めて論証しません。
QCode で Fable 5 を使う
QCode では既に Claude Fable 5 を提供しており、1つのキーで呼び出せます。具体的な料金や他モデルとの価格比較は料金ガイドをご覧ください。本ページでは扱いません。
タイムライン
現時点で確認できる主要な日付。
Claude Fable 5 が正式発表、80.3%のスコアを公表
Anthropic が Claude Fable 5 を発表。公式評価資料によると SWE-Bench Pro で80.3%を記録し、同日発表の Mythos 5 と同点だった。
主な情報源
Claude Fable 5 の発表とベンチマークデータに関する the-decoder.com の報道;SWE-Bench Pro の公式スコアと独立再現結果の乖離を指摘する techjacksolutions.com の批判的な報道;vellum.ai の SWE-Bench Pro スコア詳細分析;Anthropic 公式発表ページ。
よくある質問
Claude Fable 5 の SWE-Bench Pro 80.3%は最高スコアですか?
Anthropic が公表した比較資料の中では、80.3%はこれらのモデルの中で最高で、Mythos 5 と同点です。ただしこれは Anthropic 自社の評価基準による結果であることに注意してください。他機関による独立再現では必ずしも同じ順位になるとは限りません。詳細は次の質問をご覧ください。
このスコアは信頼できますか?なぜ論争があるのですか?
スコア自体は実際に公表された数字であり、捏造ではありません。しかしこれは Anthropic 自社の評価スキャフォールディングで測定されたものであり、公式評価基準による結果であって、中立的な第三者による独立再現の結果ではありません。techjacksolutions.com の批判的な報道は、独立評価機関が SWE-Bench Pro を再現した結果、公式発表の数字とは異なるスコアが得られたことを指摘しています。論争の焦点は「テスト条件を誰が構築したか」「その構造が被験モデルに有利に働きやすいかどうか」であり、スコアの存在自体を疑うものではありません。
公式評価基準と独立再現の具体的な違いは何ですか?
評価スキャフォールディングは、モデルがタスク説明をどう読み取るか、ツールをどう呼び出すか、失敗後に再試行できるか、どれだけのコンテキスト・ステップ予算が与えられるかを決定し、これらの実装上の詳細が最終的な通過率に実質的な影響を与えます。テストされるモデルの提供元が自らこのスキャフォールディングを構築・調整する場合と、中立的な第三者が統一基準で全モデルを比較する場合とでは、結果が異なる可能性があります。これはほぼ全てのベンダー自社発表のベンチマークスコアに共通する一般的な問題であり、Fable 5 に固有のものではありません。
このスコアはモデル選定にどれくらい参考になりますか?
意味のある一つのシグナルとして扱うべきであり、唯一の判断材料にはしないでください。これは実世界のコードベースでのバグ修正系タスクにおけるおおよその能力水準を示すものであり、あなた自身のユースケース(タスクの種類、コンテキスト長、コスト予算)と完全に一致するとは限りません。「SWE-Bench Pro 2026 ランキング」で全体比較を確認した上で、自分の実際のタスクで小規模に検証することをおすすめします。
関連コンテンツ
SWE-Bench Pro 2026 ランキング
全モデルの横並び比較
SWE-Bench と本番環境の実態ギャップ
ベンチマークの方法論的な限界
Claude Fable 5 vs GPT-5.6 Sol
2つのフラッグシップモデルの詳細比較
本サイトは Anthropic と提携関係にありません。SWE-Bench Pro のスコアは公式発表資料と第三者報道に基づきます。本ページの情報は2026-08-08時点のもので、変更される可能性があります。評価基準の違いにより、情報源が異なるスコアは直接比較できない場合があります。