詳細解説 · 論争のあるベンチマークスコア

SWE-Bench Pro における Claude Fable 5:80.3%はどう測定されたのか、信頼できるのか

Claude Fable 5 は SWE-Bench Pro で80.3%を記録し、公表されている中でも最高水準のスコアの一つです。しかし実際にはどう測定されたのか、なぜ独立評価機関が異なる結果を報告しているのか——両方の側面を紹介します。

#80.3%のスコア#SWE-Bench Pro#評価基準の論争#Claude Fable 5
まず知っておくこと:このスコアには論争があります

80.3% は Anthropic が自社の評価スキャフォールディングで計測した公式口径の成績です。集約ボード(llm-stats / benchlm、2026-08-18/21 スナップショット)は Fable 5 を 80.0% と記録し、Mythos 5 が 80.3% で先行 —— どちらの数字も実在し、違いは口径です。なお Scale 公式の統一フレームワークボードの数字は全体的にさらに低くなっています。3 つの口径の完全な対照は站内「SWE-bench Pro 三つの第一位」を参照。

最終再確認:2026-08-22(2 つの口径を併記:公式自己申告 80.3 / 集約ボード 80.0)。

SWE-Bench Pro ランキング比較

Fable 5 発表時に Anthropic が公表した SWE-Bench Pro のスコアを、同時期の他の主要モデルと比較しています。すべての数字は公式・評価機関発表の資料によるものです——「評価者/基準」の列に注目してください。同一の中立的テストで測定されたものではありません。

モデル SWE-Bench Pro スコア 評価者/基準 備考
Claude Fable 5 80.3% Anthropic 自社の評価スキャフォールディング Mythos 5 と同点
Claude Opus 4.8 69.2% Anthropic 自社の評価スキャフォールディング 前世代の Claude フラッグシップ、比較基準として掲載
GPT-5.5 58.6% Anthropic が公表した比較データ OpenAI のフラッグシップモデル、OpenAI 自身による検証ではない
Gemini 3.1 Pro 54.2% Anthropic が公表した比較データ Google のフラッグシップモデル、Google 自身による検証ではない

このスコアを詳しく見る

80.3%はどう測定されたのか

SWE-Bench Pro は実世界のソフトウェアエンジニアリングタスクに基づく評価スイートで、実際の開発現場に近いコードベース内で修正やリファクタリングなどのタスクの完遂が求められ、旧来の SWE-Bench より本番環境の複雑さに近い設計です。Claude Fable 5 は Anthropic の公式資料で 80.3%(Mythos 5 と同点)を記録した一方、集約ボード(llm-stats / benchlm)では Fable 5 が 80.0%、Mythos 5 が 80.3% と記録されています —— どちらの数字も実在します。問題はどちらかが捏造かではなく、それぞれがどの口径で測定されたかです。

重要な補足:公式評価基準であり、中立的な再現結果ではない

80.3%という数字は、Anthropic 自社の評価スキャフォールディングを使って測定されたものです。つまりこれは公式評価基準によるスコアであり、中立的な第三者テストフレームワークによる独立再現の結果ではありません。この違いは重要です。評価スキャフォールディングは、モデルがタスクをどう読み取るか、ツールをどう呼び出すか、失敗後に再試行できるか、どれだけのコンテキスト予算が与えられるかを左右し、これらの実装details は最終的な通過率に実質的な影響を与えます。そして、テストされるモデルの提供元自身がこのスキャフォールディングを構築・調整する場合、自社モデルに有利になりやすい構造的な余地があります。techjacksolutions.com は、独立評価機関が独自の手法で SWE-Bench Pro を再現したところ、Anthropic の公式発表の数字とは異なるスコアが得られたことを指摘する批判的な報道を発表しています。これは80.3%が偽物や無意味だという意味ではなく、これが「公式評価基準の下でのスコア」であり「中立的な再現結果」とは別物だということです。読者は発表会で示された数字だけでなく、両方の情報を知っておくべきです。

この種のスコアの参考価値と限界

ベンチマークスコアは有用な参考データですが、モデル選定の全てではありません。SWE-Bench Pro が示すのは特定のタスク分布(実世界のコードベースでのバグ修正系タスク)における性能であり、あなた自身のユースケース——ゼロからの構築、複雑なシステム設計、長いコンテキストでの大規模リファクタリングなど——では必ずしも同じ結果にはなりません。さらに、評価基準の不一致(公式スキャフォールディング vs 独立再現)は、同じランキング上の数字が必ずしも同一の公平な条件下で測定されたわけではないことを意味します。実際にモデルを選ぶ際は、ベンチマークスコアだけでなく、具体的なタスクの種類、必要なコンテキスト長、モデル間のコスト差も考慮し、可能であれば自分の実際のタスクで小規模に試してから判断することをおすすめします。

サイト内の他の2記事との関係

この3本は互いに補完し合う内容で、重複を避けそれぞれ異なる論点に焦点を当てています。

全モデルのランキングを見るには

SWE-Bench Pro における主要モデル全体の完全なランキングと横並び比較は、「SWE-Bench Pro 2026 ランキング」ページをご覧ください。本ページは Fable 5 一機種のスコアの出所と論争を深掘りするもので、全体ランキングはここでは繰り返しません。

ベンチマークの方法論的な限界について

SWE-Bench のようなベンチマークが抱える一般的な方法論上の限界(タスク選定のバイアス、スキャフォールディング依存、本番環境の代表性など)は、「SWE-Bench と本番環境の実態ギャップ」ページで体系的に論じています。本ページはその結論を引用するにとどめ、ここで改めて論証しません。

QCode で Fable 5 を使う

QCode では既に Claude Fable 5 を提供しており、1つのキーで呼び出せます。具体的な料金や他モデルとの価格比較は料金ガイドをご覧ください。本ページでは扱いません。

タイムライン

現時点で確認できる主要な日付。

2026-06-09

Claude Fable 5 が正式発表、80.3%のスコアを公表

Anthropic が Claude Fable 5 を発表。公式評価資料によると SWE-Bench Pro で80.3%を記録し、同日発表の Mythos 5 と同点だった。

主な情報源

Claude Fable 5 の発表とベンチマークデータに関する the-decoder.com の報道;SWE-Bench Pro の公式スコアと独立再現結果の乖離を指摘する techjacksolutions.com の批判的な報道;vellum.ai の SWE-Bench Pro スコア詳細分析;Anthropic 公式発表ページ。

よくある質問

Claude Fable 5 の SWE-Bench Pro 80.3%は最高スコアですか?

口径次第です:Anthropic の公式資料では Fable 5 と Mythos 5 が 80.3% で同点。集約ボード(llm-stats / benchlm、08-18 スナップショット)では Mythos 5 が 80.3% で 1 位、Fable 5 が 80.0% で 2 位、Opus 5 が 79.2% で 3 位。引用する際は口径を添えてください。

このスコアは信頼できますか?なぜ論争があるのですか?

スコア自体は実際に公表された数字で、捏造ではありません。ただし 80.3% は Anthropic 自社の評価スキャフォールディングによる公式口径で、集約ボード(llm-stats / benchlm)は 80.0% と記録しています。Scale 公式の統一 SEAL フレームワークによるボードの数字は全体的にさらに低い。論争の本質は「テスト条件を誰が構築し、データ分割がどれか」であって、スコアの存在ではありません。3 つの口径の対照は「SWE-bench Pro 三つの第一位」を参照。

公式評価基準と独立再現の具体的な違いは何ですか?

評価スキャフォールディングは、モデルがタスク説明をどう読み取るか、ツールをどう呼び出すか、失敗後に再試行できるか、どれだけのコンテキスト・ステップ予算が与えられるかを決定し、これらの実装上の詳細が最終的な通過率に実質的な影響を与えます。テストされるモデルの提供元が自らこのスキャフォールディングを構築・調整する場合と、中立的な第三者が統一基準で全モデルを比較する場合とでは、結果が異なる可能性があります。これはほぼ全てのベンダー自社発表のベンチマークスコアに共通する一般的な問題であり、Fable 5 に固有のものではありません。

このスコアはモデル選定にどれくらい参考になりますか?

意味のある一つのシグナルとして扱うべきであり、唯一の判断材料にはしないでください。これは実世界のコードベースでのバグ修正系タスクにおけるおおよその能力水準を示すものであり、あなた自身のユースケース(タスクの種類、コンテキスト長、コスト予算)と完全に一致するとは限りません。「SWE-Bench Pro 2026 ランキング」で全体比較を確認した上で、自分の実際のタスクで小規模に検証することをおすすめします。

QCode アカウントを作成

プランは ¥60 / $8.57 から。Claude・GPT・Gemini などを 1 キーで。

関連コンテンツ

本サイトは Anthropic と提携関係にありません。SWE-Bench Pro のスコアは公式発表資料と第三者報道に基づきます。本ページの情報は2026-08-08時点のもので、変更される可能性があります。評価基準の違いにより、情報源が異なるスコアは直接比較できない場合があります。