SWE-Bench Pro 上的 Claude Fable 5:80.3% 是怎么来的,靠谱吗
Claude Fable 5 在 SWE-Bench Pro 上取得 80.3%,是当前对外公布的最高分之一——但这个数字是怎么测出来的,为什么有独立评测机构给出不同结果?这里把两边都摆出来。
80.3% 是 Anthropic 用自己的评测脚手架跑出来的官方成绩,不是中立第三方测试框架独立复现的结果。techjacksolutions.com 等独立评测报道指出,第三方复现得到的分数与官方公布的数字有出入。详见下文「关键澄清」一节,不要只看这个数字就下结论。
最近复核:2026-08-08。
SWE-Bench Pro 榜单对比
Fable 5 发布时 Anthropic 公布的 SWE-Bench Pro 分数,与同期其他旗舰模型的对比。所有数字均来自官方/评测方发布材料,注意下方「评测方/口径」一列——这不是同一套中立测试跑出来的结果。
| 模型 | SWE-Bench Pro 分数 | 评测方/口径 | — | 备注 |
|---|---|---|---|---|
| Claude Fable 5 | 80.3% | Anthropic 自有评测框架 | — | 与 Mythos 5 同分 |
| Claude Opus 4.8 | 69.2% | Anthropic 自有评测框架 | — | 上一代 Claude 旗舰模型,作为对照基线 |
| GPT-5.5 | 58.6% | Anthropic 发布的对比数据 | — | OpenAI 旗舰模型,未经 OpenAI 自测复核 |
| Gemini 3.1 Pro | 54.2% | Anthropic 发布的对比数据 | — | Google 旗舰模型,未经 Google 自测复核 |
深入看这个分数
80.3% 是怎么测出来的
SWE-Bench Pro 是一套基于真实世界软件工程任务的评测集,要求模型在接近实际开发场景的代码库里完成修复、重构等任务,比早期版本的 SWE-Bench 更贴近生产环境的复杂度。Claude Fable 5 在这套评测上拿到 80.3% 的分数,与同期发布的 Mythos 5 打平,是 Anthropic 官方发布材料里的头部数字之一。这个分数本身是真实存在的——问题不在于它是不是编造的,而在于它是在什么条件下测出来的。
关键澄清:官方评测口径,非中立复现
80.3% 这个数字,是用 Anthropic 自己的评测脚手架(scaffolding)跑出来的,也就是官方评测口径,不是由中立第三方测试框架独立复现的结果。这个区别很重要:评测脚手架决定了模型怎么读取任务、怎么调用工具、失败了能不能重试、给多少上下文预算,这些实现细节都会实质影响最终分数,而由被测方自己搭建和调优这套脚手架,天然存在对自家模型更友好的空间。techjacksolutions.com 发布过一篇质疑性报道,明确指出独立评测机构用自己的方法复现 SWE-Bench Pro 测试后,得到的分数与 Anthropic 官方公布的数字存在差距。这不代表 80.3% 是假的或者没有意义,而是说这是「官方评测口径下的成绩」,跟「中立复现」是两回事,读者应该同时知道这两边的信息,而不是只看到发布会上的那个数字。
这类分数对选型的参考价值和局限
基准分数是有用的参考点,但不是选型的全部依据。SWE-Bench Pro 反映的是模型在特定任务分布(真实世界代码库里的修复类任务)下的表现,你自己的场景可能是别的任务类型——比如从零搭建、复杂系统设计、长上下文下的大范围重构——分数不一定能直接迁移。另外,评测口径不统一(官方脚手架 vs 独立复现)意味着跨模型横向比较时,同一张榜单上的数字未必是在完全公平的条件下测出来的。实际选型时,除了看基准分数,还要看具体任务类型、需要的上下文长度、以及不同模型之间的成本差异,最好用自己的真实任务小范围试跑再决定。
跟站内其他两篇怎么分工
这三篇内容互补,不重复展开,各自聚焦不同的问题。
全量榜单看这里
如果你想看 SWE-Bench Pro 上所有主流模型的完整排名和横向对比,去看《SWE-Bench Pro 2026 排行榜》——本页只深入解读 Fable 5 这一款模型的分数来源和争议,不重复列出完整榜单。
基准测试方法论的通用局限,看这里
SWE-Bench 这类基准测试本身存在哪些方法论局限(比如任务选取偏差、脚手架依赖、生产环境代表性问题),《SWE-Bench 与生产环境的真实差距》那篇已经系统讨论过,本页直接引用其结论,不在这里重新论证。
在 QCode 上用 Fable 5
QCode 已经上线 Claude Fable 5,一把 key 即可调用。具体定价和其他模型的价格对比,请看定价指南,本页不展开。
时间线
目前公开可查的关键节点。
Claude Fable 5 正式发布,公布 80.3% 分数
Anthropic 发布 Claude Fable 5,官方评测材料显示其在 SWE-Bench Pro 上取得 80.3%,与同期发布的 Mythos 5 同分。
主要来源
the-decoder.com 关于 Claude Fable 5 发布与评测数据的报道;techjacksolutions.com 对 SWE-Bench Pro 官方分数与独立复现结果差异的质疑性报道;vellum.ai 的 SWE-Bench Pro 分项评测拆解;Anthropic 官方发布页面。
常见问题
Claude Fable 5 的 SWE-Bench Pro 80.3% 是最高分吗?
在 Anthropic 官方公布的对比材料里,80.3% 是这几款模型中最高的,与 Mythos 5 并列。但要注意这是 Anthropic 自己的评测口径下的结果,其他机构独立复现未必得到同样的排名,具体见下一条。
这个分数可信吗?为什么会有争议?
分数本身是真实公布的数字,不是编造的,但它是用 Anthropic 自己的评测脚手架跑出来的官方口径成绩,不是中立第三方独立复现的结果。techjacksolutions.com 的质疑性报道指出,独立评测机构复现 SWE-Bench Pro 后得到的分数跟官方公布的数字有出入。争议点在于「测试条件由谁搭建、是否天然对被测模型更友好」,而不是分数是否存在。
官方评测口径和独立复现具体差在哪?
评测脚手架决定了模型怎么读取任务描述、怎么调用工具、失败后能不能重试、给多少上下文和步数预算,这些实现细节都会实质影响最终通过率。由被测模型的厂商自己搭建和调优这套脚手架,跟中立第三方用统一标准跑所有模型比较,结果可能不一样,这是几乎所有厂商自测分数都会遇到的通用问题,不是 Fable 5 独有。
这个分数对我选模型有什么实际参考价值?
可以把它当作一个有意义的信号,但不要当作唯一依据。它反映的是模型在真实代码库修复类任务上的大致能力水位,跟你自己场景(任务类型、上下文长度、成本预算)不一定完全对应。建议结合《SWE-Bench Pro 2026 排行榜》看全量对比,再拿自己的真实任务小范围验证。
相关内容
SWE-Bench Pro 2026 排行榜
全量模型横向对比
SWE-Bench 与生产环境的真实差距
基准测试方法论的局限性
Claude Fable 5 vs GPT-5.6 Sol
两款旗舰模型的深度对比
本站与 Anthropic 无隶属关系。SWE-Bench Pro 分数以官方发布材料与第三方报道为准,本页信息截至 2026-08-08,可能变动。评测口径差异可能导致跨来源分数不完全可比。