深度解读 · 争议评测数据

SWE-Bench Pro 上的 Claude Fable 5:80.3% 是怎么来的,靠谱吗

Claude Fable 5 在 SWE-Bench Pro 上取得 80.3%,是当前对外公布的最高分之一——但这个数字是怎么测出来的,为什么有独立评测机构给出不同结果?这里把两边都摆出来。

#80.3% 分数#SWE-Bench Pro#评测口径争议#Claude Fable 5
先看清楚:这个分数存在争议

80.3% 是 Anthropic 用自己的评测脚手架跑出来的官方成绩,不是中立第三方测试框架独立复现的结果。techjacksolutions.com 等独立评测报道指出,第三方复现得到的分数与官方公布的数字有出入。详见下文「关键澄清」一节,不要只看这个数字就下结论。

最近复核:2026-08-08。

SWE-Bench Pro 榜单对比

Fable 5 发布时 Anthropic 公布的 SWE-Bench Pro 分数,与同期其他旗舰模型的对比。所有数字均来自官方/评测方发布材料,注意下方「评测方/口径」一列——这不是同一套中立测试跑出来的结果。

模型 SWE-Bench Pro 分数 评测方/口径 备注
Claude Fable 5 80.3% Anthropic 自有评测框架 与 Mythos 5 同分
Claude Opus 4.8 69.2% Anthropic 自有评测框架 上一代 Claude 旗舰模型,作为对照基线
GPT-5.5 58.6% Anthropic 发布的对比数据 OpenAI 旗舰模型,未经 OpenAI 自测复核
Gemini 3.1 Pro 54.2% Anthropic 发布的对比数据 Google 旗舰模型,未经 Google 自测复核

深入看这个分数

80.3% 是怎么测出来的

SWE-Bench Pro 是一套基于真实世界软件工程任务的评测集,要求模型在接近实际开发场景的代码库里完成修复、重构等任务,比早期版本的 SWE-Bench 更贴近生产环境的复杂度。Claude Fable 5 在这套评测上拿到 80.3% 的分数,与同期发布的 Mythos 5 打平,是 Anthropic 官方发布材料里的头部数字之一。这个分数本身是真实存在的——问题不在于它是不是编造的,而在于它是在什么条件下测出来的。

关键澄清:官方评测口径,非中立复现

80.3% 这个数字,是用 Anthropic 自己的评测脚手架(scaffolding)跑出来的,也就是官方评测口径,不是由中立第三方测试框架独立复现的结果。这个区别很重要:评测脚手架决定了模型怎么读取任务、怎么调用工具、失败了能不能重试、给多少上下文预算,这些实现细节都会实质影响最终分数,而由被测方自己搭建和调优这套脚手架,天然存在对自家模型更友好的空间。techjacksolutions.com 发布过一篇质疑性报道,明确指出独立评测机构用自己的方法复现 SWE-Bench Pro 测试后,得到的分数与 Anthropic 官方公布的数字存在差距。这不代表 80.3% 是假的或者没有意义,而是说这是「官方评测口径下的成绩」,跟「中立复现」是两回事,读者应该同时知道这两边的信息,而不是只看到发布会上的那个数字。

这类分数对选型的参考价值和局限

基准分数是有用的参考点,但不是选型的全部依据。SWE-Bench Pro 反映的是模型在特定任务分布(真实世界代码库里的修复类任务)下的表现,你自己的场景可能是别的任务类型——比如从零搭建、复杂系统设计、长上下文下的大范围重构——分数不一定能直接迁移。另外,评测口径不统一(官方脚手架 vs 独立复现)意味着跨模型横向比较时,同一张榜单上的数字未必是在完全公平的条件下测出来的。实际选型时,除了看基准分数,还要看具体任务类型、需要的上下文长度、以及不同模型之间的成本差异,最好用自己的真实任务小范围试跑再决定。

跟站内其他两篇怎么分工

这三篇内容互补,不重复展开,各自聚焦不同的问题。

全量榜单看这里

如果你想看 SWE-Bench Pro 上所有主流模型的完整排名和横向对比,去看《SWE-Bench Pro 2026 排行榜》——本页只深入解读 Fable 5 这一款模型的分数来源和争议,不重复列出完整榜单。

基准测试方法论的通用局限,看这里

SWE-Bench 这类基准测试本身存在哪些方法论局限(比如任务选取偏差、脚手架依赖、生产环境代表性问题),《SWE-Bench 与生产环境的真实差距》那篇已经系统讨论过,本页直接引用其结论,不在这里重新论证。

在 QCode 上用 Fable 5

QCode 已经上线 Claude Fable 5,一把 key 即可调用。具体定价和其他模型的价格对比,请看定价指南,本页不展开。

时间线

目前公开可查的关键节点。

2026-06-09

Claude Fable 5 正式发布,公布 80.3% 分数

Anthropic 发布 Claude Fable 5,官方评测材料显示其在 SWE-Bench Pro 上取得 80.3%,与同期发布的 Mythos 5 同分。

主要来源

the-decoder.com 关于 Claude Fable 5 发布与评测数据的报道;techjacksolutions.com 对 SWE-Bench Pro 官方分数与独立复现结果差异的质疑性报道;vellum.ai 的 SWE-Bench Pro 分项评测拆解;Anthropic 官方发布页面。

常见问题

Claude Fable 5 的 SWE-Bench Pro 80.3% 是最高分吗?

在 Anthropic 官方公布的对比材料里,80.3% 是这几款模型中最高的,与 Mythos 5 并列。但要注意这是 Anthropic 自己的评测口径下的结果,其他机构独立复现未必得到同样的排名,具体见下一条。

这个分数可信吗?为什么会有争议?

分数本身是真实公布的数字,不是编造的,但它是用 Anthropic 自己的评测脚手架跑出来的官方口径成绩,不是中立第三方独立复现的结果。techjacksolutions.com 的质疑性报道指出,独立评测机构复现 SWE-Bench Pro 后得到的分数跟官方公布的数字有出入。争议点在于「测试条件由谁搭建、是否天然对被测模型更友好」,而不是分数是否存在。

官方评测口径和独立复现具体差在哪?

评测脚手架决定了模型怎么读取任务描述、怎么调用工具、失败后能不能重试、给多少上下文和步数预算,这些实现细节都会实质影响最终通过率。由被测模型的厂商自己搭建和调优这套脚手架,跟中立第三方用统一标准跑所有模型比较,结果可能不一样,这是几乎所有厂商自测分数都会遇到的通用问题,不是 Fable 5 独有。

这个分数对我选模型有什么实际参考价值?

可以把它当作一个有意义的信号,但不要当作唯一依据。它反映的是模型在真实代码库修复类任务上的大致能力水位,跟你自己场景(任务类型、上下文长度、成本预算)不一定完全对应。建议结合《SWE-Bench Pro 2026 排行榜》看全量对比,再拿自己的真实任务小范围验证。

创建 QCode 账号

套餐自 ¥60 / $8.57 起。一把 key 覆盖 Claude、GPT 与 Gemini 等模型。

相关内容

本站与 Anthropic 无隶属关系。SWE-Bench Pro 分数以官方发布材料与第三方报道为准,本页信息截至 2026-08-08,可能变动。评测口径差异可能导致跨来源分数不完全可比。