SWE-bench Pro 三个第一
谁都没撒谎,也没说全
Anthropic 系统卡写 Fable 5 = 80.3,聚合榜写 Fable 5 = 80.0 / Mythos 5 = 80.3,Scale 官方榜的数字又低一截。差异来自数据切分与 scaffold,不是刷分。
三组都在流传的「第一」
厂商自报 · Fable 5
Anthropic 系统卡口径:自家 harness、自家跑分。Mythos 5 同分。
聚合榜 · Fable 5
llm-stats 等聚合站把 Fable 5 记为 80.0、Mythos 5 记为 80.3——与系统卡差 0.3。
Scale 官方 · GPT-5.4 xHigh
Scale 官方公开集(SEAL 标准化框架)口径,2026-04。数字低一截但口径最严。
公开集 / 私有集任务数
SWE-bench Pro 共 1865 题:公开 731、私有商业 276、留存 858。各家跑的不是同一个集合。
SWE-bench Pro 是什么
Scale AI 2025-09 发布的企业级长程编程基准:1865 个任务来自 41 个专业仓库,公开集全部用 GPL 类强 copyleft 许可以压低训练污染,私有集来自签约创业公司的闭源代码。判定很严:补丁既要让新增 fail-to-pass 测试通过,又不能弄挂任何原有测试。它比 Verified 难一个量级——Verified 上 70%+ 的模型,Pro 初始基线只有约 23%。
为什么数字对不上
三处来源测的根本不是同一种「分」:厂商系统卡用自家 harness 自报;聚合站汇总厂商自报与第三方复测;Scale 官方榜用统一 SEAL 框架重跑且公开/私有集分开列。再叠加 reasoning effort 档位(high/xhigh)与快照日期,同一个模型能合法地拥有三四个不同分数。
时间线
Scale 发布 SWE-bench Pro;初始基线 GPT-5 23.3% / Opus 4.1 23.1%(公开集)。
Fable 5 / Mythos 5 发布,系统卡自报 80.3;聚合站陆续记为 80.0 / 80.3。
聚合榜定型:Mythos 5 80.3、Fable 5 80.0、Opus 5 79.2 领跑;Scale 官方榜口径数字显著更低。
已确认 vs 易误读
已确认
三组数字都真实存在且各有出处;差异可完全由数据切分(公开/私有)、scaffold(自报 harness vs SEAL 统一框架)、effort 档位解释。
易误读
「XX 以 80+ 登顶 SWE-bench Pro」与「SWE-bench Pro 最高才 50 多」可以同时为真——前者是厂商自报/聚合口径,后者是 Scale 官方统一框架口径。引用时务必带口径。
看哪个口径
横向选型
看 Scale 官方榜或 vals.ai 这类统一框架复测:数字低但可比,同一把尺子量所有模型。
追前沿动态
看厂商系统卡与聚合榜:数字新且高,但只适合和同口径的历史数字纵向比。
怎么不被榜单骗
三步:① 问清数据切分——公开集 731 题还是私有集 276 题;② 问清 scaffold——厂商自家 harness 还是 SEAL 统一框架;③ 问清 effort 档与日期。三个答案不齐的数字,不要横向比。
在 QCode 上
榜单前排的模型——Fable 5、Opus 5、GPT-5.6 全系、GLM-5.3、Kimi K3、DeepSeek V4 Pro——QCode 一把 key 都可调。与其纠结口径,不如用自己的仓库跑一次:统一端点,统一 scaffold,数字自己产出。
常见问题
SWE-bench Pro 的第一名到底是谁?
聚合口径:Mythos 5(80.3);厂商自报口径:Fable 5 与 Mythos 5 并列 80.3;Scale 官方统一框架口径的数字整体低一截。三个「第一」各有口径。
为什么官方榜比厂商自报低那么多?
Scale 官方榜用统一 SEAL 框架重跑所有模型,且公开/私有集分开报告;厂商自报用自家优化过的 harness。框架差异在难题上能差出 20 个点。
公开集和私有集有什么区别?
公开集 731 题来自 GPL 类强 copyleft 仓库;私有集 276 题来自签约创业公司的闭源商业代码,污染风险最低,分数普遍更低。另有 858 题留存集不公开。
SWE-bench Pro 和 Verified 什么关系?
Pro 是 2025-09 发布的后继基准:更长程、更贴近企业级任务、抗污染设计。Verified 上 70%+ 的模型在 Pro 初始只有约 23%。
effort 档位会影响分数吗?
会。high 与 xhigh 档在难题上差距明显,厂商自报通常取最高档。比较前确认双方档位一致。
自己做选型复测最稳的方式?
固定一个 scaffold(如官方 SWE-Agent 或 SEAL),用统一 API 端点跑自己仓库的真实 issue,比任何第三方榜都贴近你的负载。
信息来源
Scale 官方 SWE-bench Pro 页(labs.scale.com,2026-08-22 抓取)、Anthropic Fable 5 系统卡(经 vellum 转述)、llm-stats、benchlm 聚合榜(08-21)、techjacksolutions 口径争议报道。
相关阅读
榜单数字为 2026-08-22 快照,各口径出处见文内。与 Scale / Anthropic 无隶属。