SWE-Bench Pro 2026 — AI 编程模型的真实基准
08-18 聚合榜:Mythos 5 80.3、Fable 5 80.0、Opus 5 79.2 领跑,Qwen3.8 Max 67.7 开源反超 GPT-5.6 Sol 64.6。注意口径:这是聚合榜数字,厂商自报与 Scale 官方榜口径不同——差异解读见站内《三个第一》。
SWE-Bench Pro vs Verified — 基准本身
SWE-Bench Verified(2024 年开始流行):人工验证的 GitHub issue 修复任务,~500 道。SWE-Bench Pro(2026 年起主流):在 Verified 基础上加强难度——更长上下文、更多文件改动、更接近真实 PR 工作流。Verified 分数 80% 已饱和(5.2-Codex),Pro 仍有 40 个百分点提升空间,是当前主流基准。Terminal-Bench 2.0 测终端代理任务;OSWorld 测 GUI 操作;GDPval 测专业知识任务。
2026 Q1-Q2 分数演进表
早期演进:GPT-5.2-Codex(2026-01)Verified 80.0% / Pro 56.4%;GPT-5.3-Codex(2026-02)Pro 56.8%(该型号已于 2026-08 下线);GPT-5.5 Pro 58.6%。08-18 聚合榜(llm-stats / benchlm 口径):Mythos 5 80.3、Fable 5 80.0、Opus 5 79.2、Qwen3.8 Max 67.7、GPT-5.6 Sol 64.6、GLM-5.2 62.1。注意:Anthropic 系统卡自报 Fable 5 为 80.3(与 Mythos 并列),聚合榜记 80.0——两个数字并存,差的是评测口径。
主流模型横评 — 分场景选型
按 08-18 聚合榜:Mythos 5(80.3)> Fable 5(80.0)> Opus 5(79.2)领跑,Qwen3.8 Max(67.7)反超 GPT-5.6 Sol(64.6)。场景配模型:1) 长程 agent / 终端任务 → 看 Terminal-Bench 2.1 榜(站内另页);2) Python 深度重构 → Claude 系(Opus 5 / Fable 5);3) 开源权重 + 性价比 → Qwen3.8 Max / GLM-5.2 / DeepSeek V4 Pro;4) OpenAI 生态 → GPT-5.6 Sol。口径混乱问题见《SWE-bench Pro 三个第一》。
通过 QCode 统一接入所有主流模型
QCode.cc 提供统一 API 通路,国内透明接入 Claude(Opus 4.7 / Sonnet)、GPT(5.5 / Codex 系列)、Gemini(3)等主流编码模型。一个套餐共享,按用量计费。在 Claude Code、Codex CLI、Cursor、Cline、Continue 等客户端中切模型只改 base URL 与 model id 即可,配置一次跑全部。
FAQ
SWE-Bench Pro 58.6% 高吗?怎么解读?
Pro 比 Verified 难得多:Verified 已饱和(80%+),Pro 的厂商自报头部成绩约 80、Scale 官方统一框架口径低一截。读任何 Pro 分数先问三件事:哪份榜、什么 scaffold、哪个 effort 档——详见《SWE-bench Pro 三个第一》。
为什么 GPT-5.5 反超专为编码优化的 5.3-Codex?
那是 2026 上半年的口径了。08-18 聚合榜头部已是 Claude 系三款(Mythos 5 / Fable 5 / Opus 5),且 GPT-5.3-Codex 已于 2026-08 下线(迁移到 GPT-5.6 三档)。2026-09-03 之后 OpenAI 线的顶配是 GPT-6 Astra;不过要注意,OpenAI 在模型页与系统卡里都没有给出它的 SWE-bench Verified 分,所以它在这张榜上没有可比的位置,别把别处流传的数字当成官方值。
Opus 4.7 SWE-Bench Pro 分数没公布,怎么选?
Opus 4.7 在这份 2026-08-18 聚合榜上没有厂商自报的 Pro 分,所以别拿分数比它。它那一档后来是 Opus 5;截至 2026-09-29,官方最新的 Opus 是 2026-09-22 发布的 Opus 5.5($4 / $20)。选型看状态页 /claude-opus-5-2-status-tracker,规格与价目见 /claude-opus-5-5-guide。
QCode 一站接入所有主流编码模型
Mythos 5 为受限供应;Fable 5 / Opus 5 / GPT-5.6 全系 / GLM-5.3 / Kimi K3 / DeepSeek V4 Pro 在 QCode 统一通路可调用,按量计费。
开通 QCode