Разбор рейтингов · 2026-08-22

Три первых места на SWE-bench Pro
Никто не соврал, никто не договорил

Системная карта Anthropic пишет Fable 5 = 80.3; агрегаторы пишут Fable 5 = 80.0 / Mythos 5 = 80.3; официальный борд Scale даёт цифры на ступень ниже. Разница — от разбиений данных и scaffold, а не от накруток.

#swe-bench pro#методики рейтингов#публичный vs приватный срез#scaffold

Три гуляющих «первых места»

80.3

Самоотчёт вендора · Fable 5

По методике системной карты Anthropic: свой harness, свои прогоны. Mythos 5 набирает столько же.

80.0

Агрегаторы · Fable 5

Агрегаторы вроде llm-stats записывают Fable 5 как 80.0, а Mythos 5 как 80.3 — на 0.3 меньше системной карты.

59.1

Scale официальный · GPT-5.4 xHigh

Официальный публичный срез Scale (стандартизированный фреймворк SEAL), 2026-04. Цифры ниже, но методика строже всех.

731 / 276

Задач в публичном / приватном срезе

Всего в SWE-bench Pro 1865 задач: 731 публичная, 276 приватных коммерческих, 858 отложенных. Вендоры гоняют не один и тот же набор.

Что такое SWE-bench Pro

Корпоративный длинный бенчмарк по кодингу, выпущенный Scale AI в 2025-09: 1865 задач из 41 профессионального репозитория. Публичный срез собран исключительно из сильных copyleft-лицензий семейства GPL, чтобы приглушить тренировочное загрязнение; приватный срез — закрытый код стартапов по контракту. Оценка строгая: патч обязан пройти новые fail-to-pass тесты и не сломать ни одного существующего. Он на порядок сложнее Verified — модели с 70%+ на Verified стартовали на Pro примерно с 23%.

Почему цифры не сходятся

Три источника вообще измеряют разный «балл»: системные карты вендоров — самоотчёты на собственных harness; агрегаторы сводят самоотчёты и сторонние перемерки; официальный борд Scale прогоняет всё на едином фреймворке SEAL и отдельно публикует публичный/приватный срезы. Добавьте ступени reasoning effort (high/xhigh) и даты снапшотов — и одна модель законно владеет тремя-четырьмя разными очками.

Таймлайн

2025-09-21

Scale выпускает SWE-bench Pro; стартовые базовые линии: GPT-5 23.3% / Opus 4.1 23.1% (публичный срез).

2026-06-08/09

Выходят Fable 5 / Mythos 5, системные карты заявляют 80.3; агрегаторы постепенно записывают 80.0 / 80.3.

2026-08

Агрегированные борды устаканиваются: лидируют Mythos 5 80.3, Fable 5 80.0, Opus 5 79.2; официальный борд Scale по своей методике заметно ниже.

Подтверждено vs где ошибаются

Подтверждено

Все три набора цифр реально существуют и у каждого есть источник; расхождения полностью объясняются разбиением данных (публичный/приватный), scaffold (самоотчётный harness против единого SEAL) и ступенью effort.

Где ошибаются

«X возглавил SWE-bench Pro с 80+» и «максимум SWE-bench Pro — пятьдесят с лишним» могут быть правдой одновременно: первое — самоотчёт вендора/агрегаторы, второе — единый фреймворк Scale. Цитируя цифру, всегда указывайте методику.

Какую методику читать

Сравнение моделей

Смотрите официальный борд Scale или перемерки на едином фреймворке вроде vals.ai: цифры ниже, но сравнимы — одна линейка на всех.

Слежение за фронтиром

Смотрите системные карты вендоров и агрегированные борды: цифры свежее и выше, но сравнивать их можно только вертикально — с историей в той же методике.

Как не дать рейтингам себя обмануть

Три шага: ① уточните разбиение — 731 публичная задача или 276 приватных; ② уточните scaffold — свой harness вендора или единый фреймворк SEAL; ③ уточните ступень effort и дату. Цифры без всех трёх ответов горизонтально не сравнивайте.

В QCode

Модели с верхних строчек бордов — Fable 5, Opus 5, вся линейка GPT-5.6, GLM-5.3, Kimi K3, DeepSeek V4 Pro — доступны одним ключом QCode. Вместо споров о методиках прогоните собственный репозиторий: один endpoint, один scaffold, цифры производите сами.

Частые вопросы

Так кто первый на SWE-bench Pro?

По агрегаторам: Mythos 5 (80.3); по самоотчётам вендоров: Fable 5 и Mythos 5 делят 80.3; цифры официального единого фреймворка Scale в целом на ступень ниже. У каждого из трёх «первых мест» своя методика.

Почему официальный борд так ниже самоотчётов?

Официальный борд Scale прогоняет все модели на едином фреймворке SEAL и отдельно отчитывается по публичному/приватному срезам; самоотчёты используют собственные затюненные harness. На сложных задачах разница фреймворков может стоить 20 очков.

Чем публичный срез отличается от приватного?

731 публичная задача — из репозиториев с сильными copyleft-лицензиями семейства GPL; 276 приватных — закрытый коммерческий код стартапов по контракту, риск загрязнения минимален, очки обычно ниже. Ещё 858 отложенных задач не публикуются.

Как SWE-bench Pro соотносится с Verified?

Pro — преемник, выпущенный в 2025-09: длиннее по горизонту, ближе к корпоративным задачам, устойчив к загрязнению. Модели с 70%+ на Verified стартовали на Pro примерно с 23%.

Ступень effort влияет на очки?

Да. На сложных задачах high и xhigh заметно различаются, и самоотчёты обычно берут верхнюю ступень. Перед сравнением убедитесь, что ступени у обеих сторон совпадают.

Самый надёжный способ перемерить для выбора?

Зафиксируйте один scaffold (например, официальный SWE-Agent или SEAL), используйте единый API endpoint и гоняйте реальные issue из своих репозиториев — ближе к вашей нагрузке, чем любой сторонний борд.

Источники

Официальная страница SWE-bench Pro Scale (labs.scale.com, выгрузка 2026-08-22), системная карта Anthropic Fable 5 (через vellum), llm-stats, агрегированный борд benchlm (08-21), репортажи techjacksolutions о споре методик.

Вместо веры бордам — собственный прогон

Лидеры рейтингов доступны на одном endpoint QCode — гоняйте свои репозитории под единым scaffold.

Читать дальше

Цифры рейтингов — снапшот на 2026-08-22, источники по каждой методике указаны в тексте. Не аффилированы с Scale / Anthropic.