Три первых места на SWE-bench Pro
Никто не соврал, никто не договорил
Системная карта Anthropic пишет Fable 5 = 80.3; агрегаторы пишут Fable 5 = 80.0 / Mythos 5 = 80.3; официальный борд Scale даёт цифры на ступень ниже. Разница — от разбиений данных и scaffold, а не от накруток.
Три гуляющих «первых места»
Самоотчёт вендора · Fable 5
По методике системной карты Anthropic: свой harness, свои прогоны. Mythos 5 набирает столько же.
Агрегаторы · Fable 5
Агрегаторы вроде llm-stats записывают Fable 5 как 80.0, а Mythos 5 как 80.3 — на 0.3 меньше системной карты.
Scale официальный · GPT-5.4 xHigh
Официальный публичный срез Scale (стандартизированный фреймворк SEAL), 2026-04. Цифры ниже, но методика строже всех.
Задач в публичном / приватном срезе
Всего в SWE-bench Pro 1865 задач: 731 публичная, 276 приватных коммерческих, 858 отложенных. Вендоры гоняют не один и тот же набор.
Что такое SWE-bench Pro
Корпоративный длинный бенчмарк по кодингу, выпущенный Scale AI в 2025-09: 1865 задач из 41 профессионального репозитория. Публичный срез собран исключительно из сильных copyleft-лицензий семейства GPL, чтобы приглушить тренировочное загрязнение; приватный срез — закрытый код стартапов по контракту. Оценка строгая: патч обязан пройти новые fail-to-pass тесты и не сломать ни одного существующего. Он на порядок сложнее Verified — модели с 70%+ на Verified стартовали на Pro примерно с 23%.
Почему цифры не сходятся
Три источника вообще измеряют разный «балл»: системные карты вендоров — самоотчёты на собственных harness; агрегаторы сводят самоотчёты и сторонние перемерки; официальный борд Scale прогоняет всё на едином фреймворке SEAL и отдельно публикует публичный/приватный срезы. Добавьте ступени reasoning effort (high/xhigh) и даты снапшотов — и одна модель законно владеет тремя-четырьмя разными очками.
Таймлайн
Scale выпускает SWE-bench Pro; стартовые базовые линии: GPT-5 23.3% / Opus 4.1 23.1% (публичный срез).
Выходят Fable 5 / Mythos 5, системные карты заявляют 80.3; агрегаторы постепенно записывают 80.0 / 80.3.
Агрегированные борды устаканиваются: лидируют Mythos 5 80.3, Fable 5 80.0, Opus 5 79.2; официальный борд Scale по своей методике заметно ниже.
Подтверждено vs где ошибаются
Подтверждено
Все три набора цифр реально существуют и у каждого есть источник; расхождения полностью объясняются разбиением данных (публичный/приватный), scaffold (самоотчётный harness против единого SEAL) и ступенью effort.
Где ошибаются
«X возглавил SWE-bench Pro с 80+» и «максимум SWE-bench Pro — пятьдесят с лишним» могут быть правдой одновременно: первое — самоотчёт вендора/агрегаторы, второе — единый фреймворк Scale. Цитируя цифру, всегда указывайте методику.
Какую методику читать
Сравнение моделей
Смотрите официальный борд Scale или перемерки на едином фреймворке вроде vals.ai: цифры ниже, но сравнимы — одна линейка на всех.
Слежение за фронтиром
Смотрите системные карты вендоров и агрегированные борды: цифры свежее и выше, но сравнивать их можно только вертикально — с историей в той же методике.
Как не дать рейтингам себя обмануть
Три шага: ① уточните разбиение — 731 публичная задача или 276 приватных; ② уточните scaffold — свой harness вендора или единый фреймворк SEAL; ③ уточните ступень effort и дату. Цифры без всех трёх ответов горизонтально не сравнивайте.
В QCode
Модели с верхних строчек бордов — Fable 5, Opus 5, вся линейка GPT-5.6, GLM-5.3, Kimi K3, DeepSeek V4 Pro — доступны одним ключом QCode. Вместо споров о методиках прогоните собственный репозиторий: один endpoint, один scaffold, цифры производите сами.
Частые вопросы
Так кто первый на SWE-bench Pro?
По агрегаторам: Mythos 5 (80.3); по самоотчётам вендоров: Fable 5 и Mythos 5 делят 80.3; цифры официального единого фреймворка Scale в целом на ступень ниже. У каждого из трёх «первых мест» своя методика.
Почему официальный борд так ниже самоотчётов?
Официальный борд Scale прогоняет все модели на едином фреймворке SEAL и отдельно отчитывается по публичному/приватному срезам; самоотчёты используют собственные затюненные harness. На сложных задачах разница фреймворков может стоить 20 очков.
Чем публичный срез отличается от приватного?
731 публичная задача — из репозиториев с сильными copyleft-лицензиями семейства GPL; 276 приватных — закрытый коммерческий код стартапов по контракту, риск загрязнения минимален, очки обычно ниже. Ещё 858 отложенных задач не публикуются.
Как SWE-bench Pro соотносится с Verified?
Pro — преемник, выпущенный в 2025-09: длиннее по горизонту, ближе к корпоративным задачам, устойчив к загрязнению. Модели с 70%+ на Verified стартовали на Pro примерно с 23%.
Ступень effort влияет на очки?
Да. На сложных задачах high и xhigh заметно различаются, и самоотчёты обычно берут верхнюю ступень. Перед сравнением убедитесь, что ступени у обеих сторон совпадают.
Самый надёжный способ перемерить для выбора?
Зафиксируйте один scaffold (например, официальный SWE-Agent или SEAL), используйте единый API endpoint и гоняйте реальные issue из своих репозиториев — ближе к вашей нагрузке, чем любой сторонний борд.
Источники
Официальная страница SWE-bench Pro Scale (labs.scale.com, выгрузка 2026-08-22), системная карта Anthropic Fable 5 (через vellum), llm-stats, агрегированный борд benchlm (08-21), репортажи techjacksolutions о споре методик.
Вместо веры бордам — собственный прогон
Лидеры рейтингов доступны на одном endpoint QCode — гоняйте свои репозитории под единым scaffold.
Читать дальше
Рейтинг SWE-bench Pro 2026
Свежий снапшот позиций.
Разбор Terminal-Bench 2.1
Ещё один бенчмарк с тремя рейтингами.
SWE-bench и реальная работа
Разрыв между очками в рейтингах и настоящей инженерией.
Цифры рейтингов — снапшот на 2026-08-22, источники по каждой методике указаны в тексте. Не аффилированы с Scale / Anthropic.