Подробный разбор · Спорная оценка бенчмарка

Claude Fable 5 на SWE-Bench Pro: откуда взялись 80,3% и можно ли им доверять

Claude Fable 5 набрала 80,3% на SWE-Bench Pro — один из самых высоких опубликованных результатов. Но как именно измерялась эта цифра и почему независимые исследователи сообщают о других результатах? Разбираем обе стороны.

#Оценка 80,3%#SWE-Bench Pro#Спор о методологии#Claude Fable 5
Сначала прочитайте это: оценка спорная

80,3% — это официальная цифра Anthropic, полученная с помощью собственного оценочного каркаса компании, а не независимо воспроизведённая нейтральным сторонним фреймворком тестирования. Отчёты независимых исследователей, включая techjacksolutions.com, отмечают, что воспроизведённые оценки отличаются от официальной цифры. Прежде чем делать выводы только по заголовочной цифре, см. раздел «Ключевое уточнение» ниже.

Последняя проверка: 2026-08-08.

Сравнение рейтинга SWE-Bench Pro

Оценки SWE-Bench Pro, опубликованные Anthropic при запуске Fable 5, в сравнении с другими флагманскими моделями того же периода. Все цифры взяты из официальных материалов/материалов оценщиков — обратите внимание на колонку «Оценщик/методология»: эти результаты получены не в рамках одного и того же нейтрального теста.

Модель Оценка SWE-Bench Pro Оценщик / методология Примечание
Claude Fable 5 80,3% Собственный оценочный каркас Anthropic Столько же, сколько у Mythos 5
Claude Opus 4.8 69,2% Собственный оценочный каркас Anthropic Флагман предыдущего поколения Claude, приведён как база для сравнения
GPT-5.5 58,6% Данные сравнения, опубликованные Anthropic Флагманская модель OpenAI; не проверялась независимо самой OpenAI
Gemini 3.1 Pro 54,2% Данные сравнения, опубликованные Anthropic Флагманская модель Google; не проверялась независимо самой Google

Подробнее об этой оценке

Как измерялись эти 80,3%

SWE-Bench Pro — это бенчмарк, построенный на задачах из реальной разработки ПО: модели работают внутри кодовых баз, приближенных к реальным production-репозиториям, исправляя ошибки и внося изменения на уровне сложности, более близком к реальной разработке, чем в более ранних версиях SWE-Bench. Claude Fable 5 набрала на этом бенчмарке 80,3%, сравнявшись с Mythos 5, запущенной в тот же день, — это одна из ключевых цифр в официальных материалах релиза Anthropic. Сама оценка реальна, она не выдумана. Вопрос не в том, существует ли эта цифра, а в том, при каких условиях она была получена.

Ключевое уточнение: официальная методология оценки, а не нейтральное воспроизведение

Цифра 80,3% была получена с использованием собственного оценочного каркаса Anthropic — то есть это результат официальной методологии, а не независимого воспроизведения нейтральным сторонним фреймворком тестирования. Это различие важно: оценочный каркас определяет, как модель читает задачу, как вызывает инструменты, может ли повторить попытку после ошибки и сколько ей выделено контекстного бюджета — все эти детали реализации существенно влияют на итоговый процент прохождения. А когда сам поставщик тестируемой модели строит и настраивает этот каркас, у него неизбежно есть пространство для того, чтобы условия оказались более выгодными для собственной модели. techjacksolutions.com опубликовал критический материал, прямо указывающий, что независимые исследователи, воспроизведя SWE-Bench Pro по собственной методологии, получили оценки, отличающиеся от официальной цифры Anthropic. Это не значит, что 80,3% — фикция или бессмысленное число; это значит, что перед нами «результат по официальной методологии оценки», а это не то же самое, что «нейтральное воспроизведение», и читателю стоит знать обе стороны, а не только цифру с презентации.

Практическая ценность и ограничения таких оценок

Оценки бенчмарков — полезная точка отсчёта, но не вся картина при выборе модели. SWE-Bench Pro отражает результат на конкретном распределении задач (исправление ошибок в реальных кодовых базах), а ваш собственный сценарий может выглядеть совсем иначе: разработка с нуля, сложное проектирование систем, масштабный рефакторинг при длинном контексте. Оценка не обязательно переносится на такие задачи. Кроме того, несогласованность методологии (официальный каркас vs независимое воспроизведение) означает, что цифры в одном и том же рейтинге не обязательно получены в полностью равных условиях. При реальном выборе модели стоит смотреть не только на оценку бенчмарка, но и на тип ваших задач, требования к длине контекста и разницу в стоимости между моделями — и в идеале протестировать на небольшом наборе собственных реальных задач перед принятием решения.

Как эта страница связана с двумя другими

Эти три материала дополняют друг друга без повторов — каждый раскрывает свой вопрос.

Нужен полный рейтинг?

Полный рейтинг SWE-Bench Pro по всем основным моделям смотрите на странице «Рейтинг SWE-Bench Pro 2026». Эта страница подробно разбирает только Fable 5 и историю её оценки, не повторяя здесь полный рейтинг.

Нужен разбор ограничений методологии в целом?

Общие методологические ограничения бенчмарков вроде SWE-Bench (смещение в выборе задач, зависимость от оценочного каркаса, насколько они репрезентативны для production) подробно разобраны на странице «SWE-Bench и разрыв с реальным production». Эта страница опирается на её выводы, не аргументируя их заново.

Использование Fable 5 на QCode

На QCode уже доступна Claude Fable 5 — по единому ключу. Подробности цен и сравнение с другими моделями смотрите в гиде по ценам, здесь это не раскрывается.

Хронология

Ключевая дата, известная на данный момент.

2026-06-09

Запуск Claude Fable 5, публикация оценки 80,3%

Anthropic выпускает Claude Fable 5; официальные материалы по оценке показывают результат 80,3% на SWE-Bench Pro, совпадающий с оценкой Mythos 5, запущенной в тот же день.

Основные источники

Материал the-decoder.com о запуске Claude Fable 5 и опубликованных данных бенчмарков; критический материал techjacksolutions.com о расхождении между официальной оценкой SWE-Bench Pro и независимо воспроизведёнными результатами; разбор оценки SWE-Bench Pro от vellum.ai; официальная страница релиза Anthropic.

Частые вопросы

80,3% Claude Fable 5 на SWE-Bench Pro — это самая высокая оценка?

Среди моделей в собственном сравнительном материале Anthropic 80,3% — самая высокая оценка, наравне с Mythos 5. Но учтите, что это результат по собственной методологии оценки Anthropic — независимые воспроизведения другими организациями не обязательно дадут тот же порядок. Подробнее — в следующем вопросе.

Можно ли доверять этой оценке? Почему вокруг неё спор?

Сама цифра реальна и официально опубликована, она не выдумана. Но она получена с помощью собственного оценочного каркаса Anthropic — это результат официальной методологии, а не независимого воспроизведения сторонней организацией. Критический материал techjacksolutions.com указывает, что независимые исследователи, воспроизведя SWE-Bench Pro, получили оценки, отличающиеся от официальной цифры. Спор идёт о том, кто строил условия тестирования и насколько эта конструкция изначально благоприятна для тестируемой модели, а не о том, существует ли оценка вообще.

В чём конкретно разница между официальной методологией и независимым воспроизведением?

Оценочный каркас определяет, как модель читает описание задачи, как вызывает инструменты, может ли повторить попытку после сбоя и сколько ей выделено бюджета по контексту и шагам — все эти детали реализации существенно влияют на итоговый процент прохождения. Когда поставщик тестируемой модели сам строит и настраивает этот каркас, результаты могут отличаться от того, что получил бы нейтральный сторонний оценщик, тестирующий все модели по единому стандарту. Это общая проблема оценок бенчмарков, публикуемых вендорами, а не что-то уникальное для Fable 5.

Насколько эта оценка должна влиять на выбор модели?

Воспринимайте её как одну значимую точку данных, а не единственный критерий. Она отражает примерный уровень возможностей модели на задачах по исправлению ошибок в реальных кодовых базах, что не обязательно совпадает с вашим сценарием (тип задач, длина контекста, бюджет). Рекомендуем свериться с полным «Рейтингом SWE-Bench Pro 2026» для широкого сравнения, а затем проверить модель на небольшом наборе собственных реальных задач.

Создать аккаунт QCode

Планы от ¥60 / $8.57. Один ключ для Claude, GPT и Gemini.

Похожие материалы

Этот сайт не аффилирован с Anthropic. Оценки SWE-Bench Pro приводятся по официальным материалам релиза и сторонним публикациям; информация на странице актуальна на 2026-08-08 и может измениться. Различия в методологии оценки означают, что цифры из разных источников могут быть не полностью сопоставимы.