Claude Fable 5 на SWE-Bench Pro: откуда взялись 80,3% и можно ли им доверять
Claude Fable 5 набрала 80,3% на SWE-Bench Pro — один из самых высоких опубликованных результатов. Но как именно измерялась эта цифра и почему независимые исследователи сообщают о других результатах? Разбираем обе стороны.
80,3% — это официальная цифра Anthropic, полученная с помощью собственного оценочного каркаса компании, а не независимо воспроизведённая нейтральным сторонним фреймворком тестирования. Отчёты независимых исследователей, включая techjacksolutions.com, отмечают, что воспроизведённые оценки отличаются от официальной цифры. Прежде чем делать выводы только по заголовочной цифре, см. раздел «Ключевое уточнение» ниже.
Последняя проверка: 2026-08-08.
Сравнение рейтинга SWE-Bench Pro
Оценки SWE-Bench Pro, опубликованные Anthropic при запуске Fable 5, в сравнении с другими флагманскими моделями того же периода. Все цифры взяты из официальных материалов/материалов оценщиков — обратите внимание на колонку «Оценщик/методология»: эти результаты получены не в рамках одного и того же нейтрального теста.
| Модель | Оценка SWE-Bench Pro | Оценщик / методология | — | Примечание |
|---|---|---|---|---|
| Claude Fable 5 | 80,3% | Собственный оценочный каркас Anthropic | — | Столько же, сколько у Mythos 5 |
| Claude Opus 4.8 | 69,2% | Собственный оценочный каркас Anthropic | — | Флагман предыдущего поколения Claude, приведён как база для сравнения |
| GPT-5.5 | 58,6% | Данные сравнения, опубликованные Anthropic | — | Флагманская модель OpenAI; не проверялась независимо самой OpenAI |
| Gemini 3.1 Pro | 54,2% | Данные сравнения, опубликованные Anthropic | — | Флагманская модель Google; не проверялась независимо самой Google |
Подробнее об этой оценке
Как измерялись эти 80,3%
SWE-Bench Pro — это бенчмарк, построенный на задачах из реальной разработки ПО: модели работают внутри кодовых баз, приближенных к реальным production-репозиториям, исправляя ошибки и внося изменения на уровне сложности, более близком к реальной разработке, чем в более ранних версиях SWE-Bench. Claude Fable 5 набрала на этом бенчмарке 80,3%, сравнявшись с Mythos 5, запущенной в тот же день, — это одна из ключевых цифр в официальных материалах релиза Anthropic. Сама оценка реальна, она не выдумана. Вопрос не в том, существует ли эта цифра, а в том, при каких условиях она была получена.
Ключевое уточнение: официальная методология оценки, а не нейтральное воспроизведение
Цифра 80,3% была получена с использованием собственного оценочного каркаса Anthropic — то есть это результат официальной методологии, а не независимого воспроизведения нейтральным сторонним фреймворком тестирования. Это различие важно: оценочный каркас определяет, как модель читает задачу, как вызывает инструменты, может ли повторить попытку после ошибки и сколько ей выделено контекстного бюджета — все эти детали реализации существенно влияют на итоговый процент прохождения. А когда сам поставщик тестируемой модели строит и настраивает этот каркас, у него неизбежно есть пространство для того, чтобы условия оказались более выгодными для собственной модели. techjacksolutions.com опубликовал критический материал, прямо указывающий, что независимые исследователи, воспроизведя SWE-Bench Pro по собственной методологии, получили оценки, отличающиеся от официальной цифры Anthropic. Это не значит, что 80,3% — фикция или бессмысленное число; это значит, что перед нами «результат по официальной методологии оценки», а это не то же самое, что «нейтральное воспроизведение», и читателю стоит знать обе стороны, а не только цифру с презентации.
Практическая ценность и ограничения таких оценок
Оценки бенчмарков — полезная точка отсчёта, но не вся картина при выборе модели. SWE-Bench Pro отражает результат на конкретном распределении задач (исправление ошибок в реальных кодовых базах), а ваш собственный сценарий может выглядеть совсем иначе: разработка с нуля, сложное проектирование систем, масштабный рефакторинг при длинном контексте. Оценка не обязательно переносится на такие задачи. Кроме того, несогласованность методологии (официальный каркас vs независимое воспроизведение) означает, что цифры в одном и том же рейтинге не обязательно получены в полностью равных условиях. При реальном выборе модели стоит смотреть не только на оценку бенчмарка, но и на тип ваших задач, требования к длине контекста и разницу в стоимости между моделями — и в идеале протестировать на небольшом наборе собственных реальных задач перед принятием решения.
Как эта страница связана с двумя другими
Эти три материала дополняют друг друга без повторов — каждый раскрывает свой вопрос.
Нужен полный рейтинг?
Полный рейтинг SWE-Bench Pro по всем основным моделям смотрите на странице «Рейтинг SWE-Bench Pro 2026». Эта страница подробно разбирает только Fable 5 и историю её оценки, не повторяя здесь полный рейтинг.
Нужен разбор ограничений методологии в целом?
Общие методологические ограничения бенчмарков вроде SWE-Bench (смещение в выборе задач, зависимость от оценочного каркаса, насколько они репрезентативны для production) подробно разобраны на странице «SWE-Bench и разрыв с реальным production». Эта страница опирается на её выводы, не аргументируя их заново.
Использование Fable 5 на QCode
На QCode уже доступна Claude Fable 5 — по единому ключу. Подробности цен и сравнение с другими моделями смотрите в гиде по ценам, здесь это не раскрывается.
Хронология
Ключевая дата, известная на данный момент.
Запуск Claude Fable 5, публикация оценки 80,3%
Anthropic выпускает Claude Fable 5; официальные материалы по оценке показывают результат 80,3% на SWE-Bench Pro, совпадающий с оценкой Mythos 5, запущенной в тот же день.
Основные источники
Материал the-decoder.com о запуске Claude Fable 5 и опубликованных данных бенчмарков; критический материал techjacksolutions.com о расхождении между официальной оценкой SWE-Bench Pro и независимо воспроизведёнными результатами; разбор оценки SWE-Bench Pro от vellum.ai; официальная страница релиза Anthropic.
Частые вопросы
80,3% Claude Fable 5 на SWE-Bench Pro — это самая высокая оценка?
Среди моделей в собственном сравнительном материале Anthropic 80,3% — самая высокая оценка, наравне с Mythos 5. Но учтите, что это результат по собственной методологии оценки Anthropic — независимые воспроизведения другими организациями не обязательно дадут тот же порядок. Подробнее — в следующем вопросе.
Можно ли доверять этой оценке? Почему вокруг неё спор?
Сама цифра реальна и официально опубликована, она не выдумана. Но она получена с помощью собственного оценочного каркаса Anthropic — это результат официальной методологии, а не независимого воспроизведения сторонней организацией. Критический материал techjacksolutions.com указывает, что независимые исследователи, воспроизведя SWE-Bench Pro, получили оценки, отличающиеся от официальной цифры. Спор идёт о том, кто строил условия тестирования и насколько эта конструкция изначально благоприятна для тестируемой модели, а не о том, существует ли оценка вообще.
В чём конкретно разница между официальной методологией и независимым воспроизведением?
Оценочный каркас определяет, как модель читает описание задачи, как вызывает инструменты, может ли повторить попытку после сбоя и сколько ей выделено бюджета по контексту и шагам — все эти детали реализации существенно влияют на итоговый процент прохождения. Когда поставщик тестируемой модели сам строит и настраивает этот каркас, результаты могут отличаться от того, что получил бы нейтральный сторонний оценщик, тестирующий все модели по единому стандарту. Это общая проблема оценок бенчмарков, публикуемых вендорами, а не что-то уникальное для Fable 5.
Насколько эта оценка должна влиять на выбор модели?
Воспринимайте её как одну значимую точку данных, а не единственный критерий. Она отражает примерный уровень возможностей модели на задачах по исправлению ошибок в реальных кодовых базах, что не обязательно совпадает с вашим сценарием (тип задач, длина контекста, бюджет). Рекомендуем свериться с полным «Рейтингом SWE-Bench Pro 2026» для широкого сравнения, а затем проверить модель на небольшом наборе собственных реальных задач.
Создать аккаунт QCode
Планы от ¥60 / $8.57. Один ключ для Claude, GPT и Gemini.
Похожие материалы
Рейтинг SWE-Bench Pro 2026
Полное сравнение моделей
SWE-Bench и разрыв с реальным production
Методологические ограничения этого семейства бенчмарков
Claude Fable 5 против GPT-5.6 Sol
Подробное сравнение двух флагманских моделей
Этот сайт не аффилирован с Anthropic. Оценки SWE-Bench Pro приводятся по официальным материалам релиза и сторонним публикациям; информация на странице актуальна на 2026-08-08 и может измениться. Различия в методологии оценки означают, что цифры из разных источников могут быть не полностью сопоставимы.