Claude Fable 5 на SWE-Bench Pro: откуда взялись 80,3% и можно ли им доверять
Claude Fable 5 набрала 80,3% на SWE-Bench Pro — один из самых высоких опубликованных результатов. Но как именно измерялась эта цифра и почему независимые исследователи сообщают о других результатах? Разбираем обе стороны.
80.3% — результат по официальной методике Anthropic, полученный на её собственном оценочном каркасе. Агрегированные доски (llm-stats / benchlm, снимки 2026-08-18/21) фиксируют Fable 5 на 80.0%, а лидирует Mythos 5 с 80.3% — обе цифры реально существуют, разница в методике. Также учтите: официальная доска Scale на едином фреймворке в целом ниже. Полное сопоставление трёх методик — на странице «Три первых места SWE-bench Pro».
Последняя сверка: 2026-08-22 (рядом обе методики: официальный самоотчёт 80.3 / агрегированная доска 80.0).
Сравнение рейтинга SWE-Bench Pro
Оценки SWE-Bench Pro, опубликованные Anthropic при запуске Fable 5, в сравнении с другими флагманскими моделями того же периода. Все цифры взяты из официальных материалов/материалов оценщиков — обратите внимание на колонку «Оценщик/методология»: эти результаты получены не в рамках одного и того же нейтрального теста.
| Модель | Оценка SWE-Bench Pro | Оценщик / методология | — | Примечание |
|---|---|---|---|---|
| Claude Fable 5 | 80,3% | Собственный оценочный каркас Anthropic | — | Столько же, сколько у Mythos 5 |
| Claude Opus 4.8 | 69,2% | Собственный оценочный каркас Anthropic | — | Флагман предыдущего поколения Claude, приведён как база для сравнения |
| GPT-5.5 | 58,6% | Данные сравнения, опубликованные Anthropic | — | Флагманская модель OpenAI; не проверялась независимо самой OpenAI |
| Gemini 3.1 Pro | 54,2% | Данные сравнения, опубликованные Anthropic | — | Флагманская модель Google; не проверялась независимо самой Google |
Подробнее об этой оценке
Как измерялись эти 80,3%
SWE-Bench Pro — это набор задач на основе реальной разработки ПО: модель должна выполнять исправления, рефакторинги и похожие задачи в кодовых базах, приближенных к реальным сценариям разработки, — ближе к продакшн-сложности, чем ранние версии SWE-Bench. Claude Fable 5 набрала 80.3% в официальных материалах Anthropic (наравне с Mythos 5), тогда как агрегированные доски (llm-stats / benchlm) фиксируют у Fable 5 80.0%, а у Mythos 5 — 80.3%: обе цифры реально существуют, и вопрос не в том, какая из них выдумана, а в том, по какой методике измерена каждая.
Ключевое уточнение: официальная методология оценки, а не нейтральное воспроизведение
Цифра 80,3% была получена с использованием собственного оценочного каркаса Anthropic — то есть это результат официальной методологии, а не независимого воспроизведения нейтральным сторонним фреймворком тестирования. Это различие важно: оценочный каркас определяет, как модель читает задачу, как вызывает инструменты, может ли повторить попытку после ошибки и сколько ей выделено контекстного бюджета — все эти детали реализации существенно влияют на итоговый процент прохождения. А когда сам поставщик тестируемой модели строит и настраивает этот каркас, у него неизбежно есть пространство для того, чтобы условия оказались более выгодными для собственной модели. techjacksolutions.com опубликовал критический материал, прямо указывающий, что независимые исследователи, воспроизведя SWE-Bench Pro по собственной методологии, получили оценки, отличающиеся от официальной цифры Anthropic. Это не значит, что 80,3% — фикция или бессмысленное число; это значит, что перед нами «результат по официальной методологии оценки», а это не то же самое, что «нейтральное воспроизведение», и читателю стоит знать обе стороны, а не только цифру с презентации.
Практическая ценность и ограничения таких оценок
Оценки бенчмарков — полезная точка отсчёта, но не вся картина при выборе модели. SWE-Bench Pro отражает результат на конкретном распределении задач (исправление ошибок в реальных кодовых базах), а ваш собственный сценарий может выглядеть совсем иначе: разработка с нуля, сложное проектирование систем, масштабный рефакторинг при длинном контексте. Оценка не обязательно переносится на такие задачи. Кроме того, несогласованность методологии (официальный каркас vs независимое воспроизведение) означает, что цифры в одном и том же рейтинге не обязательно получены в полностью равных условиях. При реальном выборе модели стоит смотреть не только на оценку бенчмарка, но и на тип ваших задач, требования к длине контекста и разницу в стоимости между моделями — и в идеале протестировать на небольшом наборе собственных реальных задач перед принятием решения.
Как эта страница связана с двумя другими
Эти три материала дополняют друг друга без повторов — каждый раскрывает свой вопрос.
Нужен полный рейтинг?
Полный рейтинг SWE-Bench Pro по всем основным моделям смотрите на странице «Рейтинг SWE-Bench Pro 2026». Эта страница подробно разбирает только Fable 5 и историю её оценки, не повторяя здесь полный рейтинг.
Нужен разбор ограничений методологии в целом?
Общие методологические ограничения бенчмарков вроде SWE-Bench (смещение в выборе задач, зависимость от оценочного каркаса, насколько они репрезентативны для production) подробно разобраны на странице «SWE-Bench и разрыв с реальным production». Эта страница опирается на её выводы, не аргументируя их заново.
Использование Fable 5 на QCode
На QCode уже доступна Claude Fable 5 — по единому ключу. Подробности цен и сравнение с другими моделями смотрите в гиде по ценам, здесь это не раскрывается.
Хронология
Ключевая дата, известная на данный момент.
Запуск Claude Fable 5, публикация оценки 80,3%
Anthropic выпускает Claude Fable 5; официальные материалы по оценке показывают результат 80,3% на SWE-Bench Pro, совпадающий с оценкой Mythos 5, запущенной в тот же день.
Основные источники
Материал the-decoder.com о запуске Claude Fable 5 и опубликованных данных бенчмарков; критический материал techjacksolutions.com о расхождении между официальной оценкой SWE-Bench Pro и независимо воспроизведёнными результатами; разбор оценки SWE-Bench Pro от vellum.ai; официальная страница релиза Anthropic.
Частые вопросы
80,3% Claude Fable 5 на SWE-Bench Pro — это самая высокая оценка?
Зависит от методики: в официальных материалах Anthropic Fable 5 и Mythos 5 делят 80.3%; на агрегированных досках (llm-stats / benchlm, снимок 08-18) Mythos 5 первая с 80.3%, Fable 5 вторая с 80.0%, Opus 5 третья с 79.2%. Цитируя, указывайте методику.
Можно ли доверять этой оценке? Почему вокруг неё спор?
Сама оценка — реально опубликованная цифра, а не выдумка; но 80.3% — это официальная методика на собственном оценочном каркасе Anthropic, а агрегированные доски (llm-stats / benchlm) фиксируют 80.0%. Официальная доска Scale на едином фреймворке SEAL в целом ещё ниже. Суть спора — «кто строил условия теста и какая использовалась разбивка данных», а не существование оценки. Сопоставление трёх методик — «Три первых места SWE-bench Pro».
В чём конкретно разница между официальной методологией и независимым воспроизведением?
Оценочный каркас определяет, как модель читает описание задачи, как вызывает инструменты, может ли повторить попытку после сбоя и сколько ей выделено бюджета по контексту и шагам — все эти детали реализации существенно влияют на итоговый процент прохождения. Когда поставщик тестируемой модели сам строит и настраивает этот каркас, результаты могут отличаться от того, что получил бы нейтральный сторонний оценщик, тестирующий все модели по единому стандарту. Это общая проблема оценок бенчмарков, публикуемых вендорами, а не что-то уникальное для Fable 5.
Насколько эта оценка должна влиять на выбор модели?
Воспринимайте её как одну значимую точку данных, а не единственный критерий. Она отражает примерный уровень возможностей модели на задачах по исправлению ошибок в реальных кодовых базах, что не обязательно совпадает с вашим сценарием (тип задач, длина контекста, бюджет). Рекомендуем свериться с полным «Рейтингом SWE-Bench Pro 2026» для широкого сравнения, а затем проверить модель на небольшом наборе собственных реальных задач.
Создать аккаунт QCode
Планы от ¥60 / $8.57. Один ключ для Claude, GPT и Gemini.
Похожие материалы
Рейтинг SWE-Bench Pro 2026
Полное сравнение моделей
SWE-Bench и разрыв с реальным production
Методологические ограничения этого семейства бенчмарков
Claude Fable 5 против GPT-5.6 Sol
Подробное сравнение двух флагманских моделей
Этот сайт не аффилирован с Anthropic. Оценки SWE-Bench Pro приводятся по официальным материалам релиза и сторонним публикациям; информация на странице актуальна на 2026-08-08 и может измениться. Различия в методологии оценки означают, что цифры из разных источников могут быть не полностью сопоставимы.