Подробный разбор · Спорная оценка бенчмарка

Claude Fable 5 на SWE-Bench Pro: откуда взялись 80,3% и можно ли им доверять

Claude Fable 5 набрала 80,3% на SWE-Bench Pro — один из самых высоких опубликованных результатов. Но как именно измерялась эта цифра и почему независимые исследователи сообщают о других результатах? Разбираем обе стороны.

#Оценка 80,3%#SWE-Bench Pro#Спор о методологии#Claude Fable 5
Сначала прочитайте это: оценка спорная

80.3% — результат по официальной методике Anthropic, полученный на её собственном оценочном каркасе. Агрегированные доски (llm-stats / benchlm, снимки 2026-08-18/21) фиксируют Fable 5 на 80.0%, а лидирует Mythos 5 с 80.3% — обе цифры реально существуют, разница в методике. Также учтите: официальная доска Scale на едином фреймворке в целом ниже. Полное сопоставление трёх методик — на странице «Три первых места SWE-bench Pro».

Последняя сверка: 2026-08-22 (рядом обе методики: официальный самоотчёт 80.3 / агрегированная доска 80.0).

Сравнение рейтинга SWE-Bench Pro

Оценки SWE-Bench Pro, опубликованные Anthropic при запуске Fable 5, в сравнении с другими флагманскими моделями того же периода. Все цифры взяты из официальных материалов/материалов оценщиков — обратите внимание на колонку «Оценщик/методология»: эти результаты получены не в рамках одного и того же нейтрального теста.

Модель Оценка SWE-Bench Pro Оценщик / методология Примечание
Claude Fable 5 80,3% Собственный оценочный каркас Anthropic Столько же, сколько у Mythos 5
Claude Opus 4.8 69,2% Собственный оценочный каркас Anthropic Флагман предыдущего поколения Claude, приведён как база для сравнения
GPT-5.5 58,6% Данные сравнения, опубликованные Anthropic Флагманская модель OpenAI; не проверялась независимо самой OpenAI
Gemini 3.1 Pro 54,2% Данные сравнения, опубликованные Anthropic Флагманская модель Google; не проверялась независимо самой Google

Подробнее об этой оценке

Как измерялись эти 80,3%

SWE-Bench Pro — это набор задач на основе реальной разработки ПО: модель должна выполнять исправления, рефакторинги и похожие задачи в кодовых базах, приближенных к реальным сценариям разработки, — ближе к продакшн-сложности, чем ранние версии SWE-Bench. Claude Fable 5 набрала 80.3% в официальных материалах Anthropic (наравне с Mythos 5), тогда как агрегированные доски (llm-stats / benchlm) фиксируют у Fable 5 80.0%, а у Mythos 5 — 80.3%: обе цифры реально существуют, и вопрос не в том, какая из них выдумана, а в том, по какой методике измерена каждая.

Ключевое уточнение: официальная методология оценки, а не нейтральное воспроизведение

Цифра 80,3% была получена с использованием собственного оценочного каркаса Anthropic — то есть это результат официальной методологии, а не независимого воспроизведения нейтральным сторонним фреймворком тестирования. Это различие важно: оценочный каркас определяет, как модель читает задачу, как вызывает инструменты, может ли повторить попытку после ошибки и сколько ей выделено контекстного бюджета — все эти детали реализации существенно влияют на итоговый процент прохождения. А когда сам поставщик тестируемой модели строит и настраивает этот каркас, у него неизбежно есть пространство для того, чтобы условия оказались более выгодными для собственной модели. techjacksolutions.com опубликовал критический материал, прямо указывающий, что независимые исследователи, воспроизведя SWE-Bench Pro по собственной методологии, получили оценки, отличающиеся от официальной цифры Anthropic. Это не значит, что 80,3% — фикция или бессмысленное число; это значит, что перед нами «результат по официальной методологии оценки», а это не то же самое, что «нейтральное воспроизведение», и читателю стоит знать обе стороны, а не только цифру с презентации.

Практическая ценность и ограничения таких оценок

Оценки бенчмарков — полезная точка отсчёта, но не вся картина при выборе модели. SWE-Bench Pro отражает результат на конкретном распределении задач (исправление ошибок в реальных кодовых базах), а ваш собственный сценарий может выглядеть совсем иначе: разработка с нуля, сложное проектирование систем, масштабный рефакторинг при длинном контексте. Оценка не обязательно переносится на такие задачи. Кроме того, несогласованность методологии (официальный каркас vs независимое воспроизведение) означает, что цифры в одном и том же рейтинге не обязательно получены в полностью равных условиях. При реальном выборе модели стоит смотреть не только на оценку бенчмарка, но и на тип ваших задач, требования к длине контекста и разницу в стоимости между моделями — и в идеале протестировать на небольшом наборе собственных реальных задач перед принятием решения.

Как эта страница связана с двумя другими

Эти три материала дополняют друг друга без повторов — каждый раскрывает свой вопрос.

Нужен полный рейтинг?

Полный рейтинг SWE-Bench Pro по всем основным моделям смотрите на странице «Рейтинг SWE-Bench Pro 2026». Эта страница подробно разбирает только Fable 5 и историю её оценки, не повторяя здесь полный рейтинг.

Нужен разбор ограничений методологии в целом?

Общие методологические ограничения бенчмарков вроде SWE-Bench (смещение в выборе задач, зависимость от оценочного каркаса, насколько они репрезентативны для production) подробно разобраны на странице «SWE-Bench и разрыв с реальным production». Эта страница опирается на её выводы, не аргументируя их заново.

Использование Fable 5 на QCode

На QCode уже доступна Claude Fable 5 — по единому ключу. Подробности цен и сравнение с другими моделями смотрите в гиде по ценам, здесь это не раскрывается.

Хронология

Ключевая дата, известная на данный момент.

2026-06-09

Запуск Claude Fable 5, публикация оценки 80,3%

Anthropic выпускает Claude Fable 5; официальные материалы по оценке показывают результат 80,3% на SWE-Bench Pro, совпадающий с оценкой Mythos 5, запущенной в тот же день.

Основные источники

Материал the-decoder.com о запуске Claude Fable 5 и опубликованных данных бенчмарков; критический материал techjacksolutions.com о расхождении между официальной оценкой SWE-Bench Pro и независимо воспроизведёнными результатами; разбор оценки SWE-Bench Pro от vellum.ai; официальная страница релиза Anthropic.

Частые вопросы

80,3% Claude Fable 5 на SWE-Bench Pro — это самая высокая оценка?

Зависит от методики: в официальных материалах Anthropic Fable 5 и Mythos 5 делят 80.3%; на агрегированных досках (llm-stats / benchlm, снимок 08-18) Mythos 5 первая с 80.3%, Fable 5 вторая с 80.0%, Opus 5 третья с 79.2%. Цитируя, указывайте методику.

Можно ли доверять этой оценке? Почему вокруг неё спор?

Сама оценка — реально опубликованная цифра, а не выдумка; но 80.3% — это официальная методика на собственном оценочном каркасе Anthropic, а агрегированные доски (llm-stats / benchlm) фиксируют 80.0%. Официальная доска Scale на едином фреймворке SEAL в целом ещё ниже. Суть спора — «кто строил условия теста и какая использовалась разбивка данных», а не существование оценки. Сопоставление трёх методик — «Три первых места SWE-bench Pro».

В чём конкретно разница между официальной методологией и независимым воспроизведением?

Оценочный каркас определяет, как модель читает описание задачи, как вызывает инструменты, может ли повторить попытку после сбоя и сколько ей выделено бюджета по контексту и шагам — все эти детали реализации существенно влияют на итоговый процент прохождения. Когда поставщик тестируемой модели сам строит и настраивает этот каркас, результаты могут отличаться от того, что получил бы нейтральный сторонний оценщик, тестирующий все модели по единому стандарту. Это общая проблема оценок бенчмарков, публикуемых вендорами, а не что-то уникальное для Fable 5.

Насколько эта оценка должна влиять на выбор модели?

Воспринимайте её как одну значимую точку данных, а не единственный критерий. Она отражает примерный уровень возможностей модели на задачах по исправлению ошибок в реальных кодовых базах, что не обязательно совпадает с вашим сценарием (тип задач, длина контекста, бюджет). Рекомендуем свериться с полным «Рейтингом SWE-Bench Pro 2026» для широкого сравнения, а затем проверить модель на небольшом наборе собственных реальных задач.

Создать аккаунт QCode

Планы от ¥60 / $8.57. Один ключ для Claude, GPT и Gemini.

Похожие материалы

Этот сайт не аффилирован с Anthropic. Оценки SWE-Bench Pro приводятся по официальным материалам релиза и сторонним публикациям; информация на странице актуальна на 2026-08-08 и может измениться. Различия в методологии оценки означают, что цифры из разных источников могут быть не полностью сопоставимы.