Terminal-Bench 2.1
Три лидера — кому верить
Один и тот же бенчмарк, но официальный лидерборд, Artificial Analysis и vals.ai называют трёх разных победителей. Разница не в накрутках, а в harness, ступени effort и датах снапшотов.
Лидеры трёх рейтингов
Официальный борд · Claude Code × Fable 5
tbench.ai, связка agent + модель, ступень xhigh, снапшот 2026-06-07, $552.67 за прогон.
Artificial Analysis · GPT-5.6 Sol
Ступень рассуждений xhigh. Opus 5 следом с 89.1, Grok 4.6 третий с 88.4 (по The Batch от 08-21).
vals.ai · GPT-5.6 Sol
Единый harness Terminus 2, pass@1. Opus 5 — 84.64, Kimi K3 — 80.90.
Задач
Терминальные задачи от обучения моделей до системного администрирования, разбитые по сложности; на старте ни одна модель не превышала 50% на hard-ступени.
Что такое Terminal-Bench 2.1
Terminal-Bench — открытый комьюнити-бенчмарк терминальных агентов: модель должна реально выполнить задачу в песочнице терминала — например, «обучи fasttext-модель на данных yelp из data/, чтобы она весила меньше 150MB и набрала 0.62 accuracy на приватном тесте». В версии 2.1 — 89 задач: обучение моделей, системное администрирование и другое, с оценкой pass@1: задача засчитывается, только если проходят все прилагаемые pytest-проверки. Терминал — основное поле боя агентов вроде Claude Code, Codex и Cursor, поэтому этот рейтинг стал жёсткой метрикой agentic coding.
Почему в этом месяце снова спорят
С 08-08 сразу несколько изданий цитируют данные Artificial Analysis: GPT-5.6 Sol 89.5 против Claude Opus 5 89.1 — разрыв в топе всего 0.4; 08-21 The Batch сообщил, что Grok 4.6 с 88.4 вошёл в топ-3. При этом лидер официального tbench.ai — Claude Code × Fable 5 с 83.8: оба набора цифр верны, просто измеряют они разные «модели». А в релизных материалах GLM-5.3 уже фигурирует Terminal-Bench 3.0 — 2.1 превращается в рейтинг прошлого поколения.
Таймлайн
Текущая первая запись официального борда: Claude Code × Fable 5 (xhigh) — 83.8.
Цифры Artificial Analysis «Sol 89.5 vs Opus 5 89.1» начинают массово цитировать СМИ.
The Batch: Grok 4.6 с 88.4 входит в топ-3; снапшот vals.ai того же периода: Sol 85.77 / Opus 5 84.64 / K3 80.90.
Подтверждено vs где ошибаются
Подтверждено
Все три лидерборда реальны, цифры проверяемы: официальный tbench.ai (связки agent + модель, фреймворк harbor), vals.ai (единый harness Terminus 2, pass@1), Artificial Analysis (прямые замеры моделей с указанием ступени effort). Расхождения — от harness и ступени, а не от подделки данных.
Где ошибаются
Заголовки вида «модель X — первая в Terminal-Bench» почти никогда не уточняют, какой это борд, какой agent и какая ступень effort. Официальный борд измеряет связку «agent + модель» (например, Claude Code × Fable 5), а не голую модель; принимать очки связки за очки модели — самая частая ошибка.
Сначала сравните стоимость, потом очки
Очки близко
В топе-2 официального борда разница 0.7 (83.8 против 83.1), у Artificial Analysis — 0.4. Для фронтирных моделей 2.1 почти насыщен.
Стоимость отличается в разы
Стоимость прогона на официальном борде: $552.67 у связки с Fable 5, $2,059.19 у связки с GPT-5.5. При близких очках бюджет отличается почти в 4 раза.
Как перепроверить самому
Официальный фреймворк — harbor: harbor run -d terminal-bench/terminal-bench-2-1 -a "<agent>" -m "<model>" -k 5. Сравниваете модели — зафиксируйте agent и ступень effort; выбираете agent — зафиксируйте модель. Снапшоты vals.ai и Artificial Analysis годятся как перекрёстная проверка.
В QCode
Модели из верхних строчек всех трёх рейтингов — Fable 5, Opus 5, Sonnet 5, GPT-5.5, вся линейка GPT-5.6, Kimi K3, GLM-5.2 — в QCode перепроверяются по очереди одним ключом, по формуле «официальный прайс × сервисный коэффициент», и прогон обойдётся заметно дешевле, чем пополнять каждую платформу отдельно. Семейство Grok в QCode не подключено — для него нужны официальные каналы.
Частые вопросы
Так кто же первый в Terminal-Bench 2.1?
Смотря какой борд: официальный tbench.ai называет Claude Code × Fable 5 (83.8), Artificial Analysis — GPT-5.6 Sol (89.5), в снапшоте vals.ai тоже Sol (85.77). У них разные harness и методика подсчёта.
Почему цифры официального борда так ниже?
Официальный борд меряет связку «agent + модель», и у каждой записи своя дата снапшота; vals.ai перемеряет всё на едином harness Terminus 2, а Artificial Analysis тестирует модели напрямую с указанием ступени effort. Чем сильнее harness и выше ступень, тем выше очки.
Что входит в 89 задач?
Реальные задачи в песочнице терминала: обучение моделей, системное администрирование, обработка данных и другое, разбитые по сложности. Оценка pass@1 — все прилагаемые pytest-проверки должны пройти.
Terminal-Bench 3.0 уже вышел?
Вендоры уже ссылаются: в материалах GLM-5.3 фигурирует TB 3.0, а сторонние сравнения показывают Opus 5 42.7 / Sol 34.6. Он заметно сложнее, а топовые очки 2.1 уже почти насыщены.
Сколько стоит прогнать рейтинг самому?
У записей официального борда есть колонка стоимости: $552.67 за прогон у связки с Fable 5, $2,059.19 у связки с GPT-5.5. Единая API-платформа с оплатой по факту выйдет намного дешевле подписок на каждой платформе по отдельности.
На какой борд смотреть при выборе?
Для выбора agent — официальный борд (очки связок), для голых моделей — vals.ai (единый harness), для быстрого сравнения — Artificial Analysis. Ни одна отдельная цифра не должна быть единственным основанием.
Источники
Официальный борд tbench.ai (выгрузка 2026-08-22), методология и снапшоты vals.ai по Terminal-Bench 2.1, Artificial Analysis (через felloai и The Batch, 2026-08-21), BuildApps (2026-08-08).
Один ключ — и выводы вы проверите сами
Лидеры рейтингов вызываются через один endpoint QCode по формуле «официальный прайс × сервисный коэффициент» — бюджет на перепроверку под вашим контролем.
Читать дальше
Рейтинг SWE-bench Pro 2026
Свежие результаты длинного репозиторного бенчмарка.
SWE-bench и реальная работа
Разрыв между очками в рейтингах и настоящей инженерией.
Радар AI-моделей 2026
Цены и доступность флагманов всех семейств.
Цифры рейтингов — снапшот на 2026-08-22, они меняются по мере обновления бордов. Не аффилированы с организаторами бенчмарков.