Разбор рейтингов · снапшот 2026-08-22

Terminal-Bench 2.1
Три лидера — кому верить

Один и тот же бенчмарк, но официальный лидерборд, Artificial Analysis и vals.ai называют трёх разных победителей. Разница не в накрутках, а в harness, ступени effort и датах снапшотов.

#terminal-bench-2.1#89 задач#Три лидерборда#TB 3.0 уже здесь

Лидеры трёх рейтингов

83.8

Официальный борд · Claude Code × Fable 5

tbench.ai, связка agent + модель, ступень xhigh, снапшот 2026-06-07, $552.67 за прогон.

89.5

Artificial Analysis · GPT-5.6 Sol

Ступень рассуждений xhigh. Opus 5 следом с 89.1, Grok 4.6 третий с 88.4 (по The Batch от 08-21).

85.77

vals.ai · GPT-5.6 Sol

Единый harness Terminus 2, pass@1. Opus 5 — 84.64, Kimi K3 — 80.90.

89

Задач

Терминальные задачи от обучения моделей до системного администрирования, разбитые по сложности; на старте ни одна модель не превышала 50% на hard-ступени.

Что такое Terminal-Bench 2.1

Terminal-Bench — открытый комьюнити-бенчмарк терминальных агентов: модель должна реально выполнить задачу в песочнице терминала — например, «обучи fasttext-модель на данных yelp из data/, чтобы она весила меньше 150MB и набрала 0.62 accuracy на приватном тесте». В версии 2.1 — 89 задач: обучение моделей, системное администрирование и другое, с оценкой pass@1: задача засчитывается, только если проходят все прилагаемые pytest-проверки. Терминал — основное поле боя агентов вроде Claude Code, Codex и Cursor, поэтому этот рейтинг стал жёсткой метрикой agentic coding.

Почему в этом месяце снова спорят

С 08-08 сразу несколько изданий цитируют данные Artificial Analysis: GPT-5.6 Sol 89.5 против Claude Opus 5 89.1 — разрыв в топе всего 0.4; 08-21 The Batch сообщил, что Grok 4.6 с 88.4 вошёл в топ-3. При этом лидер официального tbench.ai — Claude Code × Fable 5 с 83.8: оба набора цифр верны, просто измеряют они разные «модели». А в релизных материалах GLM-5.3 уже фигурирует Terminal-Bench 3.0 — 2.1 превращается в рейтинг прошлого поколения.

Таймлайн

2026-06-07

Текущая первая запись официального борда: Claude Code × Fable 5 (xhigh) — 83.8.

2026-08-08

Цифры Artificial Analysis «Sol 89.5 vs Opus 5 89.1» начинают массово цитировать СМИ.

2026-08-21

The Batch: Grok 4.6 с 88.4 входит в топ-3; снапшот vals.ai того же периода: Sol 85.77 / Opus 5 84.64 / K3 80.90.

Подтверждено vs где ошибаются

Подтверждено

Все три лидерборда реальны, цифры проверяемы: официальный tbench.ai (связки agent + модель, фреймворк harbor), vals.ai (единый harness Terminus 2, pass@1), Artificial Analysis (прямые замеры моделей с указанием ступени effort). Расхождения — от harness и ступени, а не от подделки данных.

Где ошибаются

Заголовки вида «модель X — первая в Terminal-Bench» почти никогда не уточняют, какой это борд, какой agent и какая ступень effort. Официальный борд измеряет связку «agent + модель» (например, Claude Code × Fable 5), а не голую модель; принимать очки связки за очки модели — самая частая ошибка.

Сначала сравните стоимость, потом очки

Очки близко

В топе-2 официального борда разница 0.7 (83.8 против 83.1), у Artificial Analysis — 0.4. Для фронтирных моделей 2.1 почти насыщен.

Стоимость отличается в разы

Стоимость прогона на официальном борде: $552.67 у связки с Fable 5, $2,059.19 у связки с GPT-5.5. При близких очках бюджет отличается почти в 4 раза.

Как перепроверить самому

Официальный фреймворк — harbor: harbor run -d terminal-bench/terminal-bench-2-1 -a "<agent>" -m "<model>" -k 5. Сравниваете модели — зафиксируйте agent и ступень effort; выбираете agent — зафиксируйте модель. Снапшоты vals.ai и Artificial Analysis годятся как перекрёстная проверка.

В QCode

Модели из верхних строчек всех трёх рейтингов — Fable 5, Opus 5, Sonnet 5, GPT-5.5, вся линейка GPT-5.6, Kimi K3, GLM-5.2 — в QCode перепроверяются по очереди одним ключом, по формуле «официальный прайс × сервисный коэффициент», и прогон обойдётся заметно дешевле, чем пополнять каждую платформу отдельно. Семейство Grok в QCode не подключено — для него нужны официальные каналы.

Частые вопросы

Так кто же первый в Terminal-Bench 2.1?

Смотря какой борд: официальный tbench.ai называет Claude Code × Fable 5 (83.8), Artificial Analysis — GPT-5.6 Sol (89.5), в снапшоте vals.ai тоже Sol (85.77). У них разные harness и методика подсчёта.

Почему цифры официального борда так ниже?

Официальный борд меряет связку «agent + модель», и у каждой записи своя дата снапшота; vals.ai перемеряет всё на едином harness Terminus 2, а Artificial Analysis тестирует модели напрямую с указанием ступени effort. Чем сильнее harness и выше ступень, тем выше очки.

Что входит в 89 задач?

Реальные задачи в песочнице терминала: обучение моделей, системное администрирование, обработка данных и другое, разбитые по сложности. Оценка pass@1 — все прилагаемые pytest-проверки должны пройти.

Terminal-Bench 3.0 уже вышел?

Вендоры уже ссылаются: в материалах GLM-5.3 фигурирует TB 3.0, а сторонние сравнения показывают Opus 5 42.7 / Sol 34.6. Он заметно сложнее, а топовые очки 2.1 уже почти насыщены.

Сколько стоит прогнать рейтинг самому?

У записей официального борда есть колонка стоимости: $552.67 за прогон у связки с Fable 5, $2,059.19 у связки с GPT-5.5. Единая API-платформа с оплатой по факту выйдет намного дешевле подписок на каждой платформе по отдельности.

На какой борд смотреть при выборе?

Для выбора agent — официальный борд (очки связок), для голых моделей — vals.ai (единый harness), для быстрого сравнения — Artificial Analysis. Ни одна отдельная цифра не должна быть единственным основанием.

Источники

Официальный борд tbench.ai (выгрузка 2026-08-22), методология и снапшоты vals.ai по Terminal-Bench 2.1, Artificial Analysis (через felloai и The Batch, 2026-08-21), BuildApps (2026-08-08).

Один ключ — и выводы вы проверите сами

Лидеры рейтингов вызываются через один endpoint QCode по формуле «официальный прайс × сервисный коэффициент» — бюджет на перепроверку под вашим контролем.