Разбор бенчмарка · Terminal-Bench 3.0

Terminal-Bench 3.0
Гораздо сложнее, чем 2.1 — лидер едва перевалил за 40%

TB 3.0 запущен 2026-08-19 с целью снизить долю успешных первых попыток базовых моделей ниже 30%; текущий лидер, Claude Opus 5, набирает всего 42.7%, тогда как рейтинг 2.1 давно насыщен на уровне около 88%.

#TB 3.0#запуск 2026-08-19#лидер 42.7%#GPU-песочницы

Четыре ключевых факта

42.7%

Текущий результат лидера

Claude Opus 5 лидирует в TB 3.0 с результатом 42.7% — пока единственная модель выше 40%.

88.4%

Результат лидера TB 2.1 (насыщение)

Лидер TB 2.1, Grok 4.6, набирает 88.4%, а топ-4 модели сгрудились в диапазоне 86%-89% — разброс минимален.

<30%

Целевой показатель 3.0

Разработчики (Harbor, Laude Institute, Snorkel AI, Turing) прямо заявили цель — доля успешных первых попыток базовых моделей ниже 30%.

7 доменов

Охват предметных областей

3.0 охватывает 7 предметных областей, вводя GPU-песочницы (вплоть до H100), мультиконтейнерные топологии, реальные микросервисы и более строгую логику проверки.

Что на самом деле изменилось между 3.0 и 2.1

Топовые модели в TB 2.1 в целом подобрались к 90%, оставляя слишком мало пространства, чтобы видеть реальную разницу между моделями — классическая проблема «насыщения» бенчмарка. TB 3.0 не просто добавляет задачи — сложность поднимается на уровне инфраструктуры: GPU-песочницы вплоть до H100, мультиконтейнерные топологии, интеграция с реально работающими микросервисами и более строгая логика проверки «тогда и только тогда» (а не нечёткая приблизительная оценка). Разработчики публично заявили, что цель сложности задач в 3.0 — довести долю успешных первых попыток базовых моделей ниже 30%, что и объясняет, почему лидер Claude Opus 5 набирает лишь 42.7%. Модели не стали хуже — просто планка стала строже.

Последние новости

TB 3.0 запущен 2026-08-19, первая версия (v0.1) охватывает 74 задачи в 7 предметных областях. Текущий топ-8: Claude Opus 5 (42.7%), GPT-5.6 Sol (34.6%), Claude Fable 5 (34.0%), GLM-5.3 (32.4%), Grok 4.6 (26.5%), Claude Opus 4.8 (21.1%), GPT-5.6 Terra (20.8%) и SWE-1.7 Lightning от Cognition (18.6%).

Хронология

19.08.2026

Запуск Terminal-Bench 3.0; v0.1 охватывает 74 задачи в 7 предметных областях.

Неделя запуска

Публикуется первый рейтинг: Claude Opus 5 лидирует с 42.7% — пока единственная модель выше 40%.

Продолжается

Как ранняя версия, набор задач и рейтинг, вероятно, будут расширяться; ранжирование будет меняться по мере развития бенчмарка.

Подтверждено vs требует постоянного внимания

Подтверждено

TB 3.0 запущен 19.08.2026, совместно разработан Harbor, Laude Institute, Snorkel AI и Turing; текущий лидер — Claude Opus 5 (42.7%). Лидер TB 2.1, Grok 4.6, набирает 88.4%, а топ-4 сгрудились в диапазоне 86%-89%.

Требует постоянного внимания

3.0 пока остаётся ранней версией (v0.1, 74 задачи); набор задач и рейтинг, скорее всего, будут расширяться и корректироваться, так что не стоит воспринимать снимок рейтинга на конкретный момент как неизменный вывод.

TB 3.0 vs TB 2.1

TB 2.1 (тренд к насыщению)

Топовые модели сгрудились в диапазоне 86%-89%, разброс минимален; всё ещё широко используется, но разглядеть реальные различия между моделями стало сложно.

TB 3.0 (разводит результаты)

GPU-песочницы + мультиконтейнеры + реальные микросервисы + строгая проверка; лидер едва перевалил за 40%, что лучше отражает реальный потолок современных моделей.

Как читать этот рейтинг

Сначала проверьте, соответствует ли охват предметных областей вашему реальному сценарию использования (3.0 охватывает 7 областей, и не каждая задача имеет отношение к вашему кейсу). Затем смотрите на реальный разрыв в баллах, а не на место в рейтинге — топовые модели TB 3.0 уже показывают заметный разброс (42.7% против 34.6% против 34.0%), что полезнее, чем скученность в 2.1 в пределах нескольких пунктов. Бенчмарк всё ещё ранний, так что возвращайтесь к нему периодически, а не доверяйте одному снимку.

Что делать в QCode

Из текущего топ-8 TB 3.0 Claude Opus 5, GPT-5.6 Sol, Claude Fable 5, GLM-5.3 и Claude Opus 4.8 входят в линейку продаж QCode — один ключ вызывает их по официальной цене × сервисной ставке. Grok 4.6 и SWE-1.7 Lightning сейчас не продаются через QCode.

Частые вопросы

Почему баллы TB 3.0 в целом настолько ниже, чем у 2.1?

Модели не стали слабее — стала строже проверка. 3.0 вводит GPU-песочницы, мультиконтейнерные топологии, реальные микросервисы и более строгую логику проверки; разработчики прямо нацелились на долю успешных первых попыток базовых моделей ниже 30%, так что общее снижение баллов ожидаемо.

Стоит ли ещё ориентироваться на TB 2.1?

Да, но его топовые модели в основном насытились (диапазон 86%-89%), разброс минимален. Если вы просто сравниваете несколько топовых моделей между собой, 3.0 информативнее.

Сколько задач сейчас охватывает TB 3.0?

Первая версия (v0.1) охватывает 74 задачи в 7 предметных областях; как ранняя версия, набор задач, ожидается, будет расширяться.

Grok 4.6 был первым в TB 2.1 — почему в 3.0 его место ниже?

Сложность задач и требования к инфраструктуре сильно различаются между версиями; 3.0 делает упор на реалистичные, сложные мультиконтейнерные/микросервисные сценарии, и разные модели показывают в них заметно иные результаты, чем на наборе задач 2.1 — изменение ранжирования ожидаемо.

Можно ли вызвать через QCode все модели из этого рейтинга?

Нет. Из топ-8 TB 3.0 Grok 4.6 и SWE-1.7 Lightning сейчас не продаются через QCode; остальные 5 (Claude Opus 5, GPT-5.6 Sol, Claude Fable 5, GLM-5.3, Claude Opus 4.8) можно вызвать одним ключом QCode.

Что означает логика проверки «тогда и только тогда» в TB 3.0?

Это более строгая автоматическая проверка — задача засчитывается выполненной только если она точно удовлетворяет заданным условиям, а не по нечёткой приблизительной оценке, что снижает число ложных срабатываний, когда решение «выглядит правильным, но на самом деле не полностью верно».

Источники

Дата запуска TB 3.0 (2026-08-19), разработчики (Harbor, Laude Institute, Snorkel AI, Turing), число предметных областей, целевой показатель (доля первых успешных попыток базовых моделей <30%) и текущие баллы рейтинга — из официальной страницы рейтинга Terminal-Bench 3.0 и профильных технических СМИ; баллы TB 2.1 — со страницы версии 2.1 того же рейтинга. Проверено 27.08.2026.

За рамками рейтинга: одним ключом — к основным моделям

Claude Opus 5, GPT-5.6 Sol, Claude Fable 5, GLM-5.3 и другие лидеры TB 3.0 — доступны одним ключом QCode.

Читайте также

Данные рейтинга на этой странице взяты с официальной страницы рейтинга Terminal-Bench и не являются официальной позицией QCode; конкретные баллы определяются актуальными данными рейтинга, собственный независимый рейтинг мы не ведём.