Битва флагманов · 2026-08-22

Claude Opus 5 vs GPT-5.6 Sol
Война за полпункта

На Terminal-Bench 2.1 от Artificial Analysis Sol набирает 89.5 против 89.1 у Opus 5 — разрыв между двумя дефолтными моделями агентов сократился до полпункта. Выбор решается за пределами лидерборда.

#claude opus 5#gpt-5.6 sol#terminal-bench#сравнение

Ключевые пункты

0.4

Разрыв на TB 2.1 (по AA)

Sol 89.5 vs Opus 5 89.1 (Artificial Analysis, усилие xhigh). Официальный лидерборд tbench.ai считает иначе — см. ниже.

$5 / $25

Opus 5 за миллион токенов (вход/выход)

Каталожная цена QCode. Sol — $5/$30: вход по той же цене, выход на 20% дороже.

1M / 400K

Контекстные окна

Opus 5: 1M токенов; Sol: 400K. На сверхдлинном контексте выигрывает Opus.

89.1 / 89.5

Победитель зависит от лидерборда

На AA Sol впереди на 0.4; лидер официального tbench.ai — Claude Code × Fable 5 (83.8), и ни одна из этих двух моделей там не первая.

Позиционирование моделей

Opus 5 (07-24) — действующий флагман Anthropic, дефолтная топовая модель Claude Code, с контекстом 1M, сильнейшая в длинных агентских задачах и работе с инструментами. GPT-5.6 Sol — флагманская ступень серии 5.6 от OpenAI (выше Terra/Luna), контекст 400K, а 07-30 добавлен режим Fast с ускорением 2.5x (за двойную цену). Это дефолтные топовые модели Claude Code и Codex соответственно.

Что значит разрыв в полпункта

С 08-08 цифры Artificial Analysis «Sol 89.5 vs Opus 5 89.1» растиражированы повсюду, а BuildApps озаглавил материал «разрыв настолько мал, что бенчмарк больше не основание для решения». Консенсус индустрии: две лидирующие модели фактически сравнялись в агентском кодинге, и переменные решения сместились к длине контекста, цене, экосистеме и квотам. Учтите: существует ещё и официальный лидерборд tbench.ai (комбинации агент+модель) — это другая система оценки.

Таймлайн

2026-07-24

Релиз Claude Opus 5, в тот же день две беты (включая смену инструментов посреди разговора).

2026-07-30

Пересмотр цен серии GPT-5.6: Luna -80%, Terra -20%; цена Sol не изменилась, но добавлен режим Fast.

2026-08-08

Цифры AA «Sol 89.5 vs Opus 5 89.1» широко расходятся; «насыщение бенчмарков» становится темой.

Подтверждено vs на что обратить внимание

Подтверждено

Контексты, цены и разрывы на лидербордах обеих моделей подтверждены официальными страницами или проверяемыми рейтингами. Обе модели имеют реальный объём вызовов в QCode (использование за 30 дней > 0).

На что обратить внимание

Не сравнивайте баллы с разных лидербордов: AA (прямые замеры моделей, xhigh) и официальный tbench.ai (комбинации агент+модель) — две разные системы. Сравнивая Opus 5 и Sol, зафиксируйте один рейтинг.

Выбор по сценарию

Берите Opus 5

Сверхдлинный контекст (1M), экосистема Claude Code, длинные агентские задачи. Выход — $25 за миллион, на $5 дешевле Sol.

Берите GPT-5.6 Sol

Экосистема Codex, режим Fast (ускорение 2.5x) или существующий тулчейн OpenAI. Выход — $30 за миллион.

Как сделать собственный вывод

Возьмите 5-10 реальных задач из своего репозитория, прогоните обе модели с одним агентом и одним уровнем effort и сравните «доля решённых с первого раза × стоимость токенов». Две модели с разрывом в полпункта на лидерборде могут отличаться на целый уровень на вашей нагрузке — направление станет ясно только после собственного прогона.

В QCode

claude-opus-5 и gpt-5.6-sol в продаже (реальные вызовы за последние 30 дней). Один ключ, один эндпоинт — смена модели это смена одного id, так что A/B-тест стоит два раунда токенов.

Частые вопросы

Что сильнее — Opus 5 или GPT-5.6 Sol?

На Terminal-Bench 2.1 от AA: Sol 89.5 против Opus 5 89.1, разрыв 0.4 — на уровне бенчмарка фактическая ничья. Различия в экосистеме, контексте и цене.

Насколько отличаются цены?

Каталог QCode: Opus 5 — $5/$25, Sol — $5/$30 (за миллион токенов вход/выход). Вход по одной цене, выход у Sol на 20% дороже.

У кого больше контекст?

Opus 5: 1M токенов. Sol: 400K. Для огромных репозиториев и длинных сессий выигрывает Opus.

Почему на некоторых лидербордах выше Opus 5?

Системы разные: официальный tbench.ai меряет комбинации «агент+модель», vals.ai перемеряет всё единым харнессом, AA тестирует модели напрямую. Сравнение баллов между рейтингами бессмысленно.

Обе работают с Claude Code / Codex?

Claude Code по умолчанию ходит в модели Claude, Codex — в OpenAI; инструменты с произвольными эндпоинтами (вроде Cline) позволяют комбинировать свободно.

Обе можно вызывать в QCode?

Обе в продаже, переключение одним ключом. Перед выбором основной прогоните каждую на реальных задачах.

Источники

Artificial Analysis (через BuildApps 08-08 и The Batch 08-21), официальный лидерборд tbench.ai (снят 08-22), официальное объявление Anthropic (07-24), объявление OpenAI о пересмотре цен (07-30), QCode /models (08-22).

Один ключ — прогнать обе

Opus 5 и Sol продаются в QCode на одном эндпоинте — собственные замеры надёжнее лидербордов.