Claude Opus 5 vs GPT-5.6 Sol
Война за полпункта
На Terminal-Bench 2.1 от Artificial Analysis Sol набирает 89.5 против 89.1 у Opus 5 — разрыв между двумя дефолтными моделями агентов сократился до полпункта. Выбор решается за пределами лидерборда.
Ключевые пункты
Разрыв на TB 2.1 (по AA)
Sol 89.5 vs Opus 5 89.1 (Artificial Analysis, усилие xhigh). Официальный лидерборд tbench.ai считает иначе — см. ниже.
Opus 5 за миллион токенов (вход/выход)
Каталожная цена QCode. Sol — $5/$30: вход по той же цене, выход на 20% дороже.
Контекстные окна
Opus 5: 1M токенов; Sol: 400K. На сверхдлинном контексте выигрывает Opus.
Победитель зависит от лидерборда
На AA Sol впереди на 0.4; лидер официального tbench.ai — Claude Code × Fable 5 (83.8), и ни одна из этих двух моделей там не первая.
Позиционирование моделей
Opus 5 (07-24) — действующий флагман Anthropic, дефолтная топовая модель Claude Code, с контекстом 1M, сильнейшая в длинных агентских задачах и работе с инструментами. GPT-5.6 Sol — флагманская ступень серии 5.6 от OpenAI (выше Terra/Luna), контекст 400K, а 07-30 добавлен режим Fast с ускорением 2.5x (за двойную цену). Это дефолтные топовые модели Claude Code и Codex соответственно.
Что значит разрыв в полпункта
С 08-08 цифры Artificial Analysis «Sol 89.5 vs Opus 5 89.1» растиражированы повсюду, а BuildApps озаглавил материал «разрыв настолько мал, что бенчмарк больше не основание для решения». Консенсус индустрии: две лидирующие модели фактически сравнялись в агентском кодинге, и переменные решения сместились к длине контекста, цене, экосистеме и квотам. Учтите: существует ещё и официальный лидерборд tbench.ai (комбинации агент+модель) — это другая система оценки.
Таймлайн
Релиз Claude Opus 5, в тот же день две беты (включая смену инструментов посреди разговора).
Пересмотр цен серии GPT-5.6: Luna -80%, Terra -20%; цена Sol не изменилась, но добавлен режим Fast.
Цифры AA «Sol 89.5 vs Opus 5 89.1» широко расходятся; «насыщение бенчмарков» становится темой.
Подтверждено vs на что обратить внимание
Подтверждено
Контексты, цены и разрывы на лидербордах обеих моделей подтверждены официальными страницами или проверяемыми рейтингами. Обе модели имеют реальный объём вызовов в QCode (использование за 30 дней > 0).
На что обратить внимание
Не сравнивайте баллы с разных лидербордов: AA (прямые замеры моделей, xhigh) и официальный tbench.ai (комбинации агент+модель) — две разные системы. Сравнивая Opus 5 и Sol, зафиксируйте один рейтинг.
Выбор по сценарию
Берите Opus 5
Сверхдлинный контекст (1M), экосистема Claude Code, длинные агентские задачи. Выход — $25 за миллион, на $5 дешевле Sol.
Берите GPT-5.6 Sol
Экосистема Codex, режим Fast (ускорение 2.5x) или существующий тулчейн OpenAI. Выход — $30 за миллион.
Как сделать собственный вывод
Возьмите 5-10 реальных задач из своего репозитория, прогоните обе модели с одним агентом и одним уровнем effort и сравните «доля решённых с первого раза × стоимость токенов». Две модели с разрывом в полпункта на лидерборде могут отличаться на целый уровень на вашей нагрузке — направление станет ясно только после собственного прогона.
В QCode
claude-opus-5 и gpt-5.6-sol в продаже (реальные вызовы за последние 30 дней). Один ключ, один эндпоинт — смена модели это смена одного id, так что A/B-тест стоит два раунда токенов.
Частые вопросы
Что сильнее — Opus 5 или GPT-5.6 Sol?
На Terminal-Bench 2.1 от AA: Sol 89.5 против Opus 5 89.1, разрыв 0.4 — на уровне бенчмарка фактическая ничья. Различия в экосистеме, контексте и цене.
Насколько отличаются цены?
Каталог QCode: Opus 5 — $5/$25, Sol — $5/$30 (за миллион токенов вход/выход). Вход по одной цене, выход у Sol на 20% дороже.
У кого больше контекст?
Opus 5: 1M токенов. Sol: 400K. Для огромных репозиториев и длинных сессий выигрывает Opus.
Почему на некоторых лидербордах выше Opus 5?
Системы разные: официальный tbench.ai меряет комбинации «агент+модель», vals.ai перемеряет всё единым харнессом, AA тестирует модели напрямую. Сравнение баллов между рейтингами бессмысленно.
Обе работают с Claude Code / Codex?
Claude Code по умолчанию ходит в модели Claude, Codex — в OpenAI; инструменты с произвольными эндпоинтами (вроде Cline) позволяют комбинировать свободно.
Обе можно вызывать в QCode?
Обе в продаже, переключение одним ключом. Перед выбором основной прогоните каждую на реальных задачах.
Источники
Artificial Analysis (через BuildApps 08-08 и The Batch 08-21), официальный лидерборд tbench.ai (снят 08-22), официальное объявление Anthropic (07-24), объявление OpenAI о пересмотре цен (07-30), QCode /models (08-22).
Один ключ — прогнать обе
Opus 5 и Sol продаются в QCode на одном эндпоинте — собственные замеры надёжнее лидербордов.
Читать дальше
Гид по Claude Opus 5
Полная инструкция по вызову флагмана.
Сверхбыстрый режим GPT-5.6 Sol
Детали режима Fast с ускорением 2.5x.
Разбор Terminal-Bench 2.1
С какого лидерборда взялся разрыв 0.4.
Не аффилированы с Anthropic / OpenAI. Цифры лидербордов — снимок на 2026-08.