Переход с GPT-5.6 на Astra
четыре подводных камня
Официальное руководство OpenAI по переходу перечисляет для gpt-6-astra четыре жёстких ограничения: убрать temperature, top_p и top_logprobs (а на Chat Completions ещё и logprobs); уровень рассуждений none не поддерживается, поэтому с none или minimal начинают с low; вызов инструментов требует эндпоинта Responses; и потолок вывода 128 000 включает токены рассуждений. Третий пункт чаще всего принимают за ошибку в собственном коде.
Обновлено 2026-09-09
Четыре жёстких ограничения
Нужно убрать
temperature, top_p, top_logprobs — и logprobs, если вы на Chat Completions. Прямо из официального руководства.
Только пять уровней рассуждений
low, medium, high, xhigh, max. Руководство советует всем, кто был на none или minimal, начать с low и сравнить.
Единственный эндпоинт для инструментов
Официальная формулировка: Astra поддерживает Chat Completions, но вызов инструментов требует Responses. Диалог идёт, инструменты не вызываются.
Потолок вывода включает рассуждения
Токены рассуждений идут в вывод, поэтому max_tokens по длине видимого ответа приводит к раннему обрыву.
Тот пункт, что выглядит как ваша ошибка
Большинство проблем перехода выглядит как дефект в собственном коде: тот же путь function calling работает на GPT-5.6, а на gpt-6-astra инструменты просто не вызываются, и явной ошибки нет. Официальное руководство говорит об этом прямо: Astra поддерживает Chat Completions, но вызов инструментов требует эндпоинта Responses. На Chat Completions она нормально ведёт диалог и лишь никогда не вызывает инструмент. Проверьте эндпоинт, прежде чем отлаживать схему.
Почему параметры сэмплирования должны уйти
Руководство требует убрать temperature, top_p и top_logprobs, а при использовании Chat Completions — ещё и logprobs. Обычно эти параметры проставляются по умолчанию в обёртке команды, поэтому дешевле фильтровать по имени модели на выходе, чем править каждое место вызова. Заодно: если ваша обёртка по умолчанию ставит уровень рассуждений none или minimal, обработайте это в том же проходе — у Astra такого уровня нет.
Хронология
Выходит GPT-6 Astra с идентификатором gpt-6-astra: контекст 1 050 000, максимум входа 922 000, выхода 128 000, срез знаний 2026-04-30.
Одновременно публикуется официальное руководство по переходу: убрать параметры сэмплирования, уровня none нет, вызов инструментов через Responses. Поддерживаемые эндпоинты — Chat Completions, Responses и Batch.
Страница сверена построчно с официальной документацией по модели и руководством по переходу; пересказы параметров из вторых рук не использовались.
Что написано и чего нет
✅ Прямо из официального руководства
Убрать temperature, top_p и top_logprobs (на Chat Completions ещё logprobs); none не поддерживается, начинать с low и сравнивать; Astra поддерживает Chat Completions, но вызов инструментов требует Responses; уровни рассуждений — low, medium, high, xhigh, max; поддерживаемые эндпоинты — Chat Completions, Responses, Batch; контекст 1 050 000, максимум входа 922 000, выхода 128 000.
⚠️ Чего в официальной документации нет
Число параметров, оценка SWE-bench Verified и то, пересчитывается ли при длинном контексте (вход свыше 272 000) весь запрос или только превышение, — всё это отсутствует в официальной документации. Третий пункт заметно влияет на счёт при длинных задачах, поэтому измерьте на небольшом запросе, прежде чем масштабировать. Числа по этим трём пунктам, ходящие в сети, не являются официальными и на этой странице не используются.
Два пути перехода
Фильтровать в слое обёртки
Убирать неподдерживаемые параметры по имени модели на выходе и отображать none/minimal в low. Одно изменение — выигрывают все места вызова, и откат тоже одно изменение. Подходит, когда вызовы разбросаны.
Править каждое место вызова
Точно, но медленно, и легко пропустить умолчания обёртки. Оправдано лишь при малом числе мест вызова или когда им действительно нужна разная обработка.
Разумный порядок
Сначала переведите путь вызова инструментов на эндпоинт Responses и убедитесь, что он работает: это единственный пункт, который отказывает молча. Затем уберите четыре параметра сэмплирования в слое обёртки и отобразите none/minimal в low. Дальше пересчитайте max_tokens по новому учёту — в 128 000 входят токены рассуждений. Наконец прогоните одни и те же реальные запросы через gpt-5.6-sol и gpt-6-astra и решите по разнице в качестве и стоимости, сколько переносить.
В QCode
gpt-6-astra есть в таблице моделей QCode, и за последние 30 дней по ней были реальные вызовы. Она использует тот же ключ и ту же квоту, что три уровня GPT-5.6, Claude и Gemini, поэтому сравнение при переходе делается легко: тот же эндпоинт, тот же ключ, меняете поле model и прогоняете один и тот же набор запросов через обе модели. Разница в стоимости и качестве видна в тот же день.
Частые вопросы
Почему function calling не работает на Astra?
Обычно дело в эндпоинте. Официальное руководство прямо указывает: Astra поддерживает Chat Completions, но вызов инструментов требует Responses. На Chat Completions она нормально ведёт диалог и просто не вызывает инструмент. Переведите этот путь на Responses, прежде чем отлаживать схему.
Какие параметры нужно убрать?
temperature, top_p и top_logprobs — плюс logprobs, если вы на Chat Completions. Именно эти четыре перечисляет официальное руководство.
Я использовал reasoning effort = none. Что теперь?
Astra не поддерживает none. Руководство советует начать с low и сравнить. Учтите, что токены рассуждений идут в вывод, поэтому более высокий уровень дороже по выходной части.
Как задавать max_tokens?
Помните, что в потолок вывода 128 000 входят токены рассуждений. Если задавать его по длине видимого ответа, модель может израсходовать лимит на этапе рассуждений и оборваться раньше. При переходе пересчитайте этот потолок по новому учёту.
Сколько контекста доступно?
Официальная документация даёт окно 1 050 000 при максимуме входа 922 000 и выхода 128 000. При входе свыше 272 000 API переходит на более дорогой тариф, и документация не уточняет, пересчитывается ли весь запрос или только превышение.
Как переключиться с минимальным риском?
В QCode отправьте один и тот же набор реальных запросов на gpt-5.6-sol и gpt-6-astra — один ключ, одна квота, меняется только поле model. Решите, оправдывает ли разница в качестве разницу в стоимости, прежде чем выбирать между распределением по задачам и полным переходом.
Источники
Официальное руководство OpenAI по переходу (параметры сэмплирования, уровни рассуждений, эндпоинт для инструментов) и официальная документация по модели (контекст, потолок вывода, поддерживаемые эндпоинты, срез знаний). Оба получены 2026-09-09. То, чего документация не сообщает, помечено как неопубликованное и не заполнено числами из третьих рук. Объёмы вызовов в QCode взяты из собственной 30-дневной статистики сайта.
Один ключ — прогоните обе модели на одном наборе
gpt-6-astra использует тот же ключ QCode и ту же квоту, что три уровня GPT-5.6, Claude и Gemini; сравнение при переходе — это смена поля model. Тарифы от ¥60 в месяц, ключ активен сразу после оплаты.
Читайте также
GPT-6 Astra: полное руководство
Характеристики, цены и четыре вещи, которые OpenAI не опубликовала.
Расход квоты Astra
Официальная таблица credits: ровно 2,5× от GPT-5.6 Sol.
Включение GPT-5.6 в Codex
Как включалось и переключалось прошлое поколение — полезно как ориентир при переходе.
Все ограничения на этой странице взяты из официального руководства OpenAI по переходу и документации по модели, получены 2026-09-09; OpenAI может их обновить, ориентируйтесь на официальные страницы. То, что документация не публикует, не заполняется числами из третьих рук.