Сверено построчно с официальным руководством · 2026-09-09

Переход с GPT-5.6 на Astra
четыре подводных камня

Официальное руководство OpenAI по переходу перечисляет для gpt-6-astra четыре жёстких ограничения: убрать temperature, top_p и top_logprobs (а на Chat Completions ещё и logprobs); уровень рассуждений none не поддерживается, поэтому с none или minimal начинают с low; вызов инструментов требует эндпоинта Responses; и потолок вывода 128 000 включает токены рассуждений. Третий пункт чаще всего принимают за ошибку в собственном коде.

Обновлено 2026-09-09

#GPT-6 Astra#Ограничения перехода#Нужен Responses#Нет уровня none

Четыре жёстких ограничения

4 параметра

Нужно убрать

temperature, top_p, top_logprobs — и logprobs, если вы на Chat Completions. Прямо из официального руководства.

Без none

Только пять уровней рассуждений

low, medium, high, xhigh, max. Руководство советует всем, кто был на none или minimal, начать с low и сравнить.

Responses

Единственный эндпоинт для инструментов

Официальная формулировка: Astra поддерживает Chat Completions, но вызов инструментов требует Responses. Диалог идёт, инструменты не вызываются.

128 000

Потолок вывода включает рассуждения

Токены рассуждений идут в вывод, поэтому max_tokens по длине видимого ответа приводит к раннему обрыву.

Тот пункт, что выглядит как ваша ошибка

Большинство проблем перехода выглядит как дефект в собственном коде: тот же путь function calling работает на GPT-5.6, а на gpt-6-astra инструменты просто не вызываются, и явной ошибки нет. Официальное руководство говорит об этом прямо: Astra поддерживает Chat Completions, но вызов инструментов требует эндпоинта Responses. На Chat Completions она нормально ведёт диалог и лишь никогда не вызывает инструмент. Проверьте эндпоинт, прежде чем отлаживать схему.

Почему параметры сэмплирования должны уйти

Руководство требует убрать temperature, top_p и top_logprobs, а при использовании Chat Completions — ещё и logprobs. Обычно эти параметры проставляются по умолчанию в обёртке команды, поэтому дешевле фильтровать по имени модели на выходе, чем править каждое место вызова. Заодно: если ваша обёртка по умолчанию ставит уровень рассуждений none или minimal, обработайте это в том же проходе — у Astra такого уровня нет.

Хронология

2026-09-03

Выходит GPT-6 Astra с идентификатором gpt-6-astra: контекст 1 050 000, максимум входа 922 000, выхода 128 000, срез знаний 2026-04-30.

2026-09-03

Одновременно публикуется официальное руководство по переходу: убрать параметры сэмплирования, уровня none нет, вызов инструментов через Responses. Поддерживаемые эндпоинты — Chat Completions, Responses и Batch.

2026-09-09

Страница сверена построчно с официальной документацией по модели и руководством по переходу; пересказы параметров из вторых рук не использовались.

Что написано и чего нет

✅ Прямо из официального руководства

Убрать temperature, top_p и top_logprobs (на Chat Completions ещё logprobs); none не поддерживается, начинать с low и сравнивать; Astra поддерживает Chat Completions, но вызов инструментов требует Responses; уровни рассуждений — low, medium, high, xhigh, max; поддерживаемые эндпоинты — Chat Completions, Responses, Batch; контекст 1 050 000, максимум входа 922 000, выхода 128 000.

⚠️ Чего в официальной документации нет

Число параметров, оценка SWE-bench Verified и то, пересчитывается ли при длинном контексте (вход свыше 272 000) весь запрос или только превышение, — всё это отсутствует в официальной документации. Третий пункт заметно влияет на счёт при длинных задачах, поэтому измерьте на небольшом запросе, прежде чем масштабировать. Числа по этим трём пунктам, ходящие в сети, не являются официальными и на этой странице не используются.

Два пути перехода

Фильтровать в слое обёртки

Убирать неподдерживаемые параметры по имени модели на выходе и отображать none/minimal в low. Одно изменение — выигрывают все места вызова, и откат тоже одно изменение. Подходит, когда вызовы разбросаны.

Править каждое место вызова

Точно, но медленно, и легко пропустить умолчания обёртки. Оправдано лишь при малом числе мест вызова или когда им действительно нужна разная обработка.

Разумный порядок

Сначала переведите путь вызова инструментов на эндпоинт Responses и убедитесь, что он работает: это единственный пункт, который отказывает молча. Затем уберите четыре параметра сэмплирования в слое обёртки и отобразите none/minimal в low. Дальше пересчитайте max_tokens по новому учёту — в 128 000 входят токены рассуждений. Наконец прогоните одни и те же реальные запросы через gpt-5.6-sol и gpt-6-astra и решите по разнице в качестве и стоимости, сколько переносить.

В QCode

gpt-6-astra есть в таблице моделей QCode, и за последние 30 дней по ней были реальные вызовы. Она использует тот же ключ и ту же квоту, что три уровня GPT-5.6, Claude и Gemini, поэтому сравнение при переходе делается легко: тот же эндпоинт, тот же ключ, меняете поле model и прогоняете один и тот же набор запросов через обе модели. Разница в стоимости и качестве видна в тот же день.

Частые вопросы

Почему function calling не работает на Astra?

Обычно дело в эндпоинте. Официальное руководство прямо указывает: Astra поддерживает Chat Completions, но вызов инструментов требует Responses. На Chat Completions она нормально ведёт диалог и просто не вызывает инструмент. Переведите этот путь на Responses, прежде чем отлаживать схему.

Какие параметры нужно убрать?

temperature, top_p и top_logprobs — плюс logprobs, если вы на Chat Completions. Именно эти четыре перечисляет официальное руководство.

Я использовал reasoning effort = none. Что теперь?

Astra не поддерживает none. Руководство советует начать с low и сравнить. Учтите, что токены рассуждений идут в вывод, поэтому более высокий уровень дороже по выходной части.

Как задавать max_tokens?

Помните, что в потолок вывода 128 000 входят токены рассуждений. Если задавать его по длине видимого ответа, модель может израсходовать лимит на этапе рассуждений и оборваться раньше. При переходе пересчитайте этот потолок по новому учёту.

Сколько контекста доступно?

Официальная документация даёт окно 1 050 000 при максимуме входа 922 000 и выхода 128 000. При входе свыше 272 000 API переходит на более дорогой тариф, и документация не уточняет, пересчитывается ли весь запрос или только превышение.

Как переключиться с минимальным риском?

В QCode отправьте один и тот же набор реальных запросов на gpt-5.6-sol и gpt-6-astra — один ключ, одна квота, меняется только поле model. Решите, оправдывает ли разница в качестве разницу в стоимости, прежде чем выбирать между распределением по задачам и полным переходом.

Источники

Официальное руководство OpenAI по переходу (параметры сэмплирования, уровни рассуждений, эндпоинт для инструментов) и официальная документация по модели (контекст, потолок вывода, поддерживаемые эндпоинты, срез знаний). Оба получены 2026-09-09. То, чего документация не сообщает, помечено как неопубликованное и не заполнено числами из третьих рук. Объёмы вызовов в QCode взяты из собственной 30-дневной статистики сайта.

Один ключ — прогоните обе модели на одном наборе

gpt-6-astra использует тот же ключ QCode и ту же квоту, что три уровня GPT-5.6, Claude и Gemini; сравнение при переходе — это смена поля model. Тарифы от ¥60 в месяц, ключ активен сразу после оплаты.

Читайте также

Все ограничения на этой странице взяты из официального руководства OpenAI по переходу и документации по модели, получены 2026-09-09; OpenAI может их обновить, ориентируйтесь на официальные страницы. То, что документация не публикует, не заполняется числами из третьих рук.