照官方迁移指南逐条核 · 2026-09-09

从 GPT-5.6 迁到 Astra
会绊到你的四件事

OpenAI 的官方迁移指南对 gpt-6-astra 列了四条硬约束:去掉 temperature、top_p、top_logprobs(走 Chat Completions 的还要去掉 logprobs);不支持 none 推理档,原来用 none 或 minimal 的从 low 起步;工具调用必须走 Responses 端点;以及 128,000 的输出上限里包含推理 token。这四条里第三条最容易让人以为是自己代码坏了。

更新于 2026-09-09

#GPT-6 Astra#迁移约束#Responses 必需#无 none 档

四条硬约束

4 个参数

必须去掉

temperature、top_p、top_logprobs;用 Chat Completions 的还要去掉 logprobs。官方迁移指南原文。

无 none

推理档只有五级

low / medium / high / xhigh / max。原来用 none 或 minimal 的,官方建议从 low 起步再对比效果。

Responses

工具调用的唯一端点

官方原文:Astra 支持 Chat Completions,但工具调用需要 Responses。能聊天,调不了工具。

128,000

输出上限含推理 token

推理消耗算在输出里,所以按可见回复长度设 max_tokens 会提前截断。

最容易被误判成 bug 的那一条

很多迁移问题看起来像自己的代码坏了:同一段 function calling 代码在 GPT-5.6 上好好的,换成 gpt-6-astra 之后工具就是不被调用,也不报明显的错。官方迁移指南对此写得很直接——Astra 支持 Chat Completions,但工具调用需要 Responses 端点。换句话说,Chat Completions 上它能正常对话,只是不会调工具。先确认端点,再去查自己的 schema。

采样参数为什么必须删掉

官方迁移指南要求移除 temperature、top_p 和 top_logprobs,使用 Chat Completions 的还要移除 logprobs。这类参数在很多团队的封装层里是默认带上的,迁移时最省事的做法是在出站前按模型名过滤,而不是逐处调用点改。顺带提醒:如果你的封装层把 reasoning effort 默认设成 none 或 minimal,也要一并处理,Astra 没有这一档。

时间线

2026-09-03

GPT-6 Astra 发布,API 模型 id 为 gpt-6-astra。上下文 1,050,000,最大输入 922,000,最大输出 128,000,知识截止 2026-04-30。

2026-09-03

官方迁移指南同期给出:删采样参数、无 none 档、工具调用走 Responses。支持的端点是 Chat Completions、Responses 与 Batch。

2026-09-09

本页按官方模型文档与迁移指南逐条核对,未采用任何二手转述的参数说明。

官方写了的 vs 官方没写的

✅ 官方迁移指南原文

移除 temperature、top_p、top_logprobs(Chat Completions 另加 logprobs);不支持 none,原用 none/minimal 的从 low 起步并对比;Astra 支持 Chat Completions,但工具调用需要 Responses;推理档为 low / medium / high / xhigh / max;支持端点为 Chat Completions、Responses、Batch;上下文 1,050,000、最大输入 922,000、最大输出 128,000。

⚠️ 官方文档里没有的

参数量、SWE-bench Verified 成绩、以及长上下文(输入超过 272,000)究竟是整单换价还是只算超出部分,这三项官方都没有给。第三条尤其影响长上下文任务的账单,建议先用小额请求实测再放量。网上关于这三项的具体数字都不是官方口径,本页不采用。

两种迁移路径

封装层统一过滤

在出站前按模型名删掉不支持的参数、把 none/minimal 映射成 low。改一处,全部调用点受益,回滚也只改一处。适合调用点分散的项目。

逐调用点改

精确但慢,且容易漏掉封装层默认值。只在调用点很少、或不同调用点确实需要不同处理时才划算。

建议的迁移顺序

先把工具调用的那条路切到 Responses 端点并跑通,因为它是唯一会「静默不生效」的一条。然后在封装层统一删掉四个采样参数,并把 reasoning effort 的 none/minimal 映射成 low。接着按新的输出口径复核 max_tokens——128,000 里含推理 token。最后用同一批真实请求在 gpt-5.6-sol 与 gpt-6-astra 上各跑一遍,看质量与成本差再决定切多少。

在 QCode 上

gpt-6-astra 已在 QCode 的模型表里,最近 30 天有真实调用记录。它与 GPT-5.6 三档、Claude、Gemini 共用同一把 key 与同一份配额,所以迁移对照特别好做:同一个端点、同一把 key,换 model 字段就能把同一批请求在新旧模型上各跑一遍,成本与质量差当天可见。

常见问题

为什么我的 function calling 在 Astra 上不生效?

最常见的原因是端点。官方迁移指南写明:Astra 支持 Chat Completions,但工具调用需要 Responses。在 Chat Completions 上它能正常对话,只是不会调工具。先把这条路切到 Responses 再排查 schema。

必须删哪些参数?

temperature、top_p、top_logprobs;如果你走 Chat Completions,还要删 logprobs。官方迁移指南列的就是这四个。

我原来用 reasoning effort = none,现在怎么办?

Astra 不支持 none。官方建议原来用 none 或 minimal 的从 low 起步,再对比效果。注意推理 token 计入输出,档位越高输出侧成本越高。

max_tokens 该怎么设?

注意 128,000 的输出上限里包含推理 token。如果你按可见回复的长度设上限,模型可能在推理阶段就把额度用掉、导致提前截断。迁移时把这个上限按新口径复核一遍。

上下文能放多少?

官方模型文档给的是上下文窗口 1,050,000,最大输入 922,000,最大输出 128,000。注意输入超过 272,000 时 API 会换到更贵的一档,而官方没写清那是整单换价还是只算超出部分。

怎么低风险地切?

在 QCode 上把同一批真实请求分别打到 gpt-5.6-sol 和 gpt-6-astra —— 同一把 key、同一份配额、只改 model 字段。先看质量差是否值得成本差,再决定按任务分流还是全量切。

信息来源

OpenAI 官方迁移指南(采样参数、推理档、工具调用端点)与官方模型文档(上下文、输出上限、支持端点、知识截止),均抓取于 2026-09-09。官方未给出的项目在本页明确标为未公布,不以第三方数字填充。QCode 侧调用量来自本站 30 天用量统计。

同一把 key,把新旧模型跑一遍对照

gpt-6-astra 与 GPT-5.6 三档、Claude、Gemini 共用同一把 QCode Key 和同一份配额,迁移对照只改 model 字段。套餐 ¥60/月起,付款后 Key 立即生效。

相关阅读

本页所有约束均来自 OpenAI 官方迁移指南与模型文档,抓取于 2026-09-09;官方随时可能更新,请以官方页面为准。官方未公布的项目本页不填充第三方数字。