Migration von GPT-5.6 zu Astra
vier Stolperfallen
Der offizielle Migrationsleitfaden von OpenAI nennt vier harte Einschränkungen für gpt-6-astra: temperature, top_p und top_logprobs müssen entfernt werden (bei Chat Completions zusätzlich logprobs); die Reasoning-Stufe none wird nicht unterstützt, sodass alles, was bisher auf none oder minimal lief, bei low beginnt; Tool Calling erfordert den Responses-Endpunkt; und die Output-Obergrenze von 128,000 schließt Reasoning-Tokens ein. Den dritten Punkt halten viele für einen Fehler im eigenen Code.
Aktualisiert 2026-09-09
Die vier harten Einschränkungen
Müssen entfernt werden
temperature, top_p, top_logprobs – und zusätzlich logprobs, wenn Sie Chat Completions verwenden. Direkt aus dem offiziellen Migrationsleitfaden.
Nur fünf Reasoning-Stufen
low, medium, high, xhigh, max. Laut Leitfaden sollte alles, was bisher auf none oder minimal lief, bei low beginnen und verglichen werden.
Der einzige Endpunkt für Tool Calling
Offizieller Wortlaut: Astra unterstützt Chat Completions, aber Tool Calling erfordert Responses. Das Modell führt Gespräche, ruft aber keine Tools auf.
Output-Obergrenze schließt Reasoning ein
Reasoning-Tokens zählen zum Output. Wer max_tokens nach der sichtbaren Antwort bemisst, erhält daher vorzeitig abgeschnittene Ausgaben.
Der Punkt, der nach einem Fehler in Ihrem Code aussieht
Die meisten Migrationsprobleme wirken wie ein Fehler im eigenen Code: Derselbe Function-Calling-Pfad funktioniert mit GPT-5.6, doch mit gpt-6-astra werden die Tools schlicht nicht aufgerufen – ohne erkennbare Fehlermeldung. Der offizielle Migrationsleitfaden ist hier eindeutig: Astra unterstützt Chat Completions, aber Tool Calling erfordert den Responses-Endpunkt. Über Chat Completions führt das Modell ein normales Gespräch und ruft nur nie ein Tool auf. Prüfen Sie den Endpunkt, bevor Sie Ihr Schema debuggen.
Warum die Sampling-Parameter entfernt werden müssen
Der Migrationsleitfaden verlangt, temperature, top_p und top_logprobs zu entfernen – bei Chat Completions zusätzlich logprobs. Diese Werte sind meist als Standard in der Wrapper-Schicht eines Teams gesetzt. Am günstigsten ist es daher, beim Senden nach Modellnamen zu filtern, statt jede Aufrufstelle anzupassen. Ebenfalls wichtig: Setzt Ihr Wrapper den Reasoning-Aufwand standardmäßig auf none oder minimal, beheben Sie das im selben Zug – Astra kennt diese Stufe nicht.
Zeitleiste
GPT-6 Astra erscheint mit der API-Modell-ID gpt-6-astra: 1,050,000 Kontext, 922,000 max. Input, 128,000 max. Output, Wissensstand 2026-04-30.
Gleichzeitig erscheint der offizielle Migrationsleitfaden: Sampling-Parameter entfernen, keine Stufe none, Tool Calling über Responses. Unterstützte Endpunkte sind Chat Completions, Responses und Batch.
Diese Seite wurde Zeile für Zeile mit der offiziellen Modelldokumentation und dem Migrationsleitfaden abgeglichen; Zusammenfassungen aus zweiter Hand wurden für die Parameter nicht verwendet.
Was dokumentiert ist und was nicht
✅ Direkt aus dem offiziellen Leitfaden
temperature, top_p und top_logprobs entfernen (bei Chat Completions zusätzlich logprobs); none wird nicht unterstützt, daher bei low beginnen und vergleichen; Astra unterstützt Chat Completions, aber Tool Calling erfordert Responses; die Reasoning-Stufen sind low, medium, high, xhigh, max; unterstützte Endpunkte sind Chat Completions, Responses und Batch; Kontext 1,050,000, max. Input 922,000, max. Output 128,000. Der lange Kontext steht auf derselben offiziellen Modellseite: Prompts mit mehr als 272K Input-Tokens werden für die gesamte Anfrage mit dem 2-fachen Input- und Cache-Satz und dem 1.5-fachen Output-Satz berechnet, nicht nur für den überschreitenden Teil (erneut geprüft am 2026-09-29).
⚠️ Nicht in der offiziellen Dokumentation
Die Parameteranzahl und ein SWE-bench-Verified-Wert sind weiterhin nicht in der offiziellen Dokumentation angegeben. Ob langer Kontext (Input über 272,000) die gesamte Anfrage oder nur den überschreitenden Teil neu bepreist, gehört nicht mehr dazu: Die offizielle Modellseite nennt es, und nach einer wörtlichen erneuten Prüfung am 2026-09-29 wanderte diese Zeile in die linke Spalte. Im Netz kursierende Zahlen zu diesen beiden Punkten sind nicht offiziell und werden auf dieser Seite nicht verwendet.
Zwei Migrationswege
In der Wrapper-Schicht filtern
Nicht unterstützte Parameter beim Senden nach Modellnamen entfernen und none/minimal auf low abbilden. Eine Änderung, von der alle Aufrufstellen profitieren – und auch ein Rollback ist nur eine Änderung. Am besten, wenn die Aufrufstellen verstreut sind.
Jede Aufrufstelle anpassen
Präzise, aber langsam; Wrapper-Standardwerte werden dabei leicht übersehen. Lohnt sich nur bei wenigen Aufrufstellen oder wenn verschiedene Stellen tatsächlich unterschiedlich behandelt werden müssen.
Eine sinnvolle Reihenfolge
Verlegen Sie zuerst den Tool-Calling-Pfad auf den Responses-Endpunkt und bringen Sie ihn zum Laufen, denn nur dort tritt der Fehler unbemerkt auf. Entfernen Sie danach die vier Sampling-Parameter in der Wrapper-Schicht und bilden Sie none/minimal auf low ab. Prüfen Sie anschließend max_tokens anhand der neuen Zählweise – 128,000 schließt Reasoning-Tokens ein. Führen Sie zuletzt dieselben echten Anfragen gegen gpt-5.6-sol und gpt-6-astra aus und lassen Sie den Unterschied bei Qualität und Kosten entscheiden, wie viel Sie umstellen.
Bei QCode
gpt-6-astra steht in der Modelltabelle von QCode und hat in den letzten 30 Tagen echten Traffic. Das Modell teilt sich einen Key und ein Kontingent mit den drei GPT-5.6-Stufen, Claude und Gemini, was den Migrationsvergleich einfach macht: gleicher Endpunkt, gleicher Key, Modellfeld ändern und denselben Satz Anfragen gegen beide ausführen. Der Unterschied bei Kosten und Qualität zeigt sich noch am selben Tag. Noch eine Unterscheidung: CNBC berichtete (das WSJ zuerst), dass OpenAI beschlossen habe, GPT-6.1 Astra nicht zu veröffentlichen; auf der Website und in den offiziellen Konten von OpenAI findet sich keine solche Aussage, weshalb diese Seite es als Medienbericht einordnet. Stand 2026-09-29 sind die veröffentlichten Modelle, die heute bei QCode verfügbar sind, weiterhin gpt-6-astra, gpt-6-sol und gpt-6-luna.
Häufig gestellte Fragen
Warum funktioniert mein Function Calling mit Astra nicht?
Meist liegt es am Endpunkt. Der offizielle Migrationsleitfaden besagt, dass Astra Chat Completions unterstützt, Tool Calling aber Responses erfordert. Über Chat Completions führt das Modell ein normales Gespräch und ruft nur nie ein Tool auf. Verlegen Sie diesen Pfad auf Responses, bevor Sie Ihr Schema debuggen.
Welche Parameter müssen entfernt werden?
temperature, top_p und top_logprobs – zusätzlich logprobs, wenn Sie Chat Completions verwenden. Diese vier nennt der offizielle Leitfaden.
Ich habe Reasoning Effort = none verwendet. Was nun?
Astra unterstützt none nicht. Der Leitfaden empfiehlt, bei low zu beginnen und zu vergleichen. Beachten Sie, dass Reasoning-Tokens zum Output zählen, eine höhere Stufe verursacht also auf der Output-Seite höhere Kosten.
Wie sollte ich max_tokens festlegen?
Bedenken Sie, dass die Obergrenze von 128,000 Output-Tokens die Reasoning-Tokens einschließt. Wenn Sie den Wert nach der sichtbaren Antwort bemessen, kann das Modell sein Budget schon während des Reasonings aufbrauchen und die Antwort vorzeitig abschneiden. Prüfen Sie diese Obergrenze bei der Migration anhand der neuen Abrechnung erneut.
Wie viel Kontext kann ich nutzen?
Die offizielle Modelldokumentation nennt ein Kontextfenster von 1,050,000 Tokens mit maximal 922,000 Input- und maximal 128,000 Output-Tokens. Auch die Regel für langen Kontext ist angegeben: Prompts mit mehr als 272K Input-Tokens werden für die gesamte Anfrage mit dem 2-fachen Input- und Cache-Preis sowie dem 1,5-fachen Output-Preis berechnet – die ganze Anfrage, nicht nur der Überschuss (erneut geprüft am 2026-09-29).
Wie gelingt der Wechsel mit geringem Risiko?
Senden Sie bei QCode denselben Satz realer Anfragen an gpt-5.6-sol und gpt-6-astra – ein Key, ein Kontingent, nur das Feld model ändert sich. Entscheiden Sie, ob der Qualitätsunterschied den Kostenunterschied wert ist, bevor Sie sich zwischen Routing nach Aufgabe und einem vollständigen Umstieg entscheiden.
Quellen
Der offizielle Migrationsleitfaden von OpenAI (Sampling-Parameter, Reasoning-Stufen, Endpunkt für Tool Calling) und die offizielle Modelldokumentation (Kontext, Output-Obergrenze, unterstützte Endpunkte, Knowledge Cutoff), beide erfasst am 2026-09-09. Angaben, die die Dokumentation nicht nennt, sind hier als nicht veröffentlicht gekennzeichnet und nicht mit Zahlen von Dritten aufgefüllt. Die QCode-Aufrufvolumina stammen aus der eigenen 30-Tage-Nutzungsstatistik dieser Website.
Ein Key, beide Modelle mit demselben Batch ausführen
gpt-6-astra teilt sich mit den drei GPT-5.6-Stufen, Claude und Gemini einen QCode-Key und ein Kontingent; für einen Migrationsvergleich ändern Sie nur das Feld model. Tarife beginnen bei ¥60/Monat, und der Key ist aktiv, sobald Sie bezahlen.
Weiterführende Lektüre
Vollständiger Leitfaden zu GPT-6 Astra
Spezifikationen, Preise und was die offizielle Dokumentation noch nicht nennt.
Kontingentverbrauch von Astra
Die offizielle Credits-Tabelle: exakt das 2.5-Fache von GPT-5.6 Sol.
GPT-5.6 in Codex aktivieren
Wie die vorherige Generation aktiviert und umgeschaltet wurde – nützlich als Migrationsreferenz.
Alle Einschränkungen auf dieser Seite stammen aus dem offiziellen Migrationsleitfaden und der offiziellen Modelldokumentation von OpenAI, erfasst am 2026-09-09; OpenAI kann diese aktualisieren, richten Sie sich daher nach den offiziellen Seiten. Angaben, die die Dokumentation nicht veröffentlicht, werden nicht mit Zahlen von Dritten aufgefüllt.