Claude Adaptive Thinking und der Effort-Parameter, Modell für Modell
Stand 2026-10-08 ist Adaptive Thinking bei allen Claude-5.x-Modellen standardmäßig aktiv: Bei Opus 5.5, Fable 5.1 und Fable 5 lässt sich das Denken nicht abschalten; Sonnet 5.5 lehnt disabled ab, die niedrigste Einstellung ist between_tools; Opus 5 und Haiku 5.5 akzeptieren disabled nur bei Effort high oder niedriger; Sonnet 5 kann es ohne Einschränkung abschalten. Die Denktiefe steuern Sie jetzt über output_config.effort (low / medium / high / xhigh / max), Standard ist medium bei Opus 5.5 und Haiku 5.5 und high bei den übrigen Modellen; budget_tokens liefert ab Claude 4.7 bei allen Modellen einen 400-Fehler.
Aktualisiert 2026-10-08
Vier Ergebnisse vorab
Denken bei Opus 5.5 / Fable 5.1
Laut offizieller Dokumentation lehnen Opus 5.5, Fable 5.1 und Fable 5 thinking disabled ab, das Denken lässt sich also nicht abschalten; bei Opus 5.5 liefert disabled auf jeder Effort-Stufe einen 400-Fehler.
Standard-Effort in der API
Offiziell nutzen die meisten Modelle standardmäßig high, Opus 5.5 und Haiku 5.5 dagegen medium. Den Standardwert explizit zu setzen wirkt genau wie Weglassen und bricht den Prompt-Cache nicht.
Effort-Werte
low, medium, high, xhigh und max. Opus 5.5, Sonnet 5.5 und Haiku 5.5 unterstützen alle fünf; die Dokumentation weist darauf hin, dass nicht jedes Modell mit max auch xhigh unterstützt.
Stand bei budget_tokens
Die Dokumentation sagt klar: Claude 4.7 und neuere Modelle lehnen type enabled mit budget_tokens ab; bei den Claude-4.6-Modellen funktioniert es noch, ist aber veraltet; bei 4.5 und älter ist es der einzige manuelle Modus.
Was Adaptive Thinking und Effort jeweils steuern
Stand 2026-10-08 lauten die offiziellen Definitionen: Beim Adaptive Thinking prüft das Modell jede Anfrage und entscheidet selbst, ob und wie viel es denkt; der Effort-Parameter steuert, wie viele Tokens Claude für eine Antwort aufwendet. Beide haben verschiedene Aufgaben: thinking legt fest, ob Claude zuerst in thinking-Blöcken nachdenkt, Effort bestimmt den Aufwand für die gesamte Antwort einschließlich Denken, Text und Tool-Aufrufen. Die Dokumentation warnt, dass adaptive ein Denkmodus und keine Effort-Stufe ist und nicht als Effort-Wert übergeben werden darf. Effort steht in output_config.effort, nicht im thinking-Objekt; es ist ein Verhaltenssignal und kein striktes Token-Budget, daher garantiert keine Stufe bei jeder Anfrage einen thinking-Block.
Jüngste offizielle Änderungen
Opus 5.5, erschienen am 2026-09-22, hat den Standard-Effort auf medium gesenkt: Laut Dokumentation nutzen Opus 5 und ältere Opus-Modelle standardmäßig high, eine Anfrage ohne Effort läuft auf Opus 5.5 also eine Stufe niedriger als auf Opus 5; zudem ist das Denken immer aktiv und nicht abschaltbar. Sonnet 5.5 vom 2026-09-28 lehnt disabled ab; um das vorgelagerte Denken abzuschalten, senden Sie between_tools, das nur bei Effort high oder niedriger funktioniert. Seit 2026-10-05 meldet die Models API capabilities.thinking.types.disabled, sodass Sie vor dem Senden prüfen können, ob ein Modell disabled akzeptiert (bei Ablehnung ist supported false). Haiku 5.5 vom 2026-10-07 denkt standardmäßig, beantwortet manuelles budget_tokens mit einem 400-Fehler, und eine Antwort kann mit thinking-Blöcken beginnen.
Zeitleiste
Claude Opus 5.5 (claude-opus-5-5) erscheint: Denken ist immer aktiv, thinking disabled und enabled liefern beide 400, Standard-Effort ist medium.
Claude Sonnet 5.5 (claude-sonnet-5-5) erscheint: Vorgelagertes Denken schalten Sie jetzt mit between_tools ab, akzeptiert nur bei Effort high oder niedriger.
Claude Haiku 5.5 (claude-haiku-5-5) erscheint: Adaptive Thinking ist standardmäßig aktiv, budget_tokens liefert 400, und disabled schaltet das Denken bei high oder niedriger ab.
Bestätigt vs. vom Hersteller nicht angegeben
Bestätigt (wörtlich in der offiziellen Dokumentation)
Folgendes lässt sich wörtlich in der offiziellen Dokumentation von Anthropic und Claude Code prüfen: Bei Opus 5.5, Fable 5.1 und Fable 5 lässt sich das Denken nicht abschalten; Sonnet 5.5 lehnt disabled ab, between_tools gilt nur bei high oder niedriger; Opus 5 und Haiku 5.5 akzeptieren disabled nur bei high oder niedriger; Sonnet 5 kann das Denken abschalten; Opus 4.8, Opus 4.7, Opus 4.6 und Sonnet 4.6 denken erst, wenn Sie adaptive setzen; die offizielle Beschreibung jeder Effort-Stufe und die Standardwerte je Modell; budget_tokens liefert ab Claude 4.7 einen 400-Fehler; Denk-Tokens werden als Output-Tokens abgerechnet und zählen zu max_tokens; in Claude Code lässt sich das Denken bei Opus 5.5, Sonnet 5.5, Haiku 5.5 und den Fable-Modellen nicht abschalten.
Was der Hersteller nicht angibt
Drei Dinge sind nicht veröffentlicht, planen Sie Ihr Budget also nicht danach. Erstens, wie viele Tokens oder wie viel Geld jede Effort-Stufe mehr oder weniger kostet: Die Dokumentation nennt Effort nur ein Verhaltenssignal und kein striktes Budget und gibt keine Faktoren an. Zweitens sind gleichnamige Stufen über Modelle hinweg nicht gleichwertig: Laut Hersteller ist die Effort-Skala je Modell kalibriert, und die Stufen von Sonnet 5.5 wurden neu kalibriert, es gibt also keine Grundlage, alte Einstellungen zu übernehmen. Drittens gibt es in den Primärquellen keine Formel der Art eine Effort-Stufe entspricht so vielen budget_tokens; die offizielle Migrationsanleitung verlangt nur, budget_tokens zu entfernen und Effort zu verwenden.
Was wählen: Effort, max_tokens oder Denken abschalten
Effort vs. max_tokens
In den Worten der Dokumentation ist Effort eine weiche Vorgabe und max_tokens eine harte Grenze: max_tokens deckelt die gesamte Ausgabe einer Anfrage, Denken und Text zusammen, Effort beeinflusst nur, wie viel davon ins Denken geht, und garantiert keine Token-Anzahl. Um Kosten oder Latenz zu senken, empfiehlt die Dokumentation, zuerst den Effort zu senken, was die gesamte Antwort samt Denken verkleinert; für eine harte Obergrenze nutzen Sie max_tokens. Ab high denkt Claude unter Umständen sehr ausführlich und schöpft max_tokens eher aus.
Effort senken vs. Denken abschalten
Modelle, bei denen sich das Denken abschalten lässt (Sonnet 5 sowie Opus 5 und Haiku 5.5 bei high oder niedriger), akzeptieren disabled, doch für Haiku 5.5 nennt die Dokumentation Effort als den besseren Weg, Qualität gegen Geschwindigkeit und Kosten abzuwägen. Bei Opus 5.5 und Fable 5.1 bleibt nur Effort, und bei Sonnet 5.5 ist between_tools die niedrigste Einstellung. Eine Änderung der thinking-Konfiguration oder des Effort auf oberster Ebene startet den Prompt-Cache neu; bei Opus 5.5, Sonnet 5.5, Haiku 5.5 und einigen weiteren Modellen können Sie Effort stattdessen pro Nachricht ändern (Beta, Header mid-conversation-output-config-2026-07-01) und den Cache behalten. Mit between_tools bei Sonnet 5.5 oder disabled bei Haiku 5.5 liefert eine Effort-Änderung pro Nachricht allerdings einen 400-Fehler.
In drei Schritten von budget_tokens zu Effort
Erstens budget_tokens entfernen: Laut offizieller Migrationsanleitung liefert type enabled ab Claude 4.7, etwa bei Opus 5.5, Sonnet 5, Sonnet 5.5, Fable 5.1 und Haiku 5.5, einen 400-Fehler; lassen Sie thinking also weg oder senden Sie thinking type adaptive (bei Opus 4.8 und Opus 4.7 bedeutet ein fehlendes thinking kein Denken, setzen Sie adaptive dort also ausdrücklich). Zweitens die Tiefe über output_config.effort steuern: Ohne Angabe gilt medium bei Opus 5.5 und Haiku 5.5 und high bei den anderen Modellen; die Dokumentation empfiehlt, die Effort-Stufen auf den eigenen Evals neu durchzutesten, statt Einstellungen eines älteren Modells zu übernehmen. Drittens max_tokens erhöhen und Content-Blöcke nach type auswählen: Denken zählt zu max_tokens, und eine Antwort kann mit thinking-Blöcken beginnen; bei diesen Modellen ist display standardmäßig omitted (leeres thinking-Feld, nur signature), setzen Sie display also auf summarized, wenn Sie die Zusammenfassung sehen wollen. usage.output_tokens_details.thinking_tokens in der Antwort zeigt, wie viele abgerechnete Output-Tokens ins Nachdenken flossen.
Mit QCode
Laut QCode-Dokumentation laufen Claude-Modelle nur über den Endpunkt mit Anthropic-Protokoll: In Claude Code setzen Sie ANTHROPIC_BASE_URL auf https://api.qcode.cc/api (das SDK baut daraus /api/v1/messages). Über QCode aufrufen lassen sich die Claude-5.x-Modelle claude-sonnet-5-5, claude-opus-5-5, claude-sonnet-5, claude-opus-5 und claude-fable-5-1; mit demselben Schlüssel wechseln Sie nur über das Feld model. Ob Haiku 5.5 (claude-haiku-5-5) gelistet ist, sehen Sie auf /models. Abgerechnet wird pro Token, die Preise je Modell stehen auf /models.
Häufig gestellte Fragen
Bei welchen Claude-Modellen lässt sich das Denken nicht abschalten?
Bei Opus 5.5, Fable 5.1 und Fable 5. Laut Dokumentation lehnen diese Modelle thinking type disabled ab, wörtlich: „Thinking can't be turned off on these models“. Sonnet 5.5 lehnt disabled ebenfalls ab, mit between_tools schalten Sie aber das vorgelagerte Denken ab; Opus 5 und Haiku 5.5 akzeptieren disabled nur bei Effort high oder niedriger; Sonnet 5 kann es direkt abschalten. Vorab prüfen lässt es sich über capabilities.thinking.types.disabled in der Models API.
Welche Effort-Stufen gibt es, und welche ist Standard?
Fünf: low, medium, high, xhigh und max. Laut Dokumentation ist bei den meisten Modellen high Standard, bei Opus 5.5 und Haiku 5.5 medium, bei Sonnet 5.5 in der Claude API high. Die offiziellen Beschreibungen: max ist die absolute Höchstleistung ohne Einschränkung beim Token-Verbrauch, xhigh erweiterte Leistung für langwierige Arbeit, high verbraucht so viele Tokens, wie die Aufgabe braucht, medium ist ein ausgewogener Ansatz mit moderater Ersparnis, low ist am effizientesten bei etwas geringerer Leistung.
Wie viel spart ein niedrigerer Effort?
Der Hersteller nennt keinen Faktor. Die Dokumentation beschreibt Effort als Verhaltenssignal und nicht als striktes Token-Budget, das auf alle Output-Tokens wirkt, also Text, Tool-Aufrufe und Denken; low spart deutlich Tokens bei etwas geringerer Leistung. Denk-Tokens werden als Output-Tokens abgerechnet, auch wenn der Denktext nicht zurückgegeben wird; wie viel ins Nachdenken floss, zeigt usage.output_tokens_details.thinking_tokens in der Antwort. Eine harte Obergrenze setzt nur max_tokens.
Kann ich budget_tokens noch verwenden?
Ab Claude 4.7 nicht mehr: type enabled mit budget_tokens liefert einen 400-Fehler. Bei den Claude-4.6-Modellen funktioniert es noch, ist aber veraltet. Modelle, die nur manuelles Extended Thinking unterstützen, etwa Sonnet 4.5, Opus 4.5 und Haiku 4.5, nutzen weiter budget_tokens; Opus 4.5 ist darunter das einzige, das zusätzlich Effort unterstützt, und beides wirkt zusammen. Zur Migration entfernen Sie budget_tokens, wechseln auf adaptive und steuern die Tiefe über Effort.
Worin unterscheidet sich Haiku 5.5 beim Denken von anderen 5.x-Modellen?
Laut offizieller Konfigurationstabelle ist Haiku 5.5 das einzige der drei 5.5-Modelle, das thinking disabled akzeptiert: Bei Effort high oder niedriger lässt sich das Denken abschalten, bei xhigh oder max kommt ein 400-Fehler. Wie Opus 5.5 nutzt es standardmäßig medium und denkt standardmäßig; der Denktext wird standardmäßig nicht zurückgegeben, während Haiku 4.5 eine Zusammenfassung lieferte. Die Dokumentation empfiehlt trotzdem, Qualität, Geschwindigkeit und Kosten über Effort abzuwägen statt über das Abschalten des Denkens.
Wie stelle ich Effort in Claude Code ein, und lässt sich das Denken dort abschalten?
Mit /effort (ohne Argument öffnet sich ein Schieberegler, mit Stufenname wird sie direkt gesetzt, /effort auto löscht die gespeicherte Stufe des aktiven Modells), dem Startparameter --effort, der Umgebungsvariable CLAUDE_CODE_EFFORT_LEVEL oder den Pfeiltasten links und rechts in /model. In Claude Code ist bei Opus 5.5, Sonnet 5.5 und Haiku 5.5 medium Standard; Einstellungsdateien akzeptieren max nicht, und sofern max nicht über die Umgebungsvariable gesetzt ist, gilt es nur für die aktuelle Sitzung. Laut Dokumentation lässt sich das Denken in Claude Code bei Opus 5.5, Sonnet 5.5, Haiku 5.5 und den Fable-Modellen nicht abschalten, MAX_THINKING_TOKENS=0 wirkt dort nicht; ultrathink im Prompt fügt nur eine Anweisung in den Kontext ein, der an die API gesendete Effort bleibt gleich.
Quellen
Offizielle Anthropic-Dokumentation (platform.claude.com, abgerufen am 2026-10-08): die Thinking-Übersicht (Konfigurationstabelle je Modell, Regeln zum Abschalten, display-Standardwerte), Troubleshooting thinking (unterstützte und abgelehnte Konfigurationen je Modell), Steering thinking (Wirkung der Effort-Stufen auf das Denken, Kostenkontrolle und Preise), Effort (die fünf Stufen, Standardwerte und Empfehlungen je Modell), Extended thinking (Abkündigung von budget_tokens und Migration), die What's-new-Seite und der Migrationsleitfaden zu Claude Haiku 5.5, die Modellübersicht sowie die Release Notes der Claude Platform (Daten zu Opus 5.5, Sonnet 5.5, Haiku 5.5 und dem neuen Feld der Models API). Die offizielle Claude-Code-Dokumentation Model configuration (code.claude.com, am selben Tag). Die QCode-Dokumentationsseite zu Endpunkten und API-Pfaden (docs.qcode.cc, am selben Tag).
Claude 5.x mit einem Schlüssel aufrufen
Setzen Sie in Claude Code ANTHROPIC_BASE_URL auf https://api.qcode.cc/api und tragen Sie claude-sonnet-5-5, claude-opus-5-5 oder ein anderes Modell ins Feld model ein; abgerechnet wird pro Token, Preise je Modell auf /models.
Weiterführende Lektüre
Claude Ultracode vs. Max
Ultracode ist ein eigener Schalter in Claude Code und keine Effort-Stufe: wie Sie ihn aktivieren und wann max passt.
Claude Sonnet 5.5 Migration: Fehler bei deaktiviertem Thinking und between_tools
Der genaue disabled-Fehler, Grenzen von between_tools und Effort sowie computer_20251124.
Claude Sonnet 5.5 Komplettguide
Spezifikationen, Preisliste, Standard-Effort und die fünf Breaking Changes.
Diese Seite wurde am 2026-10-08 mit den aktuellen Versionen der offiziellen Dokumentation von Anthropic und Claude Code abgeglichen; Änderungen beim Anbieter sind ohne Vorankündigung möglich. Wie sich Effort auf den Token-Verbrauch auswirkt, hängt von der Aufgabe ab, und der Hersteller nennt keine festen Faktoren; nichts hier ist ein Versprechen für Ihre konkrete Arbeitslast. Maßgeblich für die Modellverfügbarkeit ist /models.