Kontingent und Kosten paralleler Agenten: ein Pool, N Kontexte
Wenn mehrere Agenten gleichzeitig laufen, was wird dabei verbraucht: das 5-Stunden-Fenster und die Wochenobergrenze auf der Abo-Seite von Claude oder das eigene tägliche API-Kontingent dieser Website? Die beiden Uhren werden hier getrennt gezählt – Stückpreise sind Anthropics veröffentlichte Preise mit Stand 2026-09-22, Cache-Lese- und Schreibvorgänge werden separat erfasst, und Worker-Anzahl sowie Kontextlänge sind als Annahmen gekennzeichnet, mit offengelegter Rechnung, damit jeder sie nachrechnen kann.
Aktualisiert 2026-09-22
Vier Kernpunkte
Eigener Kontext pro Agent
Beide Seiten lesen sich linear: „Token costs scale linearly“, „token usage is roughly proportional to team size“. Der eine Multiplikator, den sie nennen (Agent Teams im Plan-Modus), benennt seine Einheit: „approximately 7x more tokens than standard sessions“ – Tokens, nicht die Rechnung. Was sie auf ×N treibt, ist das feste Präfix pro Anfrage: Teammitglieder laden CLAUDE.md, MCP-Server und Skills, und eine Token-Zahl wird nicht genannt. Geprüft am 2026-09-22.
Eigener Cache-Schreibvorgang pro Worktree
„The API caches by matching the start of each request, called the prefix“ – Treffer sind Präfix-Treffer. In Claude Code gilt der Cache pro Rechner und pro Verzeichnis: „each worktree has its own working directory“, also bedeuten N Worktrees eines Repos N Präfixe und N Cache-Schreibvorgänge. Die Zeile Claude Sonnet 5 in der Anthropic-Preisliste (Stand 2026-09-22): Input $2, Cache-Lesen $0.20, Cache-Schreiben $2.50 pro MTok, 5-Minuten-Stufe. Input gegenüber Cache-Lesen ist das 10-Fache – ein Verhältnis zweier gelisteter Zahlen, keine um das 10-Fache höhere Rechnung. Geprüft am 2026-09-22.
Die Leiste zeigt das aktive Konto
Die Seite zur Nutzungserfassung sagt zunächst „Orca reads the local usage state each agent maintains on disk“, dann „No API calls, no extra auth.“ und schließt mit „numbers update when the agent writes, not in real time“. Die Leiste erfasst nur das aktive Konto, und geschätzte Zeilen tragen den Hinweis „not a live bill from the provider“. Diese Seite nennt nur Claude Code, Codex, Gemini, OpenCode, Kimi Code und MiniMax; darüber hinaus weiten wir nichts aus. Geprüft am 2026-09-22.
Parallelbetrieb bekommt keinen eigenen Zähler
Beginnen Sie mit der Fehlerseite: „A single burst of heavy activity, such as a large workflow fanout, can exhaust the weekly allowance before the session window resets.“ Beide Kontingente zählen gleichzeitig – „Usage counts against the session and weekly allowances at the same time“ – und der parallele Betrieb von Agents eröffnet keinen zweiten Zähler. Alles unter einem Konto (claude.ai, Claude Code, Claude Desktop) greift auf dasselbe Kontingent zu. Der Anbieter beschreibt dieses Kontingent in Nachrichten und Arbeitszeit, nicht als Token-Formel; deshalb erfindet diese Seite keine. Geprüft am 2026-09-22.
Wie das Kontingent gemessen wird
Das Kontingent wird weder nach Anzahl der Sitzungen noch nach paralleler Breite gemessen: Das offizielle Modell summiert Tokens über zwei Fenster, eine 5-Stunden-Sitzung und ein Wochenlimit, das pro Konto zu einem festen Zeitpunkt zurückgesetzt wird; beide gelten für alle Modelle gemeinsam. Auf einem Konto greifen claude.ai, Claude Code und Claude Desktop auf dasselbe Limit zu. Wer N Agents parallel laufen lässt, eröffnet also kein zweites Hauptbuch – derselbe feste Kontext wird lediglich erneut gezählt. Halten Sie die Gegenstände auseinander: Diese Fenster gehören zum Claude-Code-Abo; die API-Abrechnung füllt Kapazität fortlaufend wieder auf, statt sie zurückzusetzen. Geprüft am 2026-09-22.
Die Wochenstufe in diesem Halbjahr
Die Kontingentbasis hat sich in diesem Halbjahr zweimal verschoben, beide Male in einem einzigen offiziellen Artikel. Die befristete Erhöhung lautet „From May 13, 2026 through September 13, 2026, your weekly usage limit in Claude Code was 50% higher“, und die 5-Stunden-Ebene war nicht Teil davon; ab 2026-09-14 liegt die Wochenstufe über ihrem Niveau vor der Aktion – „starting September 14, 2026, weekly limits in Claude Code are 25% higher than they were before the promotion“ – beschränkt auf Claude Code. Nach dem 2026-09-14 trifft ein Fan-out also auf eine Wochenstufe, die weder dem Aktions- noch dem Vor-Aktions-Wert entspricht, und Vielfache bleiben hier der an diesem Tag festgehaltene offizielle Satz, keine Prozentangabe. Preise sind aktuelle Werte: Sonnet 5 Input $2, Cache-Lesen $0.20, Cache-Schreiben $2.50 (Stand 2026-09-22); die Fußzeile weist darauf hin, dass sich Preise nach Ermessen des Anbieters ändern können. Geprüft am 2026-09-22.
Wann wir geprüft haben
2026-05-13: Ein Help-Center-Artikel besagt: „From May 13, 2026 through September 13, 2026, your weekly usage limit in Claude Code was 50% higher. 5-hour usage limits were not affected by this promotion.“ Die Erhöhung betraf nur die Wochenebene, das 5-Stunden-Fenster blieb unberührt, sie galt ausschließlich für Claude Code (CLI, IDE-Erweiterungen, Desktop, Web) und endete am 2026-09-13. Geprüft am 2026-09-22.
2026-09-14: Derselbe Artikel macht einen Teil dieser Erhöhung dauerhaft – „starting September 14, 2026, weekly limits in Claude Code are 25% higher than they were before the promotion for Pro, Max, Team, and seat-based Enterprise plans“. Alle Aussagen zum Wochenkontingent beziehen sich auf den Wortlaut, der nach diesem Datum gilt. Diese Seite wurde am 2026-09-22 geprüft.
2026-09-22: Die Preisangaben und Limit-Sätze hier wurden an diesem Tag aus den offiziellen Archiven erfasst und wortgetreu verglichen. Die Zeile „Claude Sonnet 5“ auf claude.com/pricing nennt Input, Output, Cache-Lesen und Cache-Schreiben, und die Seite hält fest: „Price and plans are subject to change at Anthropic's discretion.“ Preise sind nur mit diesem Datum korrekt zu lesen; ohne Datum stimmen sie nicht mehr. Geprüft am 2026-09-22.
Wörtlich in der Dokumentation vs. Community-Legenden
Wörtlich im offiziellen Text
Vier Blöcke, alle wortgleich mit dem am 2026-09-22 erfassten offiziellen Text. Limits: „Your session-based usage limit will reset every five hours“, Max-Tarife haben zudem ein wöchentliches Nutzungslimit, das für alle Modelle gilt; die Wochenstufe wird zu einem festen, Ihrem Konto zugewiesenen Zeitpunkt zurückgesetzt; claude.ai, Claude Code und Claude Desktop teilen sich ein Limit. Parallelität: „Each teammate runs its own context window, so token usage is roughly proportional to team size“, und das einzige Vielfache, das der Hersteller nennt, lautet „Agent teams use approximately 7x more tokens than standard sessions when teammates run in plan mode“ – es geht um Tokens, nicht um Geld. Obergrenze: Claude Code blockiert weitere Anfragen bis zum in der Meldung angezeigten Zeitpunkt der Zurücksetzung; ein Modellwechsel stellt den Zugriff nicht wieder her. Orchestrator-Seite: Orca liest den lokalen Nutzungsstatus, den jeder Agent auf der Festplatte führt – „No API calls, no extra auth.“
⚠️ Community-Überlieferung, kein offizieller Wortlaut
Drei Behauptungen, die der festgehaltene offizielle Text nicht stützt. Erstens: „Parallele Agents sprengen den Cache, daher springt die Rechnung auf das 10- oder 50-Fache“: Beides steht dort nicht – Community-Rückmeldung, kein offizieller Wortlaut. Der offizielle Wortlaut weist in die andere Richtung: Claude Code hält spätere Agents zurück, damit deren erste Anfragen das gemeinsame Präfix lesen, statt es jeweils ungecacht zu verarbeiten. Die einzige 10 hier ist $2 geteilt durch $0.20: zwei Tabellenpreise, keine Rechnungserhöhung. Zweitens: „Es warnt bei 80 %“: 80 % ist der eigene Schwellenwert des Orchestrators (Orca: A warning chip when you cross 80% of a limit.), das Beispiel von Claude Code lautet You've used 85% of your session limit. Drittens: „Es wechselt von selbst das Konto, wenn das Kontingent voll ist“: nicht dokumentiert; die Usage Policy verbietet es, mehrere Konten zu unterhalten, um Limits zu umgehen. Dokumentiert sind: Blockieren bis zur Reset-Zeit oder Weiterarbeiten in der offenen Sitzung mit einem Abo. Geprüft am 2026-09-22.
Parallel oder einzelne Sitzung
N parallele Agents
Die parallele Seite multipliziert sich mit der Anzahl der Kopien. Die Annahme stammt von uns, der Hersteller veröffentlicht keine Token-Anzahl: Jeder Agent sendet erneut ein festes Präfix von 40000 Tokens, 5 Agents, je 20 Runden, bepreist wird nur dieses Präfix. Die Zeile für Sonnet 5 nennt Input mit $2 pro Million Tokens: eine Runde = 40000 / 1000000 × $2 = $0.08, gesamt = $0.08 × 5 × 20 = $8.00. Das Schreiben in den Cache wird als Obergrenze einmal pro Agent in dessen erster Runde gezählt (der Hersteller lässt auch benachbarte Agents das Präfix des jeweils anderen erneut lesen), zu $2.50: 40000 / 1000000 × $2.50 = $0.10, somit kommen bei 5 Agents $0.50 hinzu. Preise Stand 2026-09-22.
Eine lange Sitzung
Die Seite mit einer einzelnen Sitzung zahlt die Fixkosten nur einmal: Nachdem das Präfix geschrieben wurde, wird jede Runde als Cache-Lesevorgang zu $0.20 abgerechnet; der Listenpreis für Input von $2 geteilt durch diesen Wert ergibt 10 – zwei Zahlen aus der Preistabelle, keine mit 10 multiplizierte Rechnung. Schmerzhaft ist eine Pause: „Cached prefixes automatically expire after a minimum of 5 minutes of inactivity“, die Cache-Zeilen tragen den Hinweis „Prompt caching pricing reflects 5-minute TTL“, und nach einem Modellwechsel liest die nächste Anfrage die gesamte Unterhaltung ohne Cache-Treffer erneut ein. Geprüft am 2026-09-22.
Drei Schritte, um den Fan-out zu kalkulieren
1) Messen Sie das feste Präfix P einer Aufgabe: System-Prompt, Tool-Definitionen, CLAUDE.md – alles wird in jedem Turn erneut gesendet. Anthropic veröffentlicht keine Token-Zahl, daher ist P = 40,000 eine ausdrücklich getroffene Annahme, keine offizielle Zahl. 2) Multiplizieren Sie mit Parallelität und Turns: Jeder Teammate hat ein eigenes Kontextfenster und verbraucht Tokens unabhängig, und die Token-Nutzung ist ungefähr proportional zur Teamgröße; nehmen Sie N = 5, T = 20. 3) Setzen Sie die Preise der Sonnet-5-Zeile von claude.com/pricing (Stand 2026-09-22) an: Input $2 / MTok, Cache-Lesen $0.20 / MTok, 5-Minuten-Cache-Schreiben $2.50 / MTok. Kalter Turn: 40,000 ÷ 1,000,000 × 2 = $0.08, dann × 5 × 20 = $8.00. Vollständig im Cache: 40,000 ÷ 1,000,000 × 0.20 = $0.008, also $0.80. Ein Schreibvorgang pro Agent: 40,000 ÷ 1,000,000 × 2.50 = $0.10, somit 5 Agents = $0.50. Input geteilt durch Cache-Lesen ergibt 10 ($2 ÷ $0.20): zwei Zahlen einer Preisliste, keine Rechnung mal 10. Output und Tool-Ergebnisse sind in diesem Beispiel nicht enthalten.
Was Ihr eigener Key Ihnen zeigen kann
Zwei getrennte Uhren. Das 5-Stunden-Fenster und das Wochenlimit sind Mechanik des Claude-Abos, nicht unsere. Wir verkaufen eine API: Die einzige verbleibende Nutzungsdimension bei persönlichen Tarifen ist ein Tageslimit. Ihr Key zeigt Ablauf, heutige Nutzung, Monatskontingent und Auslastung für aktive API-Keys; dieser Endpunkt ist schreibgeschützt, pro Minute und pro Tag begrenzt und mit wenigen Sekunden Cache versehen, also kein Guthaben-Zähler zum dauerhaften Abfragen. Ein persönlicher Key erlaubt außerdem 5 gleichzeitige Anfragen (Stand 2026-09-22): Weitere Agents werden eingereiht, sie eröffnen keine sechste Spur. Auch der Orchestrator führt kein aggregiertes Hauptbuch – die Leiste folgt dem aktiven Konto, und ihre Kostenzeile ist keine Live-Rechnung des Anbieters. Kein Sparversprechen, nur Zahlen, die Sie nachrechnen können (geprüft am 2026-09-22).
FAQ
Kann automatisch das Konto gewechselt werden, sobald ein Limit erreicht ist?
Nicht als Versprechen. Die Dokumentation legt fest: „Claude Code blocks further requests until the reset time shown in the message“, und der vorgesehene Weg zur Fortsetzung ist „In an interactive session signed in with a claude.ai subscription, Claude Code can also wait in the open session and continue the interrupted task shortly after the reset“ – dasselbe Abo wartet die Zurücksetzung ab, es wechselt nicht zwischen Konten. Auch ein Modellwechsel hilft nicht: Sitzungs- und Wochenlimits gelten für alle Modelle gemeinsam. Wichtiger noch: Die offizielle Nutzungsrichtlinie führt „Create or manage multiple accounts to evade detection or circumvent platform safeguards“ als untersagt auf. Die Wochenstufe wird laut Dokumentation jede Woche zu einem festen, Ihrem Konto zugewiesenen Zeitpunkt zurückgesetzt, unabhängig davon, wann Sie begonnen haben (geprüft am 2026-09-22).
Warum machen Modell- oder Kontowechsel den Cache zunichte?
Bei Modellen ist die Formulierung eindeutig: „Each model has its own prompt cache, so the next request re-reads the whole conversation with no cache hits.“ Bei Konten sagt die Dokumentation: „Caches are isolated between organizations. Different organizations never share caches, even if they use identical prompts“ – wechseln Sie in eine andere Organisation, wird dasselbe Präfix erneut geschrieben, und zwar zu „5-minute cache write tokens are 1.25 times the base input tokens price“. Selbst wer bleibt, wo er ist, muss beachten: „Cache hits require 100% identical prompt segments“, sodass ein Branch-Name oder ein Pfad pro Worktree im Präfix den Treffer zunichtemacht. Die Community-Zahl einer 10- bis 50-fachen Rechnung hat in den hier erfassten Seiten keine offizielle Entsprechung: Sie ist Community-Feedback ohne offizielle Formulierung, und diese Seite führt sie nicht als Kostenangabe (geprüft am 2026-09-22).
Kostet die Aufteilung der Aufgabe auf mehr Agenten weniger?
Nicht unbedingt, oft sogar das Gegenteil. Jeder Agent trägt seine eigene Kopie des festen Präfixes: „Each subagent starts with a fresh, isolated context window“, und „each teammate has its own context window and consumes tokens independently“, wobei die „token usage roughly proportional to team size“ ist; die Workflows-Seite ergänzt, dass ein einzelner Lauf „meaningfully more tokens“ verbrauchen kann als dieselbe Aufgabe im Gespräch. Unter der Annahme dieser Seite, P = 40,000, bezahlt die Aufteilung einer Aufgabe in K Teile dieses Präfix K-mal – unsere eigene Rechnung, keine offizielle Zahl. Den einzigen Multiplikator nennt Anthropic selbst: Agent Teams im Plan-Modus mit „7x more tokens than standard sessions“, und das sind Tokens, keine siebenfach höhere Rechnung. Der Break-even-Test besteht aus einer Zeile: ob die vermiedenen doppelten Lesevorgänge (K − 1) × P × den Input-Preis übersteigen (geprüft am 2026-09-22).
Diese 80-Prozent-Warnung – wessen Zahl ist das?
Zuerst die Herkunft: 80 Prozent ist die eigene Schwelle des Orchestrators – seine Seite zur Nutzungsverfolgung sagt „A warning chip when you cross 80% of a limit“ –, während Anthropics eigene Beispielformulierung „85% of your session limit“ lautet; die beiden Zahlen sind nicht dasselbe. Die beobachtete Ebene ist ein Paar, nämlich das Fünf-Stunden-Sitzungslimit und das wöchentliche Nutzungslimit, mechanisch definiert als „Percentage of the 5-hour or 7-day rate limit consumed, from 0 to 100“, und diese Fenster gibt es nur für Abonnenten von claude.ai Pro und Max, ein API-Key hat also keines von beiden. Die Anzeige selbst ist nicht live: „numbers update when the agent writes, not in real time“. Als Bremsleuchte brauchbar, als Abrechnungsgrundlage ungeeignet (geprüft am 2026-09-22).
Löst paralleles Ausführen von Agenten ein 429 aus?
Wieder zwei Uhren. Auf der API-Seite werden Limits pro Modellklasse in RPM, ITPM und OTPM gemessen, und ihre Überschreitung liefert 429 mit einem retry-after; zwei offizielle Sätze betreffen direkt die Parallelität: „Short bursts of requests can exceed the limit and trigger rate limit errors“, und ein starker Anstieg der Nutzung kann zudem „acceleration limits“ auslösen. Dieser Pool wird dort bemessen, wo „Limits are set at the organization level“, sodass ein Fan-out ihn nie vergrößert, und die Kapazität wird kontinuierlich aufgefüllt, statt in festen Intervallen zurückgesetzt zu werden. Auf der Abo-Seite ist die Obergrenze kein 429: „Claude Code blocks further requests until the reset time shown in the message.“ Für API-Keys, Cloud-Hosting und Pay-as-you-go sagt die Dokumentation, dass die Nutzung dort pro Anfrage gemessen wird, es also kein Zurücksetzen gibt, auf das man warten müsste – es gibt nichts auszusitzen. Unser eigener Key erlaubt eine Parallelität von 5 (Stand 2026-09-22); Warten in der Warteschlange ist keine Sperre (geprüft am 2026-09-22).
Wie schätze ich die tatsächlichen Kosten eines parallelen Laufs ab?
Folgen Sie dem obigen Drei-Schritte-Beispiel und beachten Sie dann drei Einschränkungen. Erstens: Stückpreise sind datiert – die offizielle Preisseite selbst nennt „Price and plans are subject to change at Anthropic's discretion“, und die Cache-Stufe trägt den Hinweis „Prompt caching pricing reflects 5-minute TTL“. Zweitens: Prüfen Sie Treffer selbst: „Cache hits require 100% identical prompt segments“, ein abweichendes Byte im Präfix bedeutet also keinen Treffer. Drittens: Gleichen Sie nicht mit dem Orchestrator ab: Er deckt 6 Anbieter ab (Claude Code, Codex, Gemini, OpenCode, Kimi Code, MiniMax), liest die Buchführung, die jeder Agent auf die lokale Festplatte schreibt („No API calls, no extra auth“), seine Kostenzeile ist keine Live-Rechnung des Anbieters, und die Dokumentation sagt „Prefer the provider console for authoritative spend“. Bei einem Konto teilen sich claude.ai, Claude Code und Desktop ein Kontingent, Sie stellen also die Rechnung des Anbieters oder des Keys zusammen, keine Summe von Statusleisten (geprüft am 2026-09-22).
Quellen
Offiziell von Anthropic: https://claude.com/pricing (die Zeilen 700 bis 710 des erfassten Texts bilden den Sonnet-5-Block; 121 und 724 enthalten die Hinweise zu Änderungsvorbehalt und TTL); https://code.claude.com/docs/en/errors, /costs, /agent-teams, /workflows, /statusline, /interactive-mode, /sub-agents; https://platform.claude.com/docs/en/api/rate-limits; https://platform.claude.com/docs/en/build-with-claude/prompt-caching; Help-Center-Artikel 11049741, 11647753, 12005017, 9797557. Orchestrator eines Drittanbieters: https://www.onorca.dev/docs/agents/usage-tracking. Auf dieser Website: https://qcode.cc/pricing, /enterprise, /api-key-usage-query-guide, /claude-code-cost-optimization, /multi-tool-quota-rotation. Alle erfasst am 2026-09-22; jede externe Aussage hier hat einen datierten Rohmitschnitt und einen wortgetreuen Anker, den Sie anhand des auf der Seite angegebenen Datums erneut prüfen können.
Stückpreise und Parallelität abgleichen
Stückpreise und Formulierungen der Limits wurden hier am 2026-09-22 geprüft; Token-Volumen, Anzahl der Agents und Anzahl der Runden im Beispiel sind die ausdrücklich genannten eigenen Annahmen dieser Seite. Nichts hier verspricht, dass ein Wechsel von Konten oder Modellen einen Lauf am Laufen hält oder dass das Befolgen der Rechnung Geld spart – setzen Sie Ihr eigenes gemessenes Präfix ein, um neu zu rechnen.
Weiterführende Lektüre
Kontingentrotation über mehrere Tools, regelkonform
Jedes Tool hat seinen eigenen Kontingentmechanismus; Rotation und ihre Compliance-Grenzen werden dort beschrieben, diese Seite fügt kein zweites Regelwerk hinzu.
Abfrage von API-Key-Nutzung und -Ablauf
So fragen Sie Ablauf, heutige Nutzung, Monatskontingent und Auslastung Ihrer Keys ab: drei schreibgeschützte Endpunkte.
Leitfaden zur Orca-Entwicklungsumgebung für Agents
Was es ist, was es nicht ist, wie es Agents in getrennten Worktrees ausführt, dazu Installationsschritte und Fallstricke bei Namenskollisionen.
Diese Seite gibt Dokumentation wieder, die von Anthropic und von einem Drittanbieter-Orchestrator veröffentlicht wurde; wir sind mit keinem von beiden verbunden und werden von keinem empfohlen. Modellpreise, Formulierungen der Limits, Abdeckung und Verhalten der Statusleiste sind durch die am 2026-09-22 erfassten Texte begrenzt, und die offizielle Preisseite behält sich selbst vor, Preise und Tarife zu ändern. Token-Volumen, Anzahl der Agents und Anzahl der Runden im durchgerechneten Beispiel sind die ausdrücklich genannten eigenen Annahmen dieser Seite; nur Stückpreise und Multiplikatoren haben eine Quelle. Aussagen aus der Community über eine um ein Vielfaches höhere Rechnung konnten in den hier erfassten offiziellen Texten nicht verifiziert werden; sie bleiben daher Community-Feedback und werden nicht als Kostenaussagen formuliert. QCode ist ein Anbieter für den eigenen Key der Leserin bzw. des Lesers und ist nicht für das Verhalten oder die Anzeigen eines Drittanbieter-Orchestrators verantwortlich (geprüft am 2026-09-22).