Veröffentlicht am 2026-09-10 · nicht bei QCode

Cognition SWE-2: die Anbietertabelle, die Kostenbehauptungen und was fehlt

Cognition hat SWE-2 am 2026-09-10 veröffentlicht und bezeichnet es als ihr fortschrittlichstes Coding-Modell, per Post-Training aus Kimi K3 (2.8T Parameter) entstanden und auf die Pareto-Grenze von Leistungsfähigkeit gegenüber Inferenzkosten ausgerichtet: 50.0% auf FrontierCode 1.1 Main, innerhalb eines Punktes von Fable 5.1 und dabei 64% günstiger. Dieselbe Tabelle zeigt 27.3% auf Terminal-Bench 4. Diese Seite trennt, was der Anbieter aussagt, was er nicht aussagt und was Sie hier ausführen können.

Aktualisiert 2026-09-20

#agentisches Coding#Effort-Stufen#vom Anbieter gemeldet#nicht bei QCode

Vier Zahlen aus der offiziellen Tabelle

50.0%

FrontierCode 1.1 Main

Ihre Worte: achieving 50.0% on FrontierCode 1.1 Main, within one point of Fable 5.1 while being 64% cheaper. Dieselbe Zeile nennt SWE-1.7 42.0%, Kimi K3 44.2%, Grok 4.6 48.0%, Fable 5.1 50.9%, GPT-6 Astra 53.3% - alle vom Anbieter gemeldet.

64%

Behauptete Reduktion gegenüber Fable 5.1

Der Beitrag sagt „being 64% cheaper“. Das ist Cognitions eigener Vergleich: keine Wiederholung durch Dritte und kein veröffentlichter Preis pro Million Tokens dahinter.

27.3%

Terminal-Bench 4 (die schwache Spalte in derselben Tabelle)

Gleiche Zeile: SWE-2 27.3%, Kimi K3 21.5%, Grok 4.6 20.3%, Fable 5.1 55.8%, GPT-5.6 Sol 37.3%, GPT-6 Astra 57.9%, SWE-1.7 7.6%. Cognition hat diese Zeile selbst veröffentlicht; wir lassen sie nicht weg.

2.8T

Parameter des Basismodells (Angabe von Moonshot)

Original: SWE-2 is post-trained from Kimi K3, a 2.8T-parameter model. 2.8T beschreibt das Basismodell K3, nicht die Gesamtgröße von SWE-2; Cognition sagt separat, RL sei bis in den Bereich mehrerer Billionen Parameter skaliert worden.

Was SWE-2 ist

SWE-2 ist das Coding-Modell, das Cognition (das Unternehmen hinter Devin) am 10.09.2026 veröffentlicht hat und das als bisher fortschrittlichstes Coding-Modell des Unternehmens beschrieben wird, mit konkurrenzfähigem agentischem Coding über mehrere Effort-Stufen hinweg. Es wurde nicht von Grund auf trainiert: Laut dem Beitrag ist es auf Basis von Kimi K3, dem Open-Weight-Modell von Moonshot, nachtrainiert, mit RL, das nach Angaben des Unternehmens bei vielen Benchmarks 5-6 Punkte bringt. Es wurde am selben Tag in Devin Desktop und Devin CLI ausgeliefert und wird schrittweise in Devin Web und Fusion ausgerollt. Die Route läuft über Produkt-Abo plus Agent-Orchestrierung - der Beitrag nennt keinen öffentlichen Endpunkt, keinen Preis pro Million Tokens und kein Rate Limit.

Release-Rhythmus

10.09.2026: Cognition veröffentlicht „Introducing SWE-2: Pushing the Pareto Frontier“; die Seitenmetadaten datieren den Beitrag auf den 10.09.2026, und im Text heißt es, das Modell sei ab heute in Devin Desktop und CLI verfügbar, Web und Fusion sollen folgen. Diese Seite wurde am 20.09.2026 geprüft: Dieser Beitrag ist weiterhin die einzige Quelle für die Tabelle, und es gibt keine Reproduktion durch Dritte.

Drei datierte Einträge

2026-09-10

10.09.2026: Cognition veröffentlicht SWE-2. Die offizielle Tabelle nennt 50.0 % auf FrontierCode 1.1 Main, 73.0 % auf DeepSWE 1.1, 92.8 % auf Terminal-Bench 2.1, 27.3 % auf Terminal-Bench 4 und behauptet 64 % niedrigere Kosten als Fable 5.1.

2026-09-10

Im selben Beitrag vom 10.09.2026: SWE-2 ist auf Basis von Kimi K3 (2.8T) mit der Infrastruktur und dem Rezept von SWE-1.7 nachtrainiert, mit RL, bei dem das Unternehmen nach eigener Aussage weiterhin erheblichen Spielraum sieht und das 5-6 Punkte bringt.

2026-09-20

20.09.2026, für diese Seite geprüft: Die Suche im öffentlichen QCode-Modellkatalog nach SWE-2 / Devin / Cognition liefert keinen Treffer. Deshalb behauptet hier nichts, das Modell sei aufrufbar, und die Coding-Links unten führen zu Modellen, die wir tatsächlich verkaufen.

Belegt versus noch nicht sagbar

Was der Beitrag aussagt

Stand 2026-09-20 steht auf dieser Seite weiterhin: die vier Benchmark-Werte (50.0% / 73.0% / 92.8% / 27.3%), 64% günstiger als Fable 5.1, Basismodell Kimi K3 (2.8T), am selben Tag in Devin Desktop und CLI verfügbar, bewertet über mehrere Effort-Stufen. Alles davon sind Aussagen des Anbieters, keine unabhängige Messung.

Nicht als Fakten lesen

Stand 20.09.2026 fehlen folgende Angaben: ein öffentlicher API-Endpunkt und eine Modell-ID, der Preis pro Million Tokens, Rate Limits, Kontextlänge, Trainingsdaten und Lizenz, ob die Gewichte offen sind, Enterprise-Konditionen. Eine in Suchergebnissen kursierende Aussage über einen kostenlosen Monat für Pro/Max/Teams taucht im abgerufenen Beitrag nirgends auf, deshalb wiederholt diese Seite sie nicht. „Nur wenige Punkte hinter GPT-6 Astra bei einem Viertel der Kosten“ ist der Eigenvergleich des Anbieters, und jeder Wert stammt aus der Tabelle von Cognition ohne erneute Messung durch Dritte.

SWE-2 im Vergleich zum Betrieb eines eigenen Coding-Agents

Cognition SWE-2 (innerhalb des Produkts)

Modell plus Devins Agent-Orchestrierung in einem Produkt, vom ersten Tag an in Desktop und CLI verfügbar. Der Kompromiss: Es gibt ein Abo statt einer Abrechnung pro Token. Da weder Endpunkt, Stückpreis noch Rate Limit veröffentlicht sind, lassen sich die Kosten pro Aufgabe nur zu deren Bedingungen berechnen.

Angebotene allgemeine Modelle plus eigenes Harness

Führen Sie Coding-Aufgaben mit Modellen aus, die QCode verkauft: Tauschen Sie die Modell-ID aus, zahlen Sie pro Token und behalten Sie Rate Limits und Rechnungen in Ihrer eigenen Konsole. Der Kompromiss: Orchestrierung, Kontextverwaltung und die Verifikationsschleife müssen Sie selbst aufbauen, und Effort-Stufen lassen sich nur annähern.

Drei Dinge, wenn Sie dasselbe Setup wollen

Erstens die Aufgabenteilung: Der Anbieter bewertet SWE-2 über mehrere Effort-Stufen; ein selbst gebauter Stack hat keine solchen internen Stufen, daher teilen Teams Lokalisieren, Patchen und Testen in getrennte Aufrufe auf und leiten einfache Schritte an günstigere Modelle. Zweitens die Verifikationsschleife: Die konkreteste Formulierung im Beitrag lautet wörtlich „build a flywheel powered by previous checkpoints of SWE-2 that iteratively hardens our verifiers“ - Akteur ist Cognition, die Handlung ist der Aufbau eines Flywheels, und iterativ gehärtet werden die Verifier, nicht ein Modell. Technisch gesprochen: Tests und Lint müssen automatisiert sein, sonst bricht der Wert jedes Modells ein. Drittens die Kostenbehauptungen: 64% ist ein Anbietervergleich, kein Stückpreis. Testen Sie es an Ihren eigenen Repositories und Ihrem Issue-Set, erfassen Sie Tokens und Wiederholungen und lesen Sie dann Ihre Rechnung.

Was bei QCode tatsächlich verfügbar ist

SWE-2 wird nicht angeboten. Am 20.09.2026 liefert der öffentliche QCode-Modellkatalog für SWE-2 / Devin / Cognition 0 Treffer, und auch die Tabelle der abgerechneten Nutzung der letzten 30 Tage führt keines davon auf; deshalb macht diese Seite weder Angaben zur Verfügbarkeit noch zum Preis. Um Coding-Agent-Aufgaben auf abrechenbare Aufrufe zu bringen, besteht die Route aus verkauften allgemeinen Modellen plus Schema-/Tool-Calling mit externer Validierung und Wiederholungen, abgerechnet als offizieller Preis mal Servicesatz; Stückpreise und Rate Limits finden Sie unter /pricing und im Live-Katalog.

Fragen

Kann ich SWE-2 über QCode aufrufen?

Nein. Die Katalogprüfung vom 2026-09-20 findet weder SWE-2 noch einen Cognition- oder Devin-Dienst; es wird nur innerhalb der Devin-Produktlinie bereitgestellt (Desktop, CLI, Web und Fusion werden schrittweise ausgerollt).

Sind diese Benchmark-Werte vertrauenswürdig?

Sie stammen vom Anbieter: Die vier Werte in der offiziellen Tabelle und die Aussage „64% günstiger“ kommen beide aus demselben Cognition-Beitrag, und bis 2026-09-20 wurde keine Wiederholung durch Dritte veröffentlicht. Zugutehalten muss man, dass auch die schwache Spalte enthalten ist: 27.3% auf Terminal-Bench 4.

Wie hängt es mit Kimi K3 zusammen?

Laut Beitrag ist SWE-2 ein Post-Training von Kimi K3 (2.8T); die Basis ist also das Open-Weight-Modell von Moonshot, und Cognition setzt RL obendrauf. K3 selbst schneidet in derselben Tabelle anders ab: 44.2% auf FrontierCode 1.1 Main und 21.5% auf Terminal-Bench 4.

Gibt es eine API, einen Preis, eine Kontextlänge?

Der Beitrag nennt nichts davon: keinen öffentlichen Endpunkt und keine Modell-ID, keinen Preis pro Million Tokens, kein Rate Limit, keine Kontextlänge. Diese Seite leitet sie nicht ab; Teams, die diese Zahlen benötigen, müssen auf den Anbieter warten oder das Produkt-Abo evaluieren.

Welcher Weg passt also für meinen eigenen Coding-Agent?

Das hängt davon ab, ob Sie ein Produkt wollen, das die Schleife für Sie ausführt, oder abrechenbare Aufrufe, bei denen Sie Modellwahl und Kontext steuern. Die zweite Variante gelingt heute mit angebotenen allgemeinen Modellen plus Tool Calling: Modell-ID ändern, pro Token zahlen, Logs und Limits in Ihrer Konsole behalten.

Kann ich die Zahl „64% günstiger“ direkt verwenden?

Nicht als Stückpreis. Es ist Cognitions Vergleich der eigenen Kosten mit Fable 5.1, ohne veröffentlichte Preise und ohne Nachrechnung durch Dritte, und derselbe Satz nennt „within a few points“ von GPT-6 Astra bei einem Viertel der Kosten - ebenfalls die Darstellung des Anbieters. Messen Sie an Ihren eigenen Aufgaben.

Quellen

Cognition, Introducing SWE-2: Pushing the Pareto Frontier, 10.09.2026, https://cognition.com/blog/swe-2 (abgerufen am 20.09.2026); der QCode-Katalog und die Nutzungszahlen stammen aus unserer eigenen internen Prüfung (Snapshot des öffentlichen Produktionskatalogs plus Tabelle der abgerechneten Nutzung der letzten 30 Tage). Alle Werte und Prozentangaben hier sind vom Anbieter gemeldet.

Das Agent-Produkt überspringen und Coding-Arbeit trotzdem über abrechenbare Aufrufe ausführen

SWE-2 ist nicht in unserem Katalog (geprüft am 2026-09-20); nutzen können Sie angebotene allgemeine Modelle plus Tool Calling, abgerechnet pro Token.

Als Nächstes lesen

Keine Verbindung zu Cognition oder Moonshot AI. Jeder Wert, jede Prozentangabe und jede Trainingsbeschreibung hier gibt den am 2026-09-20 abgerufenen Cognition-Beitrag sinngemäß wieder und stammt vom Anbieter; QCode bietet SWE-2 nicht an und bewertet das Produkt Devin nicht.

Erst testen, dann entscheiden

Unsicher bei der Tarifwahl? Beginnen Sie mit Starter ($8.57/Monat) und wechseln Sie auf einen höheren Tarif, wenn Sie zufrieden sind — der ungenutzte Wert des alten Tarifs geht auf Ihr Guthaben zurück.