GA auf Bedrock · dasselbe Modell über Aggregatoren aufrufbar

Kimi K3 auf Amazon Bedrock: Preise, Caching und drei Wege zum Aufruf

AWS hat Moonshots Kimi K3 am 2026-09-18 auf Bedrock allgemein verfügbar gemacht: 1M Kontext, native Bildverarbeitung, $3 Input / $15 Output pro Million Tokens am Global-Endpunkt, Cache-Lesen $0.30, Cache-Schreiben $3.75, unter der ID moonshotai.kimi-k3. Diese Seite stellt die Formulierungen von AWS den beiden anderen Wegen gegenüber – Moonshots eigener API und einem Aggregator –, denn die Gewichte sind dieselben; die Unterschiede liegen bei Rate Limits, Cache-Abrechnung und Betrieb.

Aktualisiert 2026-09-20

#1M Kontext#explizites Caching#native Bildverarbeitung#GA 2026-09-18

Vier harte Zahlen aus der AWS-Dokumentation

$3/$15

Input/Output pro Million Tokens

Preise laut Bedrock-Modellkarte: Global CRIS $3.00 Input / $15.00 Output; US CRIS liegt 10 % höher ($3.30/$16.50). Dies ist die Tabelle von AWS, nicht Moonshots Listenpreis und kein QCode-Tarif.

$0.30

Cache-Lesen (pro Million Tokens)

Gleiche Tabelle, Zeile Global CRIS: Cache-Lesen $0.30, Cache-Schreiben (30 Min.) $3.75; in der Zeile US CRIS sind es $0.33 und $4.125. Die Karte ergänzt, dass ein expliziter Cache-Checkpoint mindestens 1,024 Tokens benötigt, mindestens 30 Minuten aufbewahrt wird und derzeit nur über die Responses und Chat Completions APIs verfügbar ist.

1M

Kontextfenster

Die Karte nennt als Kontextfenster 1M Tokens, ausgelegt für lang laufende Arbeiten an großen Repos und Dokumenten. Ihre Modalitätsmatrix ist anhand der Häkchen zu lesen, nicht anhand der Zeilenbeschriftungen: Auf der Eingabeseite sind nur Text und Bild abgehakt, Audio, Sprache und Video nicht; auf der Ausgabeseite ist nur Text abgehakt (Embedding, Bild, Sprache und Video nicht) – auf Bedrock gibt es also nur Text als Ausgabe: Bilder gehen hinein, kommen aber nie heraus.

1024

Mindestanzahl Tokens pro Cache-Checkpoint

Kürzere Präfixe werden nie zu einem Checkpoint. Implizites (automatisches) Caching ist standardmäßig aktiv; laut AWS kann die Konfiguration von explizitem Caching die Trefferquote erhöhen und damit Latenz und Kosten senken.

Was K3 ist und was sich durch Bedrock ändert

Die AWS-Karte nennt K3 Moonshots „leistungsfähigstes Open-Weight-Modell“: native Bildverarbeitung plus 1M Kontextfenster, seit 2026-09-18 als moonshotai.kimi-k3 auf Bedrock GA. Geändert wird nicht das Modell, sondern die Zugriffsschicht: AWS-Endpunkte und -Kontingente, IAM und Audit-Logs, Region und CRIS-Stufen, eine EOL-Ankündigung mit 45 Tagen Vorlauf und eine AWS-Preisliste. Explizites Prompt Caching ist das Hauptmerkmal – AWS nennt es das erste Open-Weight-Modell mit explizitem Caching auf Bedrock. Parameterzahlen, die in der Community kursieren (2.8T), und Trainingsdetails gehören zu Moonshots eigenen Angaben, und diese Seite legt sie AWS nicht in den Mund.

Release-Rhythmus

2026-09-18: Der AWS-Beitrag „What's New“ mit dem Titel „Kimi K3 by Moonshot AI is now generally available on Amazon Bedrock“ erschien zusammen mit einer Modellkarte, die Preise, Modalitäten und eine Endpunktempfehlung enthält (bedrock-runtime für neue Apps, Chat Completions für K3). Prüfdatum dieser Seite, 2026-09-20: Preise und Cache-Parameter sind aus der Fassung der Karte von diesem Tag übernommen; prüfen Sie sie erneut, bevor Sie sie langfristig zitieren.

Drei Daten

2026-09-18

2026-09-18: AWS gibt die allgemeine Verfügbarkeit von Kimi K3 auf Bedrock bekannt; die Modellkarte nennt 1M Kontext, Global- und US-Preise sowie Parameter für explizites Caching, und ihre Modalitätsmatrix hakt Text und Bild für die Eingabe und nur Text für die Ausgabe ab.

2026-09-20

2026-09-20: Diese Seite prüft den QCode-Katalog: kimi-k3 ist mit bepreisten Aufrufen in den letzten 30 Tagen gelistet, der Weg über einen Aggregator ist also mit dem AWS-Weg vergleichbar und nicht hypothetisch.

2026-09-10

Referenz vom 2026-09-10: Der SWE-2-Beitrag von Cognition gibt an, dass es auf Kimi K3 (2.8T) nachtrainiert wurde, und veröffentlicht K3s eigene Coding-Werte – K3 war in diesen zwei Wochen das Basismodell, auf dem alle aufbauen.

Dokumentiert vs. noch nicht belegbar

In der AWS-Dokumentation belegt

Stand der Modellkarte vom 2026-09-20: GA-Datum, Modell-ID, 1M Kontext, die vier Preiszeilen (Input, Output, Cache-Lesen, Cache-Schreiben) einschließlich des US-Aufschlags von 10 %, das Minimum von 1,024 Tokens und die Aufbewahrung von mindestens 30 Minuten beim expliziten Cache, die Beschränkung auf Responses/Chat Completions, der empfohlene Endpunkt und die EOL-Ankündigung mit mindestens 45 Tagen Vorlauf – alles aus dieser Modellkarte.

Nicht als Fakt formulieren

Stand 2026-09-20 ist „First open-weight model with explicit prompt caching“ die Formulierung von AWS und bezieht sich auf Bedrock, nicht auf die Branche. Parameterzahl (2.8T), Ranglistenplätze und „stärkste offene Gewichte“ sind Aussagen von Moonshot oder Dritten. AWS-Preise ändern sich mit Region und CRIS-Stufe, und die Modellkarte nennt oberhalb von Standard zwei weitere Service-Tiers: Priority wird mit dem 1.75-Fachen und Flex mit dem 0.5-Fachen des Standard-Preises pro Token abgerechnet; Enterprise-Konditionen, Obergrenzen für Parallelität und Compliance-Zonen wurden nicht geprüft und werden hier nicht abgeleitet.

Bedrock vs. Einstiegspunkt über einen Aggregator

Amazon Bedrock (AWS-Bedingungen)

moonshotai.kimi-k3; Global $3/$15, US $3.30/$16.50, Cache-Lesen $0.30 / Schreiben $3.75. Sie erhalten IAM, Audit-Logging, Regionswahl und eine EOL-Ankündigung mit 45 Tagen Vorlauf, doch explizite Caching-Checkpoints sind Ihre Aufgabe, und die Rechnung geht an AWS.

Aggregator (QCode)

Dieselbe Modellfamilie ist bei QCode als kimi-k3 gelistet (geprüft am 2026-09-20, mit abgerechneten Aufrufen in den letzten 30 Tagen): ein OpenAI-kompatibler Aufruf, bei dem sich nur die Modell-ID ändert, ohne regionale Preisaufteilung und ohne manuelle Cache-Checkpoints; Cache-Verhalten und Abrechnung richten sich nach unserer Preisseite. Aktuelle Preise und Limits stammen von /pricing und aus dem Live-Katalog.

Den richtigen Weg wählen: drei Prüfpunkte

Erstens: Wo liegen die Rechnung und die Compliance-Grenze? Wenn RAG und Agenten bereits in AWS laufen und Sie Datenresidenz oder eine einzige Rechnung benötigen, ist Bedrock die naheliegende Seite; wenn Sie von einer Stelle aus zwischen Modellen wechseln möchten, ist ein Aggregator im Betrieb günstiger. Zweitens: Wie Sie Caching nutzen. Auf Bedrock müssen Sie lange Präfixe zu Checkpoints von ≥1,024 Tokens formen und innerhalb von 30 Minuten wiederverwenden; der Nutzen zeigt sich unmittelbar bei $0.30. Wer den Cache als Magie betrachtet, zahlt auf beiden Wegen den vollen Input-Preis. Drittens: Modalität und Endpunkt. Auf Bedrock nimmt K3 Text und Bilder entgegen und liefert ausschließlich Text zurück – die Modellkarte hält ausdrücklich fest: „Video inputs are not supported“. Mehrstufige Aufrufe über Converse lösen eine InternalServerException aus, wenn frühere Reasoning-Blöcke enthalten sind (die Standard-Setups von LangChain / Strands laufen hier hinein). Deshalb bevorzugt AWS die OpenAI-kompatiblen Responses- / Chat-Completions-APIs; bei gemischten Text-und-Bild-Anfragen empfiehlt die Karte, Bildblöcke vor Textblöcken zu platzieren.

Die Lage bei QCode

kimi-k3 ist im Modellkatalog von QCode enthalten (geprüft am 2026-09-20) und wurde in den letzten 30 Tagen mit echten, abgerechneten Aufrufen genutzt; der Aufruf erfolgt wie bei anderen Modellen durch Austausch der Modell-ID. Diese Seite nennt bewusst keinen QCode-Stückpreis für K3 – Preis, Cache-Abrechnung und Rate Limits stammen von /pricing und aus dem Live-Katalog. Um AWS mit einem Aggregator zu vergleichen, führen Sie dieselbe Prompt-Vorlage auf beiden aus, messen die Cache-Trefferquote und lesen anschließend die beiden Rechnungen.

Fragen

Ist K3 auf Bedrock dasselbe Modell wie die eigene API von Moonshot?

Dieselbe Gewichtsfamilie, aber eine andere Zugriffsschicht: AWS veröffentlicht es als moonshotai.kimi-k3 mit eigenen Preisen, eigener Caching-Semantik, eigenen Limits und eigenen Compliance-Bedingungen. Verhalten und Abrechnung sind daher nicht identisch mit dem gehosteten Endpunkt von Moonshot.

Kostet der 1M-Kontext extra?

Die Karte nennt 1M als Kontextfenster ohne separaten Aufschlag für langen Kontext, aber jedes Input-Token wird berechnet, sofern es nicht aus dem Cache bedient wird (Lesen $0.30, Schreiben $3.75) – wie Sie lange Präfixe wiederverwenden, bestimmt die tatsächlichen Kosten.

Was erfordert explizites Caching tatsächlich?

Laut Dokumentation: mindestens 1,024 Tokens pro Checkpoint, Aufbewahrung für mindestens 30 Minuten, und nur über die Responses- und Chat-Completions-APIs. Platzieren Sie den stabilen Präfix zuerst und den variablen Teil zuletzt.

Worin ist K3 stark, und wo liegen die Schwächen?

Tabellen des Herstellers und von Dritten sehen es bei Coding mit langem Kontext und bei visuellem Input vorn; die Schwäche müssen Sie an Ihren eigenen Aufgaben messen. Als Referenz: Laut der Tabelle von Cognition vom 2026-09-10 erreicht das Basismodell K3 44.2% bei FrontierCode 1.1 Main und 21.5% bei Terminal-Bench 4, gegenüber 50.9% und 55.8% bei Fable 5.1 – eine Herstellertabelle, kein unabhängiges Ranking.

Könnte K3 auf Bedrock eingestellt werden?

Der Lifecycle-Text von AWS für den Eintrag lautet „not sooner than: Not Applicable, at least 45 day EOL Notice will be provided“, ohne festgelegtes EOL-Datum. Das ist eine Ankündigungsfrist, kein Bestandsversprechen.

Kann ich beide Wege nutzen?

Ja, und das ist eine gängige Aufteilung: AWS für Residenz und eine einzige Rechnung, ein Aggregator für den direkten Modellwechsel und Fallbacks. Konfigurieren Sie Limits, Cache-Semantik und Logging getrennt – gehen Sie nicht davon aus, dass sich ein Codepfad auf beiden Wegen identisch verhält.

Quellen

AWS What's New, „Kimi K3 by Moonshot AI is now generally available on Amazon Bedrock“, 2026-09-18, https://aws.amazon.com/about-aws/whats-new/2026/09/moonshot-ai-kimi-k3-on-amazon-bedrock/; Amazon Bedrock User Guide, Modellkarte „Moonshot AI — Kimi K3“, https://docs.aws.amazon.com/bedrock/latest/userguide/model-card-moonshot-ai-kimi-k3.html (beide abgerufen am 2026-09-20). Die zum Vergleich herangezogenen Coding-Werte stammen von Cognition, „Introducing SWE-2“, 2026-09-10, https://cognition.com/blog/swe-2 (eine Herstellertabelle). Der Katalogeintrag bei QCode und die abgerechnete Nutzung der letzten 30 Tage sind eigene Prüfungen.

Vor der Entscheidung an einer Vorlage vergleichen

kimi-k3 ist bei QCode aufrufbar (geprüft am 2026-09-20, abgerechnete Aufrufe in den letzten 30 Tagen); Preise und Limits stammen von /pricing und aus dem Live-Katalog.

Als Nächstes lesen

Nicht mit Amazon oder Moonshot AI verbunden. Preise, Cache-Parameter und Lifecycle-Bedingungen auf AWS-Seite sind aus der am 2026-09-20 abgerufenen Dokumentation übernommen; die Coding-Benchmark-Werte stammen vom Hersteller. QCode stellt Amazon Bedrock nicht bereit und nennt dessen Preise nicht.

Erst testen, dann entscheiden

Unsicher bei der Tarifwahl? Beginnen Sie mit Starter ($8.57/Monat) und wechseln Sie auf einen höheren Tarif, wenn Sie zufrieden sind — der ungenutzte Wert des alten Tarifs geht auf Ihr Guthaben zurück.