Tooling · 2026-08-30

Warp Custom Inference
OpenAI Chat Completions, öffentliche URL

Stand 2026-08-30 dokumentiert Warp Custom Inference mit OpenAI-kompatibler Schnittstelle (POST /v1/chat/completions). Als Nächstes: Einstellungen → nach „inference endpoint“ suchen, https://api.qcode.cc/v1 und einen QCode-Key einfügen, eine Modell-ID aus /models kopieren und dann genau dieses Modell auswählen – nicht Auto.

Aktualisiert 2026-08-30

#warp#custom inference#BYOK#OpenAI-compatible

Kurzfassung

/v1/chat/completions

Protokoll, das der Endpunkt implementieren muss

Offiziell: Ein Custom-Inference-Endpunkt muss die OpenAI Chat Completions API implementieren.

0

Warp-AI-Credits, wenn dieses Modell ausgewählt ist

Offiziell: Die Auswahl eines über den Endpunkt gerouteten Modells verbraucht keine Warp-AI-Credits; der Endpunkt rechnet die Inferenz ab. Auto verbraucht weiterhin Warp-Credits.

Öffentliches HTTPS

Netzwerkregel

Offiziell: Anfragen laufen über die Server von Warp, daher werden localhost und private URLs abgelehnt. https://api.qcode.cc/v1 ist öffentliches HTTPS.

2026-08-30

Dokumentation abgerufen

Seiten docs.warp.dev custom-inference-endpoint und BYOK, abgerufen am 2026-08-30.

Was Custom Inference ist

Warp ist ein Terminal mit Agent. Laut offizieller Dokumentation bedeutet ein Custom-Inference-Endpunkt, den Agent auf eine öffentliche URL unter Ihrer Kontrolle zu richten, die OpenAI Chat Completions implementiert (OpenRouter, LiteLLM, z.ai, ein internes Gateway). Das ist nicht dasselbe Einstellungselement wie BYOK für OpenAI/Anthropic/Google direkt. Cloud Agents können lokal gespeicherte benutzerdefinierte Endpunkte nicht sehen.

Wonach weiterhin gesucht wird

Im August 2026 spricht das Warp-Konto weiterhin von BYOK und Custom Inference; ein Warp-Entwickler schrieb am 2026-08-13, dass Custom-Inference-URLs für den Agent im Warp-Terminal funktionieren, die CLI aber noch in Arbeit ist. Diese Website hatte bisher keine Warp-Seite. Hier: wie der offizielle Endpunkt hinzugefügt wird und dass Sie nach dem Einfügen von QCode nicht auf Auto klicken sollten.

Zeitleiste

2026-05-20

Der Warp-Blog kündigte BYOK im Free-Tarif sowie Custom-Inference-Endpunkte an, die mit OpenAI Chat Completions kompatibel sind.

Dokumentation im aktuellen Stand

Einstellungen, nach „inference endpoint“ suchen: Base URL, die /v1/chat/completions bereitstellt, Zugangsdaten, Modell-IDs. Wenn Sie dieses Modell auswählen, werden keine Warp-AI-Credits verbraucht.

2026-08-30

Dieser Abruf verlangt weiterhin eine öffentliche URL; localhost wird abgelehnt. Auto verbraucht immer Warp-Credits. Keys liegen im lokalen Schlüsselbund und laufen während der Anfrage über das Warp-Backend; laut offiziellem Text werden sie nicht auf Warp-Servern gespeichert.

Bestätigt vs. Stolperfallen

Bestätigt

Custom Inference ist im Free-Tarif und in berechtigten kostenpflichtigen Tarifen verfügbar (Einzelpersonen / Organisationen mit bis zu 10 Personen laut Warp-Bedingungen). Protokoll: OpenAI Chat Completions. Die Auswahl dieses Modells verbraucht keine Warp-AI-Credits. Dokumentation vom 2026-08-30.

Stolperfallen

Offiziell: Auto verbraucht weiterhin Warp-Credits. localhost wird abgelehnt. Cloud Agents können einen lokal gespeicherten benutzerdefinierten Endpunkt nicht verwenden und verbrauchen weiterhin Warp-Credits. Ein ChatGPT- oder Claude-Verbraucher-Abo kann nicht als Warp-BYOK verbunden werden; verwenden Sie einen API-Key.

Custom Endpoint vs. BYOK direkt beim Anbieter

Custom Inference (diese Seite)

Jede öffentliche OpenAI-kompatible URL. Für QCode: https://api.qcode.cc/v1.

BYOK direkt beim Anbieter

Nur Konten von OpenAI / Anthropic / Google. Gateways, LiteLLM und QCode nutzen das Custom-Inference-Element, nicht die BYOK-Felder der direkten Anbieter.

So gehen Sie weiter vor

Öffnen Sie in Warp die Einstellungen und suchen Sie nach „inference endpoint“. Endpoint URL: https://api.qcode.cc/v1 (stellt /v1/chat/completions bereit). API-Key: Ihr QCode-Key. Modell-ID: aus /models kopieren. Speichern Sie und wählen Sie dann dieses Modell in der Auswahl – nicht Auto.

Bei QCode

https://api.qcode.cc/v1 ist ein öffentlicher OpenAI-kompatibler Endpunkt und erfüllt damit die Warp-Regel „muss öffentlich erreichbar sein“. Die aktuellen Modell-IDs stehen unter /models. Bei Business/Enterprise können lokale Agent-Läufe weiterhin Warp-Plattform-Credits verbrauchen – das ist der Plattformzähler von Warp, nicht die Preisliste von QCode.

FAQ

Kann Warp mit einem Gateway wie QCode arbeiten?

Ja. Offizielle Custom Inference ist für OpenAI-kompatible URLs wie OpenRouter, LiteLLM und interne Gateways gedacht.

Kann ich localhost verwenden?

Die offizielle Dokumentation lehnt localhost und private URLs ab, weil Anfragen über die Server von Warp laufen. Stellen Sie zuerst eine öffentliche HTTPS-URL bereit.

Warum verbraucht Auto weiterhin Warp-Credits?

Offiziell: Auto hängt vom Routing von Warp ab und verbraucht daher immer Warp-Credits, auch wenn ein benutzerdefinierter Endpunkt konfiguriert ist. Um Ihren Endpunkt zu nutzen, wählen Sie dieses Modell in der Auswahl.

Kann ich ChatGPT Plus in Warp einbinden?

Offizielle BYOK-Seite: Ein ChatGPT- oder Claude-Verbraucher-Abo kann nicht mit Warp verbunden werden. Verwenden Sie einen API-Key und bezahlen Sie den Anbieter.

Speichert Warp meinen Key?

Offiziell: Er wird im lokalen Schlüsselbund gespeichert und während der Anfrage über das Warp-Backend gesendet, um Ihren Endpunkt aufzurufen, danach verworfen und nicht auf Warp-Servern gespeichert.

Woher stammen Modell-IDs?

Aus dem Live-Katalog unter /models.

Quellen

Benutzerdefinierter Inferenz-Endpunkt von Warp (docs.warp.dev/agents/inference/custom-inference-endpoint/) und Bring Your Own API Key, abgerufen am 2026-08-30. Ankündigungsbeitrag: warp.dev/blog/bring-your-own-inference-to-warp (2026-05-20).

Benutzerdefinierten Endpunkt in Warp hinzufügen

Öffentliche URL https://api.qcode.cc/v1. Wählen Sie dieses Modell, nicht Auto.

Weiterführend

Nicht mit Warp verbunden. Das Verhalten folgt docs.warp.dev. Diese Seite ist keine Anleitung, um die Authentifizierung von Warp oder eines Modellanbieter-Abos zu umgehen.

Erst testen, dann entscheiden

Unsicher bei der Tarifwahl? Beginnen Sie mit Starter ($8.57/Monat) und wechseln Sie auf einen höheren Tarif, wenn Sie zufrieden sind — der ungenutzte Wert des alten Tarifs geht auf Ihr Guthaben zurück.