AI-Agent-Evals & Readiness-Harness
Von der Demo zur Produktion · 7 Evaluationsdimensionen · 4 Harness-Muster · CI-Integration
Warum Evals der größte Flaschenhals beim Agenteneinsatz sind
Im Jahr 2026 ist die größte Hürde in KI-Agenten-Projekten nicht die Modellauswahl – es ist das Phänomen „in der Demo lauffähig, drei Tage später in der Produktion kaputt“. Branchendaten zeigen, dass 68 % der Agenten-Projekte in der Evaluationsphase stecken bleiben: Ohne wiederholbare Evals leitet niemand echten Nutzer-Traffic über den Agenten. Evals plus ein Readiness-Harness sind das Engineering-Fundament, das einen Agenten-Demo in ein Produktivsystem verwandelt.
Sieben Evaluationsdimensionen
Vier Readiness-Harness-Muster
Sandbox-Modus
Evals in einer isolierten Umgebung für PR-Prüfungen / nächtliche Jobs ausführen – ohne Auswirkungen auf die Produktion
Shadow-Modus
Der neue Agent erhält parallel zum alten Agenten echten Traffic, antwortet jedoch nicht an die Nutzer; Ausgabe-Differenzen werden verglichen
Canary-Modus
Der neue Agent übernimmt 1–5 % des Traffics, alle 7 Dimensionen werden überwacht, automatisches Rollback bei Überschreitung der Schwellenwerte
Gated-Modus
Die Evals-Suite als verpflichtendes CI-Gate definieren – jede Regression blockiert den Merge
CI-Integration
Binden Sie Ihre Evals-Suite in GitHub Actions / GitLab CI ein: Jeder PR führt 200–500 Testfälle gegen die Main-Branch-Baseline aus. Sowohl Claude Code als auch Codex CLI unterstützen den Schalter --eval-mode, der strukturiertes JSON erzeugt – einfach in Grafana oder Datadog einzubinden.
Explosion der Eval-Kosten bewältigen
Enterprise-Nutzer fragen oft: „Die Evals-Suite kostet jeden Monat ein Vermögen – 1.000 Fälle × täglich × 4 Agent-Versionen = 120.000 API-Aufrufe pro Monat.“ Zwei Antworten: (1) Wechseln Sie zu einem API-Abonnement-Dienst mit einheitlicher Abrechnung und planbarem Budget – z. B. enthält das QCode.cc Enterprise-Abo ein dediziertes Evals-Kontingent; (2) Caching + Sampling – nachts vollständiger Satz, bei PR-Prüfungen eine priorisierte Teilmenge.
Verhältnis zum Harness Engineering
Harness Engineering ist der makroskopische Systementwurf – Constraints, Feedback-Loops, Lifecycle, Kontext. Der Readiness-Harness ist die Feedback-Loop-Teilmenge, fokussiert auf die einzelne Entscheidung: „Darf dieser Agent in die Produktion?“ Sie verstärken sich gegenseitig: Ein gut entworfener Harness ermöglicht präzise Evals-Diagnosen; ausgereifte Evals lassen den Harness kontinuierlich weiterentwickeln.
Betreiben Sie Ihre Evals-Suite auf QCode.cc Enterprise
Claude Fable 5 · GPT-5.5 · dediziertes Evals-Kontingent · planbares monatliches Budget