# Aus einem Lasttest ein Freigabegate machen Typ: Checkliste Herkunft: llm-production-ops / cost-capacity-control / ops-loadtest-gate Version: ops-loadtest-gate-2026-09-04 Geprüft: 2026-09-04 ACHTUNG: Dieses Dokument ist ein Lernartefakt aus einer Schulungssequenz. Es ist kein produktives Runbook. Vor jeder Anwendung in einer realen Umgebung müssen die Schritte gegen lokale Dokumentation, Runbooks und Freigabestatus geprüft werden. ## Szenario Vor einem Launch soll der Test nicht bloß einen maximalen Requests-pro-Sekunde-Wert liefern, sondern eine belastbare Betriebsgrenze für gemischte Promptlängen und Antwortbudgets. ## Schritte 1. Produktionsnahes Lastprofil und Arbeitsmaße wie Input- und Output-Tokens festlegen 2. Akzeptanzgrenzen für Tail-Latenz, Fehler, Queue und Kosten definieren 3. Last kontrolliert steigern, bis zuerst eine Akzeptanzgrenze oder Sättigung erreicht wird 4. Grenzbereich und Erholungsverhalten mit gleichem Artefakt wiederholen 5. Tragfähigen Arbeitspunkt samt Reserve, Versionen und Messergebnissen festschreiben ## Begründung Warum: Ein Kapazitätswert ist nur zusammen mit Arbeitsverteilung, Qualitätsgrenzen und reproduzierbarer Systemversion aussagekräftig. Folgen: **+** Der Launch erhält eine überprüfbare Admission- und Reservegrenze. **−** Repräsentative Tests verbrauchen reale Inferenzkapazität und müssen nach wesentlichen Änderungen wiederholt werden. ## Quellen 1. Google SRE Workbook, Managing Load — https://sre.google/workbook/managing-load/ 2. Google SRE Book, Addressing Cascading Failures — https://sre.google/sre-book/addressing-cascading-failures/ 3. Google SRE Workbook, Implementing SLOs — https://sre.google/workbook/implementing-slos/ 4. Prometheus Instrumentation — https://prometheus.io/docs/practices/instrumentation/