LLM Production Ops

SLOs, Incident & On-Call

Der Dienst antwortet mit HTTP 200, aber die fachliche Qualität ist eingebrochen. Ein Infrastrukturmonitor bleibt grün und die Bereitschaft erhält erst Supporttickets. Für probabilistische Dienste müssen Zusage, Alarm, Mitigation und Auswertung dieselbe Nutzerwirkung beschreiben.

~25 Min · 12 Abschnitte Einführung · 8 Übungen (davon 1 Mission)

Modul starten →

Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.

Nur den Lehrtext lesen →

Das kannst du danach

  • Danach kannst du Verfügbarkeit, Tail-Latenz und undegradierte Qualität als messbare SLIs abgrenzen.
  • Du baust handlungsfähige Alarme und Runbooks für verrauschte Qualitätssignale.
  • Du weißt, wie Incident-Schweregrad, Mitigation, Kommunikation und Postmortem ohne vorschnelle Ursachenbehauptung zusammenspielen.

Übungen

  • 1. EntscheidungWorauf definierst du den Verfügbarkeits-SLI?
  • 2. EntscheidungWie gehst du vor?
  • 3. EntscheidungWelche Degradations-Strategie fährst du für die Ausfalldauer?
  • 4. EntscheidungWie baust du den Alarm um?
  • 5. EntscheidungWie stufst du ein und was folgt daraus?
  • 6. ReihenfolgeErste 20 Minuten: Qualitätsalarm im Kundenassistenten
  • 7. EntscheidungWelche Maßnahme gehört stattdessen in die Auswertung?
  • 8. EntscheidungWas ist dein erster Zug?

Arbeitsartefakte

Quellen & Aktualität5 Primärquellen · zuletzt geprüft:
  1. 01Google SRE Workbook, Implementing SLOs
  2. 02Google SRE Workbook, Alerting on SLOs
  3. 03Google SRE Workbook, Incident Response
  4. 04Google SRE Workbook, On-Call
  5. 05Google SRE Book, Postmortem Culture

Verfasst von Julian Zentgraf