SLOs, Incident & On-Call
Der Dienst antwortet mit HTTP 200, aber die fachliche Qualität ist eingebrochen. Ein Infrastrukturmonitor bleibt grün und die Bereitschaft erhält erst Supporttickets. Für probabilistische Dienste müssen Zusage, Alarm, Mitigation und Auswertung dieselbe Nutzerwirkung beschreiben.
~25 Min · 12 Abschnitte Einführung · 8 Übungen (davon 1 Mission)
Modul starten →
Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.
Das kannst du danach
- ✓Danach kannst du Verfügbarkeit, Tail-Latenz und undegradierte Qualität als messbare SLIs abgrenzen.
- ✓Du baust handlungsfähige Alarme und Runbooks für verrauschte Qualitätssignale.
- ✓Du weißt, wie Incident-Schweregrad, Mitigation, Kommunikation und Postmortem ohne vorschnelle Ursachenbehauptung zusammenspielen.
Übungen
- 1. EntscheidungWorauf definierst du den Verfügbarkeits-SLI?
- 2. EntscheidungWie gehst du vor?
- 3. EntscheidungWelche Degradations-Strategie fährst du für die Ausfalldauer?
- 4. EntscheidungWie baust du den Alarm um?
- 5. EntscheidungWie stufst du ein und was folgt daraus?
- 6. ReihenfolgeErste 20 Minuten: Qualitätsalarm im Kundenassistenten
- 7. EntscheidungWelche Maßnahme gehört stattdessen in die Auswertung?
- 8. EntscheidungWas ist dein erster Zug?
Arbeitsartefakte
- ↓Erste 20 Minuten: Qualitätsalarm im Kundenassistentenops-runbook-triage-2026-09-04 · geprüft: 2026-09-04
Quellen & Aktualität5 Primärquellen · zuletzt geprüft:
Verfasst von Julian Zentgraf