Reliabilität beginnt bei Nutzerwirkung
Einführung · 4 Abschnitte · ~8 Min Lesezeit · Stand
Messen, was Nutzer merken
Ein Dienst kann Infrastrukturmetriken im grünen Bereich haben und trotzdem sein Nutzerziel verfehlen. Ein SLI misst beobachtbares Serviceverhalten; ein SLO setzt dafür ein bewusstes Ziel. Erst dann ist klar, was ein Alarm schützen soll.
Signale beantworten verschiedene Fragen
| Signal | Frage |
|---|---|
| Metrik | Wie entwickelt sich eine aggregierte Größe? |
| Trace | Welchen Weg nahm diese Anfrage? |
| Log | Welches diskrete Ereignis trat ein? |
| Profil | Welcher Code verbraucht Ressourcen? |
Korrelation macht die Signale wertvoll: eine Fehlerrate ohne Trace erklärt selten, warum sie steigt.
Alarm ist ein Handlungsauftrag
Ein Alarm sollte eine dringliche, entscheidbare Nutzerwirkung anzeigen und einen Besitzer haben. Rauschen, das niemand sinnvoll bearbeitet, nimmt Aufmerksamkeit von echten Incidents.
Nächste Checks
- Einen SLI aus einer Nutzeraufgabe ableiten
- Trace, Log und Metrik passend kombinieren
- Ein Alert- und Incident-Signal von Diagnosematerial trennen