physar / Observability & SRE / SRE Foundations

SRE Foundations

Serviceziele, Telemetrie, Alarmierung und Incident-Lernen für allgemeine Softwaresysteme.

Reliabilität beginnt bei Nutzerwirkung

Einführung · 4 Abschnitte · ~8 Min Lesezeit · Stand

Messen, was Nutzer merken

Ein Dienst kann Infrastrukturmetriken im grünen Bereich haben und trotzdem sein Nutzerziel verfehlen. Ein SLI misst beobachtbares Serviceverhalten; ein SLO setzt dafür ein bewusstes Ziel. Erst dann ist klar, was ein Alarm schützen soll.

NutzerwirkungSignalSLI · Log · TraceEntscheidungOwner + GrenzeHandelnBeobachten, begrenzen, wiederherstellen und die Wirkung erneut am Nutzerziel prüfen.
Ein SLI wird erst wirksam, wenn sein Signal eine verantwortete Entscheidung und eine messbare Nutzerwirkung verbindet.

Signale beantworten verschiedene Fragen

SignalFrage
MetrikWie entwickelt sich eine aggregierte Größe?
TraceWelchen Weg nahm diese Anfrage?
LogWelches diskrete Ereignis trat ein?
ProfilWelcher Code verbraucht Ressourcen?

Korrelation macht die Signale wertvoll: eine Fehlerrate ohne Trace erklärt selten, warum sie steigt.

Alarm ist ein Handlungsauftrag

Ein Alarm sollte eine dringliche, entscheidbare Nutzerwirkung anzeigen und einen Besitzer haben. Rauschen, das niemand sinnvoll bearbeitet, nimmt Aufmerksamkeit von echten Incidents.

Nächste Checks

  • Einen SLI aus einer Nutzeraufgabe ableiten
  • Trace, Log und Metrik passend kombinieren
  • Ein Alert- und Incident-Signal von Diagnosematerial trennen

Gelesen ist nicht geprüft: Im Modul entscheidest du die Fälle selbst und siehst danach, wo dein Urteil trägt.

2 Checks starten →

Modul-Aufbau

EINFÜHRUNGReliabilität beginnt bei Nutzerwirkung~8 Min
ADR-001SLI-SLOsolide
FLOW-002MISSION · ALERTINGsolide

Quellen

  1. 01OpenTelemetry: Observability Primer
  2. 02Google SRE Workbook

Verfasst von Julian Zentgraf