← Monitoring, Troubleshooting & Incident Operations
Diagnose und Incident-Führung
Vom unscharfen Alarm zur belegten Fehlergrenze und kontrollierten Wiederherstellung.
Lehrtext · 4 Abschnitte · zuletzt geprüft: 2026-07-29
Die Betriebsfrage
Signale in belastbare Betriebsentscheidungen übersetzen: SLIs, Alerts, Zeitlinien, Hypothesentests und koordinierte Incident-Reaktion.
LernzielDu kannst Alerts nach Wirkung priorisieren, eine gemeinsame Zeitlinie herstellen und Diagnose von risikoreicher Remediation trennen.
Das Entscheidungsmodell
- Impact
- Betroffene Benutzer, Funktionen und SLOs bestimmen.
- Timeline
- Zeitquellen, Deployments und Signale korrelieren.
- Hypothesis
- Erwartetes Signal und widerlegenden Test vor dem Eingriff nennen.
- Control
- Incident-Führung, Kommunikation und Changefreigabe koordinieren.
Vom Symptom zur verifizierten Änderung
Impact und Incident-Level setzen→Zeitlinie und letzte Changes sammeln→Hypothese mit gezieltem Test prüfen→Remediation verifizieren und Follow-up verfolgen
Sicherheitsgeländer
BetriebsregelKorrelation ist keine Ursache. Ein zeitgleiches Deployment ist eine starke Hypothese, aber die Remediation braucht ein Signal, das Mechanismus und Wirkung verbindet.
Die folgenden Checks verändern Kontext und Fehlerbild. Entscheidend ist jeweils, welche Beobachtung die Maßnahme trägt und unter welchen Bedingungen eine andere Wahl richtig wäre.
Jetzt anwenden
Diesen Stoff gibt es als Modul mit bewerteten Entscheidungs-Checks — dieselbe Einführung, danach die Übungen.
Zum Modul →Quellen & Aktualität7 Primärquellen · zuletzt geprüft:
- 01sre.google/sre-book/monitoring-distributed-systems
- 02sre.google/workbook/incident-response
- 03cisa.gov/resources-tools/resources/federal-gov…y-response-playbooks
- 04sre.google/sre-book/service-level-objectives
- 05rfc-editor.org/rfc/rfc5905
- 06opentelemetry.io/docs/concepts/signals/traces
- 07learn.microsoft.com/en-us/azure/azure-monitor/…est-practices-alerts