physar / Monitoring, Troubleshooting & Incident Operations / Major Incidents

Major Incidents

Große Ausfälle mit Eskalation, Änderungskontrolle und Wiederherstellung führen.

Große Wirkung, kontrollierte Schritte

Einführung · 2 Abschnitte · ~8 Min Lesezeit · Stand

Die Betriebsfrage

Bei großer Nutzerwirkung muss das Team Tempo gewinnen, ohne Evidenz, Kommunikation oder Recovery zu verlieren.

Steuerung

  1. Impact und Eskalation bestätigen
  2. Sichere Mitigation priorisieren
  3. Jeden Change mit Hypothese loggen
  4. Recovery gegen Nutzer-SLI verifizieren

Gelesen ist nicht geprüft: Im Modul entscheidest du die Fälle selbst und siehst danach, wo dein Urteil trägt.

3 Checks starten →

Modul-Aufbau

EINFÜHRUNGGroße Wirkung, kontrollierte Schritte~8 Min
ADR-001MITIGATIONprincipal
FLOW-002MISSION · RECOVERY-VERIFYprincipal
TRACE-003MISSION · MITIGATION-SCOPEprincipal

Quellen

  1. 01cisa.gov/resources-tools/resources/federal-gov…y-response-playbooks
  2. 02sre.google/workbook/incident-response
  3. 03sre.google/sre-book/managing-incidents

Verfasst von Julian Zentgraf