← Cloud Infrastructure & Platform Engineering
Expert Capstone: Plattform unter Störungsdruck
Du führst Identität, Netz, Zustand, Kapazität, Daten, Guardrails und Change-Kontrolle in einem Störungsfall zusammen, priorisierst nach Nutzerwirkung und Reversibilität und sicherst Entscheidungen als belastbare Betriebsevidenz.
Fortgeschritten · ~30 Min · 12 Abschnitte Einführung · 9 Übungen (davon 1 Mission)
Modul starten →
Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.
Das kannst du danach
- ✓Mehrschichtige Plattformstörungen nach Wirkung und Grenze ordnen
- ✓Stabilisierung, Diagnose und Änderung kontrolliert voneinander trennen
- ✓Recovery und Nachbereitung über überprüfbare Evidenz führen
Übungen
- 1. EntscheidungWas ist der erste belastbare Schritt?
- 2. EntscheidungWelcher Vertrag reduziert das Betriebsrisiko am wirksamsten?
- 3. EntscheidungWann gilt der Übergang als abgeschlossen?
- 4. EntscheidungWie wird die Diagnose geführt?
- 5. MissionWer trägt was — Plattform, Produktteam oder Anbieter?
- 6. EntscheidungWie gehst du vor?
- 7. EntscheidungWie wird die Entscheidung verteidigbar getroffen?
- 8. EntscheidungWelche Maßnahme ergreifst du?
- 9. EntscheidungWas tust du zuerst?
Quellen & Aktualität12 Primärquellen · zuletzt geprüft:
- 01Google SRE Book: Managing Incidents
- 02Google SRE Book: Postmortem Culture
- 03NIST SP 800-61 Rev. 2: Computer Security Incident Handling Guide
- 04AWS Well-Architected Framework, Operational Excellence Pillar
- 05AWS: Shared Responsibility Model
- 06Microsoft: Shared responsibility in the cloud
- 07Google Cloud: Shared responsibility and shared fate
- 08NIST SP 800-53 Rev. 5 — CM-3 Configuration Change Control
- 09Google SRE Book: Handling Overload
- 10AWS Well-Architected Framework, Reliability Pillar
- 11Microsoft Azure Well-Architected Framework: Reliability
- 12AWS Well-Architected Framework, Security Pillar — Incident response
Verfasst von Julian Zentgraf