Observability & Telemetrie
Ein Nutzer meldet eine falsche und langsame Antwort, doch im Dashboard steht nur eine globale Dauer. Ohne durchgängigen Trace, Laufzeit-Provenienz und ein begrenztes Telemetrieschema bleibt unklar, ob Retrieval, Queue, Modell oder eine neue Konfiguration verantwortlich war.
~25 Min · 10 Abschnitte Einführung · 8 Übungen (davon 1 Mission)
Modul starten →
Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.
Das kannst du danach
- ✓Danach kannst du ein requestbezogenes Telemetrieschema mit klaren Datenschutz- und Volumengrenzen entwerfen.
- ✓Du erkennst Brüche in Trace-Kontext, Sampling und Laufzeit-Provenienz.
- ✓Du weißt, wann ein Detail in eine Metrik, einen Trace oder ein kontrolliertes Log gehört.
Übungen
- 1. EntscheidungWie gewinnt ihr ein brauchbares Qualitätssignal aus dem Betrieb?
- 2. EntscheidungWas erfasst ihr pro Request?
- 3. EntscheidungWie instrumentiert ihr, um die Ursache zu finden?
- 4. EntscheidungWas stempelt ihr pro Request fest, damit Incidents reproduzierbar sind?
- 5. DiagnoseDie Stelle finden, an der ein Trace zerreißt
- 6. EntscheidungWelche Sampling-Strategie wählt ihr?
- 7. EntscheidungWie geht ihr mit der Aufschlüsselung um?
- 8. EntscheidungWelche Kostenbegrenzung erhält den größten diagnostischen Wert?
Quellen & Aktualität5 Primärquellen · zuletzt geprüft:
Verfasst von Julian Zentgraf