LLM Production Ops

Observability & Telemetrie

Ein Nutzer meldet eine falsche und langsame Antwort, doch im Dashboard steht nur eine globale Dauer. Ohne durchgängigen Trace, Laufzeit-Provenienz und ein begrenztes Telemetrieschema bleibt unklar, ob Retrieval, Queue, Modell oder eine neue Konfiguration verantwortlich war.

~25 Min · 10 Abschnitte Einführung · 8 Übungen (davon 1 Mission)

Modul starten →

Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.

Nur den Lehrtext lesen →

Das kannst du danach

  • Danach kannst du ein requestbezogenes Telemetrieschema mit klaren Datenschutz- und Volumengrenzen entwerfen.
  • Du erkennst Brüche in Trace-Kontext, Sampling und Laufzeit-Provenienz.
  • Du weißt, wann ein Detail in eine Metrik, einen Trace oder ein kontrolliertes Log gehört.

Übungen

  • 1. EntscheidungWie gewinnt ihr ein brauchbares Qualitätssignal aus dem Betrieb?
  • 2. EntscheidungWas erfasst ihr pro Request?
  • 3. EntscheidungWie instrumentiert ihr, um die Ursache zu finden?
  • 4. EntscheidungWas stempelt ihr pro Request fest, damit Incidents reproduzierbar sind?
  • 5. DiagnoseDie Stelle finden, an der ein Trace zerreißt
  • 6. EntscheidungWelche Sampling-Strategie wählt ihr?
  • 7. EntscheidungWie geht ihr mit der Aufschlüsselung um?
  • 8. EntscheidungWelche Kostenbegrenzung erhält den größten diagnostischen Wert?
Quellen & Aktualität5 Primärquellen · zuletzt geprüft:
  1. 01OpenTelemetry Generative AI Semantic Conventions
  2. 02OpenTelemetry Sampling
  3. 03W3C Trace Context
  4. 04Prometheus Metric and Label Naming
  5. 05Google SRE Book, Monitoring Distributed Systems

Verfasst von Julian Zentgraf