LLM Production Ops

Latenz, Streaming & Caching

Die erste Ausgabe erscheint schnell, trotzdem steigen Abbrüche und Kosten. Gleichzeitig liefert ein Cache gelegentlich eine alte Antwort aus. Das Modul verbindet wahrgenommene Reaktivität mit End-to-End-Deadlines, Prefix-Reuse, Cache-Keys und belastbarer Invalidierung.

~25 Min · 11 Abschnitte Einführung · 8 Übungen (davon 0 Missionen)

Modul starten →

Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.

Nur den Lehrtext lesen →

Das kannst du danach

  • Danach kannst du TTFT, Generierungsdauer, Queueing und Netzanteile getrennt budgetieren.
  • Du unterscheidest Streaming, Prefix-Reuse, exakte und semantische Antwort-Caches.
  • Du weißt, welche Korrektheits-, Isolations- und Invalidierungskosten jede Wiederverwendung mitbringt.

Übungen

  • 1. EntscheidungWas ist der nächste Schritt, um die Klage zu erklären?
  • 2. EntscheidungWelche Maßnahme greift die gemeldete Reaktivität am direktesten an?
  • 3. EntscheidungWie bewertest du den Vorschlag?
  • 4. EntscheidungWelche Änderung senkt die Vorlaufzeit am wirksamsten?
  • 5. EntscheidungWelchen Einwand bringst du im Review?
  • 6. EntscheidungWie gehst du weiter vor?
  • 7. EntscheidungWelche Korrektur baust du ein?
  • 8. EntscheidungWie ziehst du die Timeout-Kette gerade?
Quellen & Aktualität5 Primärquellen · zuletzt geprüft:
  1. 01Google SRE Book, Addressing Cascading Failures
  2. 02OpenTelemetry Traces
  3. 03RFC 9111 HTTP Caching
  4. 04vLLM Automatic Prefix Caching
  5. 05NIST AI RMF Core

Verfasst von Julian Zentgraf