LLM Production Ops

Inferenz-Laufzeit & Eigenbetrieb

Der Pod läuft, doch das Modell ist noch nicht geladen; wenig später füllt der KV-Cache und die Queue wächst trotz freier Recheneinheiten. Wer Inferenz selbst betreibt, muss andere Engpässe und Bereitschaftssignale beherrschen als bei einem gewöhnlichen HTTP-Dienst.

~30 Min · 12 Abschnitte Einführung · 8 Übungen (davon 0 Missionen)

Modul starten →

Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.

Nur den Lehrtext lesen →

Das kannst du danach

  • Danach kannst du API-Nutzung und Eigenbetrieb anhand der tatsächlich übernommenen Betriebsverantwortung abgrenzen.
  • Du erkennst KV-Cache-, Batching-, Nebenläufigkeits- und Warm-up-Grenzen.
  • Du weißt, wie unveränderliche Gewichte, Startup- und Readiness-Probes sowie getrennte Runtime-Upgrades zusammenspielen.

Übungen

  • 1. EntscheidungWie bewertest du den Vorschlag?
  • 2. EntscheidungWie stellst du den Bezug der Gewichte um?
  • 3. EntscheidungWie gehst du mit dem morgendlichen Ausfallfenster um?
  • 4. EntscheidungWie löst du den Konflikt?
  • 5. EntscheidungWelche Änderung stabilisiert den Dienst am schnellsten?
  • 6. EntscheidungWas ist die tragfähigste Erklärung und erste Maßnahme?
  • 7. EntscheidungWelche Korrektur behebt das Fehlerfenster?
  • 8. EntscheidungWas war der Planungsfehler und wie gehst du jetzt vor?
Quellen & Aktualität5 Primärquellen · zuletzt geprüft:
  1. 01Kubernetes Device Plugins
  2. 02Kubernetes Liveness, Readiness and Startup Probes
  3. 03vLLM Documentation
  4. 04Hugging Face Text Generation Inference
  5. 05Google SRE Workbook, Managing Load

Verfasst von Julian Zentgraf