Inferenz-Laufzeit & Eigenbetrieb
Der Pod läuft, doch das Modell ist noch nicht geladen; wenig später füllt der KV-Cache und die Queue wächst trotz freier Recheneinheiten. Wer Inferenz selbst betreibt, muss andere Engpässe und Bereitschaftssignale beherrschen als bei einem gewöhnlichen HTTP-Dienst.
~30 Min · 12 Abschnitte Einführung · 8 Übungen (davon 0 Missionen)
Modul starten →
Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.
Das kannst du danach
- ✓Danach kannst du API-Nutzung und Eigenbetrieb anhand der tatsächlich übernommenen Betriebsverantwortung abgrenzen.
- ✓Du erkennst KV-Cache-, Batching-, Nebenläufigkeits- und Warm-up-Grenzen.
- ✓Du weißt, wie unveränderliche Gewichte, Startup- und Readiness-Probes sowie getrennte Runtime-Upgrades zusammenspielen.
Übungen
- 1. EntscheidungWie bewertest du den Vorschlag?
- 2. EntscheidungWie stellst du den Bezug der Gewichte um?
- 3. EntscheidungWie gehst du mit dem morgendlichen Ausfallfenster um?
- 4. EntscheidungWie löst du den Konflikt?
- 5. EntscheidungWelche Änderung stabilisiert den Dienst am schnellsten?
- 6. EntscheidungWas ist die tragfähigste Erklärung und erste Maßnahme?
- 7. EntscheidungWelche Korrektur behebt das Fehlerfenster?
- 8. EntscheidungWas war der Planungsfehler und wie gehst du jetzt vor?
Quellen & Aktualität5 Primärquellen · zuletzt geprüft:
Verfasst von Julian Zentgraf