LLM Production Ops

Kosten, Kapazität & Lasttests

Ein Dashboard zählt Requests, aber ein einziger langer Auftrag kostet mehr als hundert kurze. Beim Launch sind die Providerquote und die Queue erschöpft, obwohl der Durchschnitt unauffällig bleibt. Erst arbeitsbezogene Maße machen Kosten und Kapazität gemeinsam steuerbar.

~25 Min · 11 Abschnitte Einführung · 8 Übungen (davon 1 Mission)

Modul starten →

Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.

Nur den Lehrtext lesen →

Das kannst du danach

  • Danach kannst du Kosten und Kapazität auf Input-, Output- und Laufzeitarbeit statt bloße Requestzahlen beziehen.
  • Du erkennst Sättigung an Queue und Admission, bevor Nutzer nur noch Tail-Latenz sehen.
  • Du weißt, wie realistische Lastprofile, Reserve und priorisiertes Load Shedding zu einem Freigabegate werden.

Übungen

  • 1. EntscheidungWas ist der erste belastbare Schritt?
  • 2. EntscheidungWelche Anpassung am Kapazitätsmodell ist nötig?
  • 3. EntscheidungWelche Korrektur am Testaufbau ist die wichtigste?
  • 4. EntscheidungWelches Signal wählst du als primären Frühindikator?
  • 5. EntscheidungWie argumentierst du zur Dimensionierung?
  • 6. EntscheidungWelche Laufzeitpolicy schützt den Dienst am besten?
  • 7. EntscheidungWelche Budgetsteuerung ist für diesen Fall am sinnvollsten?
  • 8. ReihenfolgeAus einem Lasttest ein Freigabegate machen

Arbeitsartefakte

Quellen & Aktualität4 Primärquellen · zuletzt geprüft:
  1. 01Google SRE Workbook, Managing Load
  2. 02Google SRE Book, Addressing Cascading Failures
  3. 03Google SRE Workbook, Implementing SLOs
  4. 04Prometheus Instrumentation

Verfasst von Julian Zentgraf