AI-Grundlagen für den IT-Betrieb

Ökonomie, Modellwahl & Betriebsmodell

Ein Team kauft GPUs, weil der API-Preis pro Anfrage hoch wirkt. Ohne Auslastung, Tail-Latenz und Betriebslast zu rechnen, wird aus vermeintlicher Ersparnis ein dauerhaftes Bereitschaftsthema. Entscheidend sind Vollkosten pro akzeptiertem Ergebnis und ein getesteter Ausstiegspfad.

~25 Min · 12 Abschnitte Einführung · 9 Übungen (davon 0 Missionen)

Modul starten →

Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.

Nur den Lehrtext lesen →

Das kannst du danach

  • Danach kannst du Kosten- und Latenztreiber entlang von Prefill und Decode messen.
  • Du wählst Modelle und Routing anhand eines eigenen Qualitätsgates.
  • Du vergleichst API und Eigenbetrieb inklusive Auslastung, Exit-Fähigkeit und Betriebsarbeit.

Übungen

  • 1. EntscheidungWo setzt du zuerst an, um die Kosten zu senken?
  • 2. EntscheidungWas ist der wirksamste Hebel?
  • 3. EntscheidungWas ist der richtige erste Hebel gegen das „träge“ Gefühl?
  • 4. EntscheidungWie bewertest du den Vorschlag?
  • 5. EntscheidungWas ist die richtige Diagnose und der richtige Hebel?
  • 6. EntscheidungWie bringst du die Massenverarbeitung in Ordnung?
  • 7. EntscheidungWie entscheidest du über die Modellgröße?
  • 8. EntscheidungWelches Design erfüllt Zielqualität und Kostenprognose am besten?
  • 9. EntscheidungWas ist der wirksamste erste Schritt?
Quellen & Aktualität34 Primärquellen · zuletzt geprüft:
  1. 01Pope et al. — Efficiently Scaling Transformer Inference, MLSys 2023 (Prefill-/Decode-Asymmetrie)
  2. 02Agrawal et al. — Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve, OSDI 2024 (Prefill, Decode, Batching)
  3. 03Yao et al. — ScaleLLM: A Resource-Frugal LLM Serving Framework by Optimizing End-to-End Efficiency, EMNLP Industry 2024
  4. 04Zheng et al. — SGLang: Efficient Execution of Structured Language Model Programs, NeurIPS 2024 (KV-/Prefix-Wiederverwendung)
  5. 05Liang et al. — Holistic Evaluation of Language Models, TMLR 2023
  6. 06Ding et al. — Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing, ICLR 2024
  7. 07Xiong et al. — Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs, ICLR 2024
  8. 08Brown et al. — Language Models are Few-Shot Learners, NeurIPS 2020
  9. 09Lewis et al. — Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, NeurIPS 2020
  10. 10Gekhman et al. — Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?, EMNLP 2024
  11. 11Raji et al. — AI and the Everything in the Whole Wide World Benchmark, NeurIPS Datasets and Benchmarks Track 2021
  12. 12NIST AI Risk Management Framework (AI RMF 1.0), 2023 — Govern-Funktion (Lieferkette und Drittanbieter)
  13. 13Beyer et al. (Hrsg.) — Site Reliability Engineering, O'Reilly 2016, Kapitel Capacity Planning
  14. 14Sculley et al. — Hidden Technical Debt in Machine Learning Systems, NeurIPS 2015
  15. 15ISO/IEC 42001:2023 — AI management systems (Lieferantenbeziehungen)
  16. 16Agrawal et al. — Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve, OSDI 2024
  17. 17Ding et al. — Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing, ICLR 2024
  18. 18Liang et al. — Holistic Evaluation of Language Models, TMLR 2023
  19. 19Sculley et al. — Hidden Technical Debt in Machine Learning Systems, NeurIPS 2015
  20. 20NIST — Artificial Intelligence Risk Management Framework 1.0
  21. 21Pope et al. — Efficiently Scaling Transformer Inference, MLSys 2023 (Prefill- vs. Decode-Phase)
  22. 22Agrawal et al. — Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve, OSDI 2024 (Prefill-/Decode-Asymmetrie)
  23. 23Alayrac et al. — Flamingo: a Visual Language Model for Few-Shot Learning, NeurIPS 2022
  24. 24Anthropic Documentation — Vision: Bildgrößen und Token-Verbrauch
  25. 25Agrawal et al. — Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve, OSDI 2024 (TTFT, Prefill, Decode)
  26. 26NIST AI Risk Management Framework (AI RMF 1.0), 2023 — Govern-Funktion
  27. 27Zheng et al. — SGLang: Efficient Execution of Structured Language Model Programs (RadixAttention/Prefix-Caching), NeurIPS 2024
  28. 28Kleppmann — Designing Data-Intensive Applications, 2017 (Batch- vs. Online-Verarbeitung)
  29. 29Nygard — Release It!, 2. Auflage 2018 (Bulkhead: Ressourcen-Isolierung)
  30. 30Agrawal et al. — Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve, OSDI 2024 (Batching und Durchsatz-/Latenz-Trade-off)
  31. 31Chen et al. — FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance, TMLR 2024
  32. 32Liang et al. — Holistic Evaluation of Language Models (HELM), TMLR 2023 (aufgabenabhängige, mehrdimensionale Bewertung)
  33. 33ISO/IEC 42001:2023 — AI management systems (Lieferantenbeziehungen und Ausstiegsplanung)
  34. 34Amershi et al. — Software Engineering for Machine Learning: A Case Study, ICSE-SEIP 2019

Verfasst von Julian Zentgraf