← AI-Grundlagen für den IT-Betrieb
Ökonomie, Modellwahl & Betriebsmodell
Ein Team kauft GPUs, weil der API-Preis pro Anfrage hoch wirkt. Ohne Auslastung, Tail-Latenz und Betriebslast zu rechnen, wird aus vermeintlicher Ersparnis ein dauerhaftes Bereitschaftsthema. Entscheidend sind Vollkosten pro akzeptiertem Ergebnis und ein getesteter Ausstiegspfad.
~25 Min · 12 Abschnitte Einführung · 9 Übungen (davon 0 Missionen)
Modul starten →
Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.
Das kannst du danach
- ✓Danach kannst du Kosten- und Latenztreiber entlang von Prefill und Decode messen.
- ✓Du wählst Modelle und Routing anhand eines eigenen Qualitätsgates.
- ✓Du vergleichst API und Eigenbetrieb inklusive Auslastung, Exit-Fähigkeit und Betriebsarbeit.
Übungen
- 1. EntscheidungWo setzt du zuerst an, um die Kosten zu senken?
- 2. EntscheidungWas ist der wirksamste Hebel?
- 3. EntscheidungWas ist der richtige erste Hebel gegen das „träge“ Gefühl?
- 4. EntscheidungWie bewertest du den Vorschlag?
- 5. EntscheidungWas ist die richtige Diagnose und der richtige Hebel?
- 6. EntscheidungWie bringst du die Massenverarbeitung in Ordnung?
- 7. EntscheidungWie entscheidest du über die Modellgröße?
- 8. EntscheidungWelches Design erfüllt Zielqualität und Kostenprognose am besten?
- 9. EntscheidungWas ist der wirksamste erste Schritt?
Quellen & Aktualität34 Primärquellen · zuletzt geprüft:
- 01Pope et al. — Efficiently Scaling Transformer Inference, MLSys 2023 (Prefill-/Decode-Asymmetrie)
- 02Agrawal et al. — Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve, OSDI 2024 (Prefill, Decode, Batching)
- 03Yao et al. — ScaleLLM: A Resource-Frugal LLM Serving Framework by Optimizing End-to-End Efficiency, EMNLP Industry 2024
- 04Zheng et al. — SGLang: Efficient Execution of Structured Language Model Programs, NeurIPS 2024 (KV-/Prefix-Wiederverwendung)
- 05Liang et al. — Holistic Evaluation of Language Models, TMLR 2023
- 06Ding et al. — Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing, ICLR 2024
- 07Xiong et al. — Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs, ICLR 2024
- 08Brown et al. — Language Models are Few-Shot Learners, NeurIPS 2020
- 09Lewis et al. — Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, NeurIPS 2020
- 10Gekhman et al. — Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?, EMNLP 2024
- 11Raji et al. — AI and the Everything in the Whole Wide World Benchmark, NeurIPS Datasets and Benchmarks Track 2021
- 12NIST AI Risk Management Framework (AI RMF 1.0), 2023 — Govern-Funktion (Lieferkette und Drittanbieter)
- 13Beyer et al. (Hrsg.) — Site Reliability Engineering, O'Reilly 2016, Kapitel Capacity Planning
- 14Sculley et al. — Hidden Technical Debt in Machine Learning Systems, NeurIPS 2015
- 15ISO/IEC 42001:2023 — AI management systems (Lieferantenbeziehungen)
- 16Agrawal et al. — Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve, OSDI 2024
- 17Ding et al. — Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing, ICLR 2024
- 18Liang et al. — Holistic Evaluation of Language Models, TMLR 2023
- 19Sculley et al. — Hidden Technical Debt in Machine Learning Systems, NeurIPS 2015
- 20NIST — Artificial Intelligence Risk Management Framework 1.0
- 21Pope et al. — Efficiently Scaling Transformer Inference, MLSys 2023 (Prefill- vs. Decode-Phase)
- 22Agrawal et al. — Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve, OSDI 2024 (Prefill-/Decode-Asymmetrie)
- 23Alayrac et al. — Flamingo: a Visual Language Model for Few-Shot Learning, NeurIPS 2022
- 24Anthropic Documentation — Vision: Bildgrößen und Token-Verbrauch
- 25Agrawal et al. — Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve, OSDI 2024 (TTFT, Prefill, Decode)
- 26NIST AI Risk Management Framework (AI RMF 1.0), 2023 — Govern-Funktion
- 27Zheng et al. — SGLang: Efficient Execution of Structured Language Model Programs (RadixAttention/Prefix-Caching), NeurIPS 2024
- 28Kleppmann — Designing Data-Intensive Applications, 2017 (Batch- vs. Online-Verarbeitung)
- 29Nygard — Release It!, 2. Auflage 2018 (Bulkhead: Ressourcen-Isolierung)
- 30Agrawal et al. — Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve, OSDI 2024 (Batching und Durchsatz-/Latenz-Trade-off)
- 31Chen et al. — FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance, TMLR 2024
- 32Liang et al. — Holistic Evaluation of Language Models (HELM), TMLR 2023 (aufgabenabhängige, mehrdimensionale Bewertung)
- 33ISO/IEC 42001:2023 — AI management systems (Lieferantenbeziehungen und Ausstiegsplanung)
- 34Amershi et al. — Software Engineering for Machine Learning: A Case Study, ICSE-SEIP 2019
Verfasst von Julian Zentgraf