Eval-Sets und Regressionstests
Ein Refactoring räumt die Prompt-Vorlage auf: Feldnamen klein, Trennzeichen einheitlich, Beispiele alphabetisch. Am Instruktionstext ändert sich nichts, und der Eval-Lauf fällt um 6 Punkte. In einer systematischen Messung lagen bis zu 76 Genauigkeitspunkte zwischen der besten und der schlechtesten von mehreren gleichbedeutenden Formatvarianten.
~25 Min · 12 Abschnitte Einführung · 9 Übungen (davon 1 Mission)
Modul starten →
Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.
Das kannst du danach
- ✓Danach kannst du ein Eval-Set aus echten Vorfällen, Grundlast und Gegenfällen zusammenstellen und je Anforderung den härtesten passenden Prüfgrad wählen.
- ✓Du erkennst, wann zwei Prozentpunkte keine Verbesserung sind — und wertest gepaart aus statt Quoten zu vergleichen.
- ✓Du weißt, warum eine Gate-Schwelle aus der gemessenen Schwankung folgt und warum ein Teil der Fälle zurückgehalten werden muss.
Übungen
- 1. EntscheidungWie stellst du das Set zusammen?
- 2. EntscheidungWas gehört noch zum Abschluss?
- 3. EntscheidungWie ordnest du die Prüfungen neu?
- 4. EntscheidungWie belastbar ist das Ergebnis?
- 5. EntscheidungWas ist der Defekt der Messung?
- 6. EntscheidungWie gehst du mit der Zahl um?
- 7. EntscheidungWie ordnest du den Befund ein?
- 8. ReihenfolgeEinen Modellwechsel durchführen
- 9. EntscheidungWas ist der richtige Schritt?
Arbeitsartefakte
- ↓Einen Modellwechsel durchführeneval-model-migration-2026-09-04 · geprüft: 2026-09-04
Quellen & Aktualität8 Primärquellen · zuletzt geprüft:
- 01Miller, Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations, 2024
- 02Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, NeurIPS 2023
- 03Sclar et al., Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design, ICLR 2024
- 04Röttger et al., XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models, NAACL 2024
- 05Anthropic — Define success criteria and build evaluations
- 06Liu, Zhang und Liang, Evaluating Verifiability in Generative Search Engines, EMNLP 2023 Findings
- 07Laban et al., LLMs Get Lost In Multi-Turn Conversation, 2025
- 08Zhao et al., Calibrate Before Use: Improving Few-Shot Performance of Language Models, ICML 2021
Verfasst von Julian Zentgraf