Prompt Engineering

Eval-Sets und Regressionstests

Ein Refactoring räumt die Prompt-Vorlage auf: Feldnamen klein, Trennzeichen einheitlich, Beispiele alphabetisch. Am Instruktionstext ändert sich nichts, und der Eval-Lauf fällt um 6 Punkte. In einer systematischen Messung lagen bis zu 76 Genauigkeitspunkte zwischen der besten und der schlechtesten von mehreren gleichbedeutenden Formatvarianten.

~25 Min · 12 Abschnitte Einführung · 9 Übungen (davon 1 Mission)

Modul starten →

Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.

Nur den Lehrtext lesen →

Das kannst du danach

  • Danach kannst du ein Eval-Set aus echten Vorfällen, Grundlast und Gegenfällen zusammenstellen und je Anforderung den härtesten passenden Prüfgrad wählen.
  • Du erkennst, wann zwei Prozentpunkte keine Verbesserung sind — und wertest gepaart aus statt Quoten zu vergleichen.
  • Du weißt, warum eine Gate-Schwelle aus der gemessenen Schwankung folgt und warum ein Teil der Fälle zurückgehalten werden muss.

Übungen

  • 1. EntscheidungWie stellst du das Set zusammen?
  • 2. EntscheidungWas gehört noch zum Abschluss?
  • 3. EntscheidungWie ordnest du die Prüfungen neu?
  • 4. EntscheidungWie belastbar ist das Ergebnis?
  • 5. EntscheidungWas ist der Defekt der Messung?
  • 6. EntscheidungWie gehst du mit der Zahl um?
  • 7. EntscheidungWie ordnest du den Befund ein?
  • 8. ReihenfolgeEinen Modellwechsel durchführen
  • 9. EntscheidungWas ist der richtige Schritt?

Arbeitsartefakte

Quellen & Aktualität8 Primärquellen · zuletzt geprüft:
  1. 01Miller, Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations, 2024
  2. 02Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, NeurIPS 2023
  3. 03Sclar et al., Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design, ICLR 2024
  4. 04Röttger et al., XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models, NAACL 2024
  5. 05Anthropic — Define success criteria and build evaluations
  6. 06Liu, Zhang und Liang, Evaluating Verifiability in Generative Search Engines, EMNLP 2023 Findings
  7. 07Laban et al., LLMs Get Lost In Multi-Turn Conversation, 2025
  8. 08Zhao et al., Calibrate Before Use: Improving Few-Shot Performance of Language Models, ICML 2021

Verfasst von Julian Zentgraf