Grounding, Belege und Enthaltung
Eine Prüfung von 50 Antworten: 44 korrekt, 6 nennen Fristen, die es bei euch nicht gibt. Sie stehen in keinem mitgegebenen Abschnitt, klingen branchenüblich und sind von den korrekten Antworten nicht zu unterscheiden. In einer Untersuchung generativer Suchsysteme waren nur 51,5 % der Sätze vollständig durch ihre Zitate gestützt — bei durchweg flüssigen, informativ wirkenden Antworten.
~25 Min · 12 Abschnitte Einführung · 9 Übungen (davon 2 Missionen)
Modul starten →
Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.
Das kannst du danach
- ✓Danach kannst du eine Grounding-Instruktion aus Quelle, Belegpflicht und definiertem Ausgang bauen — und ein Belegformat verlangen, das maschinell prüfbar ist.
- ✓Du erkennst den Unterschied zwischen einem existierenden Zitat und einer daraus folgenden Aussage, und welche Prüfung welche Fehlerart fängt.
- ✓Du weißt, warum ein Gate auf selbstberichtete Sicherheit gerade bei den Fehlern versagt, die es fangen soll.
Übungen
- 1. EntscheidungWas erklärt diesen Befund?
- 2. EntscheidungWas fehlt der Instruktion?
- 3. EntscheidungWie änderst du das Belegformat?
- 4. EntscheidungWelche Fehlerart fängt diese Prüfung nicht?
- 5. MissionEine Enthaltung, die niemand auswerten kann
- 6. EntscheidungWas ist die richtige Vorgabe für diesen Fall?
- 7. EntscheidungWie behandelst du den Widerspruch?
- 8. EntscheidungWie bewertest du das Gate?
- 9. MissionPrüfquellen nach ihrer Herkunft ordnen
Quellen & Aktualität8 Primärquellen · zuletzt geprüft:
- 01Liu, Zhang und Liang, Evaluating Verifiability in Generative Search Engines, EMNLP 2023 Findings
- 02Xiong et al., Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs, ICLR 2024
- 03Maynez et al., On Faithfulness and Factuality in Abstractive Summarization, ACL 2020
- 04Ji et al., Survey of Hallucination in Natural Language Generation, ACM Computing Surveys 2023
- 05Anthropic — Citations (Fundstellen je Textabschnitt und Seite)
- 06Anthropic — Prompting best practices: Tell Claude what to do instead of what not to do
- 07Huang et al., Large Language Models Cannot Self-Correct Reasoning Yet, ICLR 2024
- 08JSON Schema Specification (Draft 2020-12)
Verfasst von Julian Zentgraf