Klassifikation und Extraktion
Eine Extraktion meldet 96 % Füllquote, und 4 % der gefüllten Werte sind falsch: Beträge und Datumsangaben, die im Dokument nicht vorkommen, aber plausibel aussehen. Die Buchhaltung hat drei Monate mit diesen Zahlen gearbeitet. Solange die Füllquote die Kennzahl ist, belohnt das System Raten und bestraft Zurückhaltung.
~25 Min · 12 Abschnitte Einführung · 9 Übungen (davon 2 Missionen)
Modul starten →
Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.
Das kannst du danach
- ✓Danach kannst du eine Kategorie über ihre Grenze zur Nachbarkategorie definieren und eine Restklasse mit eigener Kennzahl führen.
- ✓Du erkennst, wann die menschliche Übereinstimmung und nicht der Prompt die Obergrenze deiner Trefferquote ist.
- ✓Du weißt, warum bei Extraktion ein leeres Feld besser ist als ein plausibles, und wie du Beleg und normalisierten Wert trennst.
Übungen
- 1. EntscheidungWas ist der erste Hebel?
- 2. EntscheidungWie bewertest du die 100 %?
- 3. EntscheidungWas ist der nächste Schritt?
- 4. EntscheidungWelche Ursachen liegen hier vor?
- 5. EntscheidungWelcher Entwurf trägt hier?
- 6. EntscheidungWas änderst du zuerst?
- 7. MissionEin Extraktionsschema ohne Beleg
- 8. EntscheidungWelche Messung brauchst du?
- 9. MissionTestfälle nach ihrem Zweck ordnen
Quellen & Aktualität10 Primärquellen · zuletzt geprüft:
- 01Min et al., Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?, EMNLP 2022
- 02Zhao et al., Calibrate Before Use: Improving Few-Shot Performance of Language Models, ICML 2021
- 03Maynez et al., On Faithfulness and Factuality in Abstractive Summarization, ACL 2020
- 04Cohen, A Coefficient of Agreement for Nominal Scales, Educational and Psychological Measurement 20(1), 1960
- 05Anthropic — Prompting best practices: Use examples effectively
- 06Willard und Louf, Efficient Guided Generation for Large Language Models, 2023
- 07JSON Schema Specification (Draft 2020-12), Validation: enum
- 08Anthropic — Prompt engineering overview (Erfolgskriterien vor dem Tuning)
- 09Semantic Versioning 2.0.0
- 10Ji et al., Survey of Hallucination in Natural Language Generation, ACM Computing Surveys 2023
Verfasst von Julian Zentgraf