Verweigerung, Übervorsicht und Eskalation
Ein Assistent verweigert Rechtsauskünfte und verweist auf die Rechtsabteilung. Nach drei Monaten: 1.400 Verweise, keine Bearbeitung — die Rechtsabteilung wusste nichts davon, weil der Verweis ein Satz an den Nutzer war und keine Übergabe. Nutzer haben inzwischen gelernt, ihre Frage so lange umzuformulieren, bis der Assistent doch antwortet.
~25 Min · 12 Abschnitte Einführung · 9 Übungen (davon 3 Missionen)
Modul starten →
Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.
Das kannst du danach
- ✓Danach kannst du Enthaltung und Verweigerung trennen und je Verweigerungsgrund die passende Reaktion wählen — verweisen, Ersatz anbieten oder knapp ablehnen.
- ✓Du erkennst Übervorsicht als eigenen Ausfallmodus und weißt, warum sie ohne Gegentestfälle unsichtbar bleibt.
- ✓Du weißt, was ein Eskalationspfad braucht, um mehr zu sein als ein Satz: Empfänger, Übergabe, Zusage, Rückweg und zugesagte Kapazität.
Übungen
- 1. EntscheidungWas ist der strukturelle Defekt?
- 2. EntscheidungWie behandelst du die drei Fälle richtig?
- 3. MissionEine Verweigerung, die nur im Text existiert
- 4. EntscheidungWas schließt du daraus?
- 5. EntscheidungWie baust du den Text um?
- 6. ReihenfolgeEinen Eskalationspfad aufbauen
- 7. EntscheidungWas ist die tragfähige Maßnahme?
- 8. MissionEntscheidungen den richtigen Stellen zuordnen
- 9. EntscheidungWas ist der Defekt dieses Gates?
Arbeitsartefakte
- ↓Einen Eskalationspfad aufbauenrefusal-escalation-path-2026-09-04 · geprüft: 2026-09-04
Quellen & Aktualität6 Primärquellen · zuletzt geprüft:
- 01Röttger et al., XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models, NAACL 2024
- 02NIST AI Risk Management Framework, Core (Govern, Manage)
- 03Anthropic — Stop reasons und stop_details (refusal als eigener Abbruchgrund)
- 04Anthropic — Prompting best practices: Tell Claude what to do instead of what not to do
- 05JSON Schema Specification (Draft 2020-12)
- 06Wallace et al., The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions, 2024
Verfasst von Julian Zentgraf