Instruktions-Hierarchie und Regel-Konflikte
Im System-Prompt stehen Antworte in höchstens 3 Sätzen und Nenne bei rechtlichen Themen den vollständigen Haftungshinweis — der ist vier Sätze lang. Das Verhalten ist uneinheitlich, ein Ticket meldet mangelnde Regeltreue, jemand betont die Regel stärker. Niemand kommt darauf, dass eine zweite Regel im selben Prompt genau das Gegenteil verlangt und nichts sagt, welche gewinnt.
~30 Min · 12 Abschnitte Einführung · 9 Übungen (davon 3 Missionen)
Modul starten →
Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.
Das kannst du danach
- ✓Danach kannst du einen Regelkonflikt innerhalb einer Ebene von einem Hierarchie-Problem unterscheiden und ihn per Präzedenz oder präzisierter Bedingung auflösen.
- ✓Du erkennst eine Betreiber-Regel, die auf der Nutzer-Ebene gelandet ist und dort nur Nutzer-Privileg hat.
- ✓Du weißt, warum die Instruktions-Hierarchie gutartige Konflikte löst, aber keine Grenze für das ist, was schlicht nicht passieren darf.
Übungen
- 1. EntscheidungWas ist die richtige Behandlung?
- 2. EntscheidungWas ist die strukturelle Ursache?
- 3. EntscheidungWie reagierst du auf den Vorschlag?
- 4. EntscheidungWelche zwei Befunde liegen hier vor?
- 5. MissionEine Betreiber-Regel auf der falschen Ebene
- 6. EntscheidungWas hat gefehlt, damit das nicht passiert?
- 7. EntscheidungWie bewertest du die Absicherung?
- 8. MissionWer darf welche Ebene schreiben
- 9. DiagnoseDer Hinweis, der seit Dienstag fehlt
Quellen & Aktualität5 Primärquellen · zuletzt geprüft:
- 01Wallace et al., The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions, 2024
- 02Anthropic — Prompt caching: Mid-conversation system messages (Operator-Kanal)
- 03Anthropic — Prompting best practices: Tell Claude what to do instead of what not to do
- 04OWASP Top 10 for LLM Applications 2025, LLM01: Prompt Injection
- 05Anthropic — Prompt engineering overview (Erfolgskriterien und empirische Tests)
Verfasst von Julian Zentgraf