Mensch & Agent: eingreifen, nachsehen, zurückgeben
Eine Bereitschaftsperson bestätigt 500 Agenten-Freigaben am Tag in 1,8 Sekunden pro Vorgang. Das ist kein Disziplinproblem: Automation Bias tritt bei Fachleuten wie bei Laien auf und lässt sich nach der Befundlage nicht durch Training oder Anweisungen verhindern. Damit fällt eine ganze Klasse von Gegenmaßnahmen aus.
~30 Min · 12 Abschnitte Einführung · 9 Übungen (davon 2 Missionen)
Modul starten →
Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.
Das kannst du danach
- ✓Danach unterscheidest du Nachweise aus Aufzeichnungen von Selbsterklärungen des Modells.
- ✓Du stufst Eingriffe so ab, dass die günstige Stufe die häufige ist — und planst den Preis des Stoppens ein.
- ✓Du platzierst Freigaben dort, wo sie selten genug für Aufmerksamkeit sind, und baust einen Rückweg in den Lauf.
Übungen
- 1. MissionNachweis oder Erzählung
- 2. EntscheidungWie verbessert ihr die Eingriffsmöglichkeit?
- 3. EntscheidungWas zeigt ihr den Operatoren?
- 4. EntscheidungWie platziert ihr die menschliche Freigabe?
- 5. EntscheidungWas ändert ihr an der Vorlage?
- 6. MissionEin Eskalationspaket im Review
- 7. EntscheidungWie bewertest du das Vorgehen?
- 8. EntscheidungWie muss die Rückgabe an den Agenten aussehen?
- 9. EntscheidungWas ist die wirksamste Gegenmaßnahme?
Quellen & Aktualität5 Primärquellen · zuletzt geprüft:
- 01Parasuraman & Manzey — Complacency and Bias in Human Use of Automation: An Attentional Integration, Human Factors 52(3), 2010
- 02OWASP GenAI Security Project — LLM09:2025 Misinformation
- 03OWASP GenAI Security Project — LLM06:2025 Excessive Agency
- 04Anthropic Engineering — Building Effective Agents
- 05Anthropic Engineering — Effective harnesses for long-running agents
Verfasst von Julian Zentgraf