Angriffsflächen: Injection, geliehene Autorität, Ausgabe-Handling
In einem Angebots-PDF steht in weißer Schrift ein Absatz, der die Bankverbindung ändert — und der Agent legt den Zahlungsvorschlag genau so an. Wer darauf mit einem besseren Filter antwortet, hat die Frage falsch gestellt: Für Prompt Injection sind keine narrensicheren Verfahren auf Modellebene bekannt. Tragfähig ist nur, was den Wirkungspfad unterbricht.
~30 Min · 12 Abschnitte Einführung · 9 Übungen (davon 2 Missionen)
Modul starten →
Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.
Das kannst du danach
- ✓Danach unterscheidest du Maßnahmen, die Wahrscheinlichkeit verschieben, von solchen, die etwas erzwingen.
- ✓Du erkennst geliehene Autorität und reichst die Identität des Auslösers bis ins Zielsystem durch.
- ✓Du behandelst Modellausgaben vor der Weitergabe mit Null-Vertrauen und trennst Struktur von Wert.
Übungen
- 1. MissionSechs Texte, drei Vertrauensstufen
- 2. EntscheidungWelche Maßnahme senkt das Risiko am wirksamsten?
- 3. EntscheidungWie kennzeichnet ihr Fremdinhalt tragfähig?
- 4. EntscheidungWie behandelt ihr die Modellausgabe vor der Weitergabe?
- 5. EntscheidungWie behebt ihr das?
- 6. MissionDie Rolle eines Analyse-Agenten
- 7. EntscheidungWelche Schicht fehlt?
- 8. EntscheidungWie richtet ihr das Testen aus?
- 9. EntscheidungWie bewertest du die Anordnung?
Quellen & Aktualität5 Primärquellen · zuletzt geprüft:
- 01OWASP GenAI Security Project — LLM01 Prompt Injection
- 02OWASP GenAI Security Project — LLM05:2025 Improper Output Handling
- 03OWASP GenAI Security Project — LLM06:2025 Excessive Agency
- 04MITRE — CWE-441: Unintended Proxy or Intermediary (Confused Deputy)
- 05Simon Willison — The lethal trifecta for AI agents
Verfasst von Julian Zentgraf