Agentic AI

Messen & ausrollen: Verhalten als versioniertes Artefakt

Eine Fassung wird mit 95 Prozent korrekten Endantworten freigegeben und löscht in Produktion gelegentlich Zusatzdaten — der Pfad war nie Teil der Bewertung. Und nach dem Rollback läuft die alte Fassung wieder, während die Mails der letzten zwei Stunden beim Kunden liegen. Verhalten ausrollen ist etwas anderes als Code ausrollen.

~25 Min · 12 Abschnitte Einführung · 9 Übungen (davon 2 Missionen)

Modul starten →

Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.

Nur den Lehrtext lesen →

Das kannst du danach

  • Danach versionierst du Anweisung, Werkzeuge, Modell und Grenzen als eine Einheit.
  • Du bewertest Läufe über Trajektorie, Varianz und Aufwand statt über eine Endantwort in einem Durchlauf.
  • Du wählst zwischen Schattenbetrieb und Canary und planst Rollback samt Kompensation vor dem Start.

Übungen

  • 1. ReihenfolgeFünf Schritte bis zum Vollbetrieb
  • 2. EntscheidungWie baut ihr den Testsatz um?
  • 3. MissionEine Versionsangabe im Review
  • 4. EntscheidungWie macht ihr das Gate belastbar?
  • 5. EntscheidungWas ist an der Auswertung falsch, und wie misst ihr richtig?
  • 6. EntscheidungWas ist der richtige nächste Schritt?
  • 7. EntscheidungWie rollt ihr aus?
  • 8. EntscheidungWelche Entscheidungsgrundlage braucht der Canary?
  • 9. EntscheidungWie bewertest du das?

Arbeitsartefakte

Quellen & Aktualität5 Primärquellen · zuletzt geprüft:
  1. 01Anthropic Engineering — How we built our multi-agent research system
  2. 02Anthropic Engineering — Building Effective Agents
  3. 03Anthropic — Context windows
  4. 04Anthropic — Prompt caching
  5. 05OWASP GenAI Security Project — LLM06:2025 Excessive Agency

Verfasst von Julian Zentgraf