# Kontroll-Schleifen: ReAct, Planung, Termination

> Wie die Schleife eines Agenten funktioniert und wie man sie beherrscht — Reason-Act-Observe, Planung, Termination, Loop-Detection, Reflection und Kontext-Management.

Track: [Agentic AI](https://physar.tech/learn/agentic-ai)  
Kanonische Fassung: https://physar.tech/learn/agentic-ai/agent-loops  
Stand: 2026-07-22  
Interaktiver Teil: 9 Checks (nur im Browser)

## Kontroll-Schleifen: wie ein Agent iteriert — und wie du ihn beherrschst

### Der Agenten-Loop: Reason – Act – Observe

Das Herz eines Agenten ist eine Schleife: **reasonen** (was ist der nächste Schritt?), **handeln** (ein Tool aufrufen), **beobachten** (das Ergebnis) — und daraus den nächsten Schritt ableiten. Dieses Muster (**ReAct**) passt, wenn spätere Schritte von Zwischenergebnissen abhängen, die man vorab nicht kennt.

_[Abbildung: Der Agenten-Loop verbindet Handlung nur über Beobachtung und eine explizite Fortschrittsgrenze mit dem nächsten Schritt.]_

Reason → Act (Tool) → **Observe** → … → Fertig?

> **Observe ist kein Beiwerk:** Der Agent muss jedes Tool-Ergebnis — **auch Fehler** — in sein nächstes Reasoning einbeziehen. Ein ignorierter oder verschluckter Fehler bricht die Schleife und liefert selbstsicher Falsches.

### Planen oder Schritt-für-Schritt?

Reines Schritt-für-Schritt-ReAct kann sich bei **komplexen, interdependenten** Aufgaben in die Ecke manövrieren — es tut früh etwas, das eine spätere Bedingung unmöglich macht. Dann hilft **Plan-then-Execute**: erst einen Gesamtplan (Schritte, Abhängigkeiten, Constraints), dann ausführen.

> **Plan ≠ starr:** Ein Plan muss **angepasst** werden, wenn die Realität abweicht (Re-Planning). Einen veralteten Plan blind durchzuziehen ist so schlecht wie gar keiner.

### Termination: jeder Loop braucht ein Ende

Ohne erzwungene Stopp-Bedingung läuft ein Agent, bis das Plattform-Timeout oder das Kostenlimit greift. Nötig sind **beide**: eine **Ziel-Bedingung** (fertig, wenn X erreicht) UND ein **harter Backstop** (max. Schritte/Budget) für den Fall, dass das Ziel nie erreichbar ist.

> **Erzwingen, nicht erbitten:** Termination gehört in den Loop (Schritt-/Budget-Zähler + Ziel-Check) — nicht in eine Prompt-Bitte „brauch nicht zu lange“. Idealerweise mit sauberem „konnte nicht abschließen“-Ausgang.

### Steckengeblieben: Loop-Detection

Ein häufiges Failure-Muster: der Agent ruft dieselbe Aktion mit demselben Ergebnis immer wieder auf und macht **keinen Fortschritt** — bis das Schritt-Cap greift. Erkennung wiederholter Aktionen/Zustände (No-Progress) sollte die Schleife **durchbrechen**: andere Strategie erzwingen, eskalieren oder abbrechen.

> **Cap ist kein Detektor:** Ein Schritt-Cap stoppt spät und verschwendet die Schritte bis dahin. Mehr Schritte oder mehr Zufall lösen ein Feststecken nicht — es braucht eine echte Fortschritts-Prüfung.

### Reflection: sich selbst kritisieren

Eine **Reflection**-Schleife lässt den Agenten seine eigene Ausgabe gegen die Anforderungen **kritisieren und überarbeiten**, bevor er sie abgibt — hebt oft die Qualität bei „erster Entwurf zu 80 % richtig“-Aufgaben.

> **Keine Garantie:** Selbst-Prüfung teilt die **blinden Flecken** des Modells — Reflection ist eine Minderung, keine Korrektheits-Garantie. Hochriskante Ausgabe braucht zusätzlich externe Verifikation.

### Kontext über die Schleife managen

Hängt jeder Schritt die volle Historie an, wächst der Kontext ins Riesige: Kosten steigen, und frühe Constraints geraten in die vernachlässigte **Mitte** langer Kontexte („lost in the middle“) — der Agent driftet über lange Läufe.

> **Aktiv kuratieren:** Relevante Historie **zusammenfassen/prunen** und die wichtigen Ziele/Constraints bei jedem Schritt frisch voranstellen — statt alles roh anzuhängen oder nur das Fenster zu vergrößern.

### Wenn Freiheit nicht trägt: Scaffolding — gleich im Check

Ist ein Loop unzuverlässig und die Schritte großteils **bekannt**, ist mehr Freiheit die falsche Antwort. Leg **deterministisches Scaffolding** um das LLM: die bekannten Schritte als festen Ablauf kodieren, das Modell nur dort einsetzen, wo echtes Urteil nötig ist. Struktur schlägt Autonomie.

> **Gleich im Check:** Du entscheidest jetzt selbst: ReAct oder Planung, wie du terminierst, Feststecken erkennst, Kontext managst — und wann du dem Agenten Freiheit **nimmst**, statt sie zu geben.

## Quellen

- ReAct: Synergizing Reasoning and Acting in Language Models — Yao et al., 2023
- Reflexion: Language Agents with Verbal Reinforcement Learning — Shinn et al., 2023
- Plan-and-Solve Prompting: Improving Zero-Shot Chain-of-Thought Reasoning — Wang et al., 2023
- Building Effective Agents — Anthropic, 2024
- Lost in the Middle: How Language Models Use Long Contexts — Liu et al., 2023
- OWASP Top 10 for LLM Applications (2025) — LLM10 Unbounded Consumption
- OWASP Top 10 for LLM Applications (2025) — LLM05 Improper Output Handling
