Prompt Engineering

Techniken: Reasoning und Genauigkeit

Ein Assistent beantwortet Fragen zu eurer Storno-Policy falsch — flüssig, gut begründet, in sich schlüssig und komplett erfunden, weil die Policy nirgends im Kontext steht. Der Reflex lautet: mehr Chain-of-Thought. Er ist falsch, und die längere Begründung macht den Fehler im Review schwerer erkennbar, nicht leichter.

~30 Min · 12 Abschnitte Einführung · 9 Übungen (davon 2 Missionen)

Modul starten →

Fortschritt wird gespeichert — du kannst das Modul später jederzeit fortsetzen.

Nur den Lehrtext lesen →

Das kannst du danach

  • Danach kannst du entscheiden, ob eine Aufgabe überhaupt Zwischenergebnisse hat — und damit, ob Chain-of-Thought hier etwas beiträgt oder nur Latenz kostet.
  • Du erkennst den Unterschied zwischen einem Reasoning-, einem Wissens- und einem Spezifikationsproblem, bevor du eine Technik wählst.
  • Du weißt, warum Selbstprüfung ohne externes Kriterium schlechter sein kann als keine — und was als externes Kriterium taugt.

Übungen

  • 1. ReihenfolgeDie Technik-Leiter in der richtigen Reihenfolge
  • 2. EntscheidungWas verbessert die Genauigkeit am direktesten?
  • 3. EntscheidungWas ist die richtige Lehre daraus?
  • 4. EntscheidungWas ist die strukturelle Verbesserung?
  • 5. EntscheidungWas ist die richtige Diagnose und Maßnahme?
  • 6. EntscheidungWelcher Prompt-seitige Hebel senkt diese Fehler?
  • 7. MissionReasoning und Nutzlast im selben Ausgabetext
  • 8. EntscheidungWelche Technik hebt hier die Zuverlässigkeit gezielt?
  • 9. EntscheidungWie ist der Vorschlag zu bewerten?

Arbeitsartefakte

Quellen & Aktualität11 Primärquellen · zuletzt geprüft:
  1. 01Wei et al., Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, NeurIPS 2022
  2. 02Sprague et al., To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning, 2024
  3. 03Wang et al., Self-Consistency Improves Chain of Thought Reasoning in Language Models, ICLR 2023
  4. 04Zhou et al., Least-to-Most Prompting Enables Complex Reasoning in Large Language Models, ICLR 2023
  5. 05Huang et al., Large Language Models Cannot Self-Correct Reasoning Yet, ICLR 2024
  6. 06Turpin et al., Unfaithful Explanations in Chain-of-Thought Prompting, NeurIPS 2023
  7. 07Anthropic — Prompting best practices (Thinking, manuelles Chain-of-Thought, Trennung von Reasoning und Ausgabe)
  8. 08Anthropic — Prompt engineering overview
  9. 09Ji et al., Survey of Hallucination in Natural Language Generation, ACM Computing Surveys 2023
  10. 10Xiong et al., Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation, ICLR 2024
  11. 11NIST AI Risk Management Framework, Core (Measure, Manage)

Verfasst von Julian Zentgraf