physar / LLMOps / RAG-System-Architektur

RAG-System-Architektur

Retrieval-Verfahren, Chunking, Embeddings und Kontextgröße — die Grundsatzentscheidungen, bevor die erste Zeile RAG-Code steht.

RAG-System-Architektur: von der Pipeline zur richtigen Entscheidung

Einführung · 9 Abschnitte · ~8 Min Lesezeit · Stand

Was RAG ist — und die Pipeline dahinter

RAG = Retrieval-Augmented Generation. Statt dem LLM blind zu vertrauen, holst du relevante Dokumente aus deinem Wissensbestand und gibst sie ihm als Kontext mit — das Modell antwortet auf Basis deiner Daten, aktuell und nachvollziehbar, ohne Fine-Tuning.

Wichtig für alles Weitere: RAG ist keine einzelne Komponente, sondern eine Pipeline aus zwei Phasen — einmal offline indexieren, dann pro Frage online abrufen und generieren. Jede Stufe hat Alternativen mit Trade-offs.

INDEXIERUNG · offlineDokumenteChunksVektor-StoreEmbeddingsQUERY · onlineFrageRetrievaleinbetten + suchenRerankoptionalLLMAntwort
Zwei Phasen: einmal den Bestand indexieren (offline), dann pro Frage abrufen, optional neu ordnen und generieren (online). Der Vektor-Store verbindet beide.

Retrieval-Grundlagen: sparse vs. dense

Sparse (BM25 / Keyword): matcht exakte Begriffe und Tokens — Fehlercodes wie ORA-12154, Hostnamen, CLI-Flags. Präzise auf Stichwörter, aber blind für Paraphrasen.

Dense (Embeddings): matcht Bedeutung — findet „Backup schlägt fehl“ auch bei „nightly job bricht ab“. Dafür verwischt es exakte Tokens: einen präzisen Fehlercode findet es unzuverlässig.

Exakte Codes / IDsBM25 (sparse)
Natürliche SpracheDense (Embeddings)
Gemischte LastHybrid + RRF

Hybrid: zwei Signale, per RRF vereint

Reale Query-Verteilungen sind gemischt — mal exakte Codes, mal ganze Sätze. Hybrid kombiniert beide Retrieval-Signale und ist damit der robuste Praxis-Default.

FrageBM25exakte BegriffeDenseBedeutung / SemantikRRF-FusionRankings vereinenRangliste
Reciprocal Rank Fusion (RRF) vereint die beiden Ranglisten allein über die Rangpositionen — ohne die Scores der Verfahren kalibrieren zu müssen.

Chunking & Kontext

Dokumente werden vor dem Indexieren in Chunks zerlegt. Die Größe ist ein Trade-off: klein = präzises Retrieval, wenig Kontext; groß = mehr Kontext, aber verrauschte Treffer und „lost in the middle“ (Modelle übersehen Inhalte in der Mitte langer Kontexte).

DOKUMENT → CHUNKSTreffer: kleinpräzises RetrievalAN DAS LLMEltern-Abschnittgroßer Kontext
small-to-big: über kleine Chunks präzise retrieven, dann den größeren Eltern-Abschnitt ans LLM geben — Präzision UND Kontext.

Die vier Architektur-Muster

Die meisten RAG-Systeme fallen in eines von vier Mustern — von simpel bis schwer:

Naive RAGembed → top-k → generieren. Baseline. Für kleine, stabile Bestände völlig ausreichend.
Advanced RAG+ Query-Rewriting, Hybrid, Reranking. Der pragmatische Produktions-Default.
Agentic RAGein Agent entscheidet mehrstufig, was er retrievt. Für komplexe Fragen — teurer, langsamer, schwerer abzusichern.
GraphRAGKnowledge-Graph + Traversierung. Für relationale „verbinde über Dokumente“-Fragen (Multi-Hop).

Welcher Aufbau wofür?

Die entscheidende Frage ist nicht „welches Muster ist am besten“, sondern „welches passt zu dieser Frageklasse und diesem Bestand“. Der Entwurfsraum als Entscheidungsbaum:

Frageklasse & Bestand?Naive RAGklein & stabilAdvanced RAGgemischt / NLGraphRAGrelational / Multi-HopAgentic RAGmehrstufig / Tools
Frageklasse und Bestand bestimmen das Muster — nicht der Trend. Im Zweifel unten anfangen und nur bei echtem Bedarf komplexer werden.

Retrieval-Qualität: Reranking

Symptom: Das Retrieval liefert viele Kandidaten, aber die Antworten zitieren oft irrelevanten Kontext. Der höchste Präzisions-Hebel ist Reranking — nicht ein größeres LLM und nicht ein höheres top-k (das bringt nur mehr Rauschen).

RETRIEVAL · ~20 KandidatenCross-EncoderRerankerTOP-k · sortiert#1 relevanter Chunk#2 relevanter Chunk#3 relevanter Chunk
Ein Cross-Encoder bewertet Query–Chunk-Paare direkt und filtert die vielen Kandidaten auf die wirklich relevanten, sortiert nach oben.

Die Ops-Sicht: Security & Messung

Security: Alles, was du retrievst, ist nicht vertrauenswürdige Eingabe. Versteckte Anweisungen in einem Dokument sind indirekte Prompt Injection — Antwort: Guardrails + Least-Privilege, nicht auf das „Wohlverhalten“ des Modells hoffen.

Messung: „Am besten für meinen Use-Case“ beweist man mit einem Eval-Set (Faithfulness, Context Precision/Recall), nicht mit Bauchgefühl. Jede Architektur-Änderung vorher/nachher messen, idealerweise als Regressionsgate in der CI.

Zusammenfassung — gleich im Check

Du kennst jetzt die Achsen des Entwurfsraums: Retrieval-Verfahren, Right-Sizing der Architektur, Datenmodell für die Frageklasse, Chunking, Retrieval-Qualität sowie Security & Messung.

Gelesen ist nicht geprüft: Im Modul entscheidest du die Fälle selbst und siehst danach, wo dein Urteil trägt.

12 Checks starten →

Modul-Aufbau

EINFÜHRUNGRAG-System-Architektur: von der Pipeline zur richtigen Entscheidung~8 Min
ADR-001RETRIEVALsolide
ADR-002RIGHT-SIZINGeinstieg
ADR-003DATENMODELLsenior
ADR-004CHUNKINGeinstieg
ADR-005EMBEDDINGSsolide
ADR-006KONTEXTsolide
ADR-007METADATENsolide
ADR-008AKTUALITÄTsenior
ADR-009TOP-Ksolide
ADR-010CHUNK-OVERLAPeinstieg
ADR-011VEKTOR-STOREsenior
ADR-012MANDANTENprincipal

Quellen

  1. 01Okapi BM25 (Robertson/Zaragoza) — The Probabilistic Relevance Framework: BM25 and Beyond
  2. 02Reciprocal Rank Fusion — Cormack, Clarke, Buettcher, 2009
  3. 03Lost in the Middle: How Language Models Use Long Contexts — Liu et al., 2023
  4. 04Passage Re-ranking with BERT (Cross-Encoder) — Nogueira & Cho, 2019
  5. 05OWASP Top 10 for LLM Applications — LLM01: Prompt Injection
  6. 06RAGAS: Automated Evaluation of Retrieval Augmented Generation — Es et al., 2023
  7. 07Retrieval-Augmented Generation for Large Language Models: A Survey — Gao et al., 2023
  8. 08MTEB: Massive Text Embedding Benchmark — Muennighoff et al., 2022
  9. 09Metadata filtering in vector search (Pre- vs. Post-Filtering) — Weaviate / Qdrant Dokumentation
  10. 10Retrieval-Augmented Generation — Lewis et al., 2020
  11. 11Incremental indexing / Change-Data-Capture — gängiges Daten-Pipeline-Muster
  12. 12Index-Update-Strategien — LlamaIndex / LangChain Dokumentation
  13. 13Passage Re-ranking with BERT — Nogueira & Cho, 2019
  14. 14Chunking strategies (fixed-size with overlap) — LlamaIndex / LangChain Dokumentation
  15. 15pgvector — PostgreSQL-Extension, Projekt-Dokumentation
  16. 16Efficient and robust approximate nearest neighbor search using HNSW — Malkov & Yashunin, 2016
  17. 17OWASP Top 10 for LLM Applications — LLM06: Sensitive Information Disclosure
  18. 18Multi-tenant vector search: namespaces & partitioning — Pinecone / Qdrant Dokumentation

Verfasst von Julian Zentgraf