Retrieval Augmented Generation erklärt: So nutzt KI dein Unternehmenswissen
Was Retrieval Augmented Generation ist, wie die RAG-Pipeline in fünf Schritten arbeitet, welche sechs Patterns es gibt, was der Aufbau kostet und welche Fehler du vermeidest.
Definition
Retrieval Augmented Generation erklärt: Retrieval Augmented Generation (RAG) ist ein Verfahren, bei dem ein Sprachmodell vor der Antwort passende Textstellen aus einer Wissensquelle abruft und seine Antwort auf diese Stellen stützt, mit Quellenangabe.
Ein Sprachmodell weiß nichts über dein Unternehmen. Es kennt seine Trainingsdaten, nicht deine Richtlinien, Handbücher, Angebote oder Tickets. Retrieval Augmented Generation (RAG) schließt diese Lücke: Das Modell holt sich vor jeder Antwort die passenden Stellen aus deinen Dokumenten und antwortet auf dieser Grundlage, mit Quelle.
Dieser Artikel erklärt, was RAG ist, wie die Pipeline in fünf Schritten arbeitet, welche sechs Architektur-Patterns sich etabliert haben, warum die Qualität des Retrievals über alles entscheidet, was der Aufbau kostet und welche fünf Fehler die meisten Projekte machen.
Was ist Retrieval Augmented Generation?
Klassische Wissensdatenbanken basieren auf Keyword-Suche und manueller Kategorisierung. Wer nach "Wie beantrage ich Homeoffice?" sucht, findet nichts, weil der Artikel "Remote Work Policy" heißt und das Wort Homeoffice nicht enthält. Das Ergebnis: Mitarbeiter fragen Kollegen, die Kollegen werden zu wandelnden Wikis, und 47 % der Mitarbeiter nutzen die Wissensdatenbank ihres Unternehmens gar nicht, weil sie nichts finden.
RAG dreht das um. Statt nach Wörtern zu suchen, sucht das System nach Bedeutung: Dokumente werden als Vektoren gespeichert, eine Frage wird ebenfalls zum Vektor, und die ähnlichsten Abschnitte landen als Kontext beim Sprachmodell. Das Modell antwortet nur auf Basis dieses Kontexts und nennt die Quelle, etwa "Basierend auf: Remote Work Policy, Stand Januar 2026".
Der Unterschied zum Fine-Tuning: Fine-Tuning verändert das Modell selbst und ist für Verhalten, Ton und Format gedacht. RAG lässt das Modell unverändert und liefert Wissen zur Laufzeit. Für Wissen, das sich ändert, ist RAG der Standardweg: Ein neues Dokument ist nach der Indexierung sofort verfügbar, ohne Training.
Und der Unterschied zum langen Kontextfenster: Große Fenster mit 128.000 Tokens verführen dazu, alles hineinzupacken. Du zahlst aber für jedes Token, auch für die 80 Prozent, die das Modell ignoriert. RAG gibt dem Modell nur die Stellen, die zur Frage passen. Das ist billiger und in der Regel präziser.
Wie RAG funktioniert: Die Pipeline in fünf Schritten
- Ingestion: Dokumente werden in Chunks zerlegt.
- Embedding: Jeder Chunk wird als Vektor gespeichert.
- Retrieval: Bei einer Anfrage werden die ähnlichsten Chunks gefunden.
- Augmentation: Die Chunks werden als Kontext an das Sprachmodell gegeben.
- Generation: Das Modell antwortet auf Basis des bereitgestellten Kontexts.
Zwei Details entscheiden schon hier über die Qualität. Erstens das Chunking: semantisch nach Sinnabschnitten, nicht nach starrer Zeichenzahl. Zweitens die Anreicherung mit Metadaten wie Quelle, Autor, Datum und Abteilung. Mit Metadaten angereichertes RAG erreicht 82,5 % Präzision statt 73,3 % ohne, neun Prozentpunkte, die den Unterschied zwischen "nützlich" und "vertrauenswürdig" ausmachen.
Die vier Schichten einer RAG-Wissensdatenbank
Schicht 1, Datenquellen: Confluence, Notion und SharePoint für dokumentiertes Wissen; Slack und Teams für Konversationswissen, oft die wertvollste Quelle; Google Drive oder OneDrive; CRM; Ticket-Systeme.
Schicht 2, Ingestion Pipeline: Crawling, Parsing, semantisches Chunking, Anreicherung mit Metadaten, Embedding (OpenAI, Cohere oder Open-Source-Modelle), Indexierung in einer Vektordatenbank wie Qdrant, Weaviate oder Pinecone.
Schicht 3, Retrieval und Generation: Frage, Vektor, Hybrid Search aus Vektor- und Keyword-Suche, Reranker, Antwort mit Quellenangabe.
Schicht 4, Zugriffskontrolle: Rollenbasierte Rechte, Berechtigungen auf Dokumentebene, vererbt von der Quellplattform, und Filterung zur Abfragezeit. Diese Schicht wird am häufigsten vergessen, und sie entscheidet, ob ein HR-Dokument über Gehälter für alle sichtbar wird.
Sechs RAG-Patterns: Vom Prototyp zum Produktionssystem
Naive RAG: Frage, Embedding, Top-k aus der Vektordatenbank, Sprachmodell, Antwort. Für Prototypen und interne Tools unter 10.000 Dokumenten. Antwortqualität 60 bis 70 %, für kundenseitige Anwendungen ein Risiko.
Advanced RAG: Query Rewriting, Hybrid Search aus dichter und dünnbesetzter Suche, Reranker, Sprachmodell. Drei Upgrades: semantisches Chunking statt starrer 512-Token-Blöcke, Vektor-Suche plus BM25, Cross-Encoder-Reranking. Antwortqualität 80 bis 85 %. Der Produktionsstandard.
Modular RAG: Retriever, Reranker und Generator als austauschbare Komponenten. Kommt eine neue Datenquelle dazu, wird nur das betroffene Modul angepasst.
Graph RAG: Für Fragen, die Beziehungen zwischen Dokumenten brauchen: Compliance, Produktkonfiguratoren, Organisationswissen. Aufwand 3 bis 6 Monate bis zur Produktionsreife.
Agentic RAG: Ein Agent entscheidet je Anfrage, welche Retrieval-Strategie er nutzt, und kombiniert Vektorsuche, SQL und APIs. Beispiel technischer Support für CNC-Maschinen: Handbuch-Suche, Firmware-Changelog und Ticket-System in einer Antwort. Wie solche Agenten arbeiten, steht in KI-Agenten für Unternehmen.
Corrective RAG (CRAG): Nach dem Retrieval prüft das System die Relevanz der Treffer. Sind sie nicht relevant, sucht es erneut oder eskaliert, statt zu halluzinieren.
| Szenario | Pattern | Implementierungszeit |
|---|---|---|
| Unter 10.000 Dokumente, internes Tool | Naive RAG | 2 bis 4 Wochen |
| Produktion, Kundenkontakt | Advanced RAG mit Hybrid Search | 6 bis 8 Wochen |
| Mehrere Datenquellen, wachsend | Modular RAG | 8 bis 12 Wochen |
| Beziehungswissen, Compliance | Graph RAG | 3 bis 6 Monate |
| Komplexe Multi-Source-Anfragen | Agentic RAG | 4 bis 6 Monate |
| Lückenhafte Wissensbasis | Corrective RAG als Add-on | 2 bis 4 Wochen |
Warum die Retrieval-Qualität über alles entscheidet
Die häufigste Fehlannahme: mehr Kontext, bessere Antwort. Das Gegenteil trifft zu. Statt alle zehn gefundenen Chunks an das Modell zu geben, bewertet ein Reranker die Relevanz, und nur die besten drei gehen weiter. Ergebnis: 70 % weniger Tokens bei 96 bis 99 % der Antwortqualität. In Zahlen: von zehn Chunks mal 500 Tokens gleich 5.000 Tokens auf drei Chunks mal 300 Tokens gleich 900 Tokens, 82 % Einsparung bei gleichbleibender Qualität. Der Schlüssel ist bessere Retrieval-Qualität, nicht mehr Quantität.
Das wirkt auch auf die Kosten: Jeder unnötige Chunk kostet bei jedem Call Tokens. Wie du RAG-Pipelines und andere LLM-Kosten systematisch senkst, steht in Token-Optimierung: Wie du LLM-Kosten um 40 % senkst.
Ob dein Retrieval gut genug ist, misst du, statt es zu schätzen. Drei Metriken für den Produktionsbetrieb:
| Metrik | Was sie misst | Zielwert Produktion |
|---|---|---|
| Recall@k | Anteil der relevanten Dokumente in den Top-k-Treffern | über 85 % |
| Precision@k | Anteil der relevanten Dokumente an allen Treffern | über 70 % |
| Answer Faithfulness | Stimmt die Antwort mit den Quellen überein? | über 90 % |
Der Prompt für RAG: Drei Regeln
Das beste Retrieval nützt nichts, wenn das Sprachmodell den Kontext ignoriert. Drei Instruktionen gehören in jeden RAG-Prompt: Antworte nur auf Basis des bereitgestellten Kontexts. Wenn der Kontext die Frage nicht beantwortet, sag das ausdrücklich. Nenne immer die Quelle. Dazu die Regel für Unsicherheit: lieber "Ich weiß es nicht" als eine erfundene Antwort. Wie du solche Prompts baust und mit einem Golden Set aus 50 bis 100 Testfragen prüfst, steht in Prompt Testing und Evaluation.
Was RAG kostet: Build oder Buy
Self-Build mit Open Source: LangChain oder LlamaIndex, Qdrant, eigenes Frontend. 50.000 bis 150.000 EUR Initialentwicklung, volle Kontrolle, 3 bis 6 Monate Entwicklungszeit.
Spezialisierte Plattformen (Glean, Guru, eesel AI): Connectoren out of the box, produktionsreif in Wochen, 10 bis 30 EUR pro Nutzer und Monat.
Hybrid: Eine Plattform für die Basis plus eigene Erweiterungen für spezifische Use Cases. Für die meisten Mittelständler der Weg.
Die Rechnung dahinter: Ein Mitarbeiter verbringt im Schnitt 2,5 Stunden pro Woche mit Informationssuche. Bei 50 EUR pro Stunde und 100 Mitarbeitern sind das 650.000 EUR im Jahr. Eine Plattform für 15 EUR pro Nutzer plus 20.000 EUR Setup kostet im ersten Jahr rund 50.000 EUR. Bei 50 % weniger Suchzeit liegt der ROI im ersten Jahr bei 550 %. Laufend fallen bei 100.000 Dokumenten 200 bis 500 EUR für die Vektordatenbank, 500 bis 2.000 EUR für LLM-Calls und 100 bis 300 EUR für den Reranker an, zusammen 800 bis 3.000 EUR pro Monat.
RAG in der Praxis: Ein Support-Assistent für Maschinen
Ein Maschinenbauer betreibt einen technischen Support-Assistenten für seine CNC-Fräsen der Serien X200 und X400. Die Wissensbasis: Handbücher, Firmware-Changelogs und das Ticket-System. Fragt ein Kunde nach "Fehlercode 4711 bei X200", ruft das System die passende Stelle aus Handbuch Kapitel 7.3 ab und antwortet mit Quelle. Fragt er "Was kostet die X400?", verweist der Assistent an den Vertrieb, weil Preise nicht in seinem Kontext liegen. Bei "Maschine macht komische Geräusche" stellt er Rückfragen, statt zu raten. Im Agentic-RAG-Ausbau kombiniert ein Agent Handbuch-Suche, Firmware-Datenbank und Ticket-Historie automatisch in einer Antwort.
Die fünf häufigsten Fehler
- Alle Daten auf einmal indexieren. Starte mit einer Quelle.
- Berechtigungen ignorieren. Ein HR-Dokument über Gehälter darf nicht für alle auffindbar sein.
- Kein Feedback-Mechanismus für falsche oder veraltete Antworten.
- Aktualität vernachlässigen. Eine Antwort aus 2022 ist schlimmer als keine.
- Adoption unterschätzen. Integriere die Wissensdatenbank dort, wo die Leute arbeiten: Slack, Teams, Browser-Erweiterung.
RAG, Datenschutz und Architektur
Für personenbezogene oder vertrauliche Daten gilt: Die Vektordatenbank und das Modell müssen dort laufen, wo deine Daten bleiben dürfen. Weaviate ist als Open Source mit Hybrid Search DSGVO-kompatibel betreibbar, Qdrant performant und Rust-basiert, Chroma leichtgewichtig für Prototypen, Pinecone managed und schnell skalierbar. Wie RAG in eine Gesamtarchitektur mit Inference-, Orchestration- und Integration-Layer passt, steht in Enterprise LLM-Architektur. Wie ein Agent Abrufe über Sitzungen hinweg als Gedächtnis nutzt, steht in Agent Memory in LLM-Systemen. Den vollständigen Aufbau einer Wissensdatenbank mit Tools und ROI findest du im Hub Enterprise Knowledge Base mit KI aufbauen, den Gesamtüberblick im Guide KI für Unternehmen.
Fazit
Retrieval Augmented Generation ist der Weg, mit dem ein Sprachmodell dein Unternehmenswissen nutzt, ohne es neu zu trainieren. Die Technik ist kein Hexenwerk: Chunking, Embedding, Retrieval, Kontext, Antwort. Die Qualität entsteht in den Details: semantisches Chunking, Metadaten, Hybrid Search, Reranking, Zugriffskontrolle. Dein Unternehmen hat das Wissen. Die einzige Frage ist, wie lange du es dir leisten kannst, dass deine Mitarbeiter jeden Tag danach suchen.
Weiterlesen
Grundlagen zu KI für Unternehmen und die Artikel, die dieses Thema vertiefen.
- KI für Unternehmen: Der Guide für den MittelstandGrundlagen
- KI-Wissensdatenbank aufbauen: Architektur, RAG-Patterns, Tools und ROIÜberblick
- LLM-Architektur für den Mittelstand: Der komplette Guide 2026Vertiefung
- Token-Optimierung: Wie du LLM-Kosten um 40% senkstVertiefung
- Agent Memory in LLM Systems — Context, Persistence & RetrievalVertiefung
- KI-Agenten für Unternehmen: Definition, Einsatz, GrenzenVertiefung
- Prompt Engineering für Unternehmen: System Prompts, Chain-of-Thought und TestingVertiefung
Verwandte Artikel
Agent Memory in LLM Systems — Context, Persistence & Retrieval
3 Min LesezeitEnterprise LLM-Architektur: Wie man strukturierte Daten zuverlässig aus unstrukturierten Texten extrahiert
4 Min LesezeitChatbot für Unternehmen: Einsatzfelder, Architektur, Kosten und Pflichten
8 Min LesezeitVector Database Vergleich 2026 — Pinecone vs Weaviate vs Qdrant vs Chroma
2 Min LesezeitWelche Arbeit kostet in deinem Unternehmen heute zu viel Zeit?
Die KI-Mitarbeiter-Fit-Prüfung zeigt, ob ein KI-Mitarbeiter wiederkehrende operative Arbeit in eurem Prozess übernehmen kann. Du bekommst eine klare Antwort, kein Tool-Pitch.
5 Fragen · etwa 3 Minuten · klare Fit-Einschätzung