Warum Ihr RAG-System in der Produktion immer wieder scheitert
Die meisten RAG-Deployments im Unternehmen sehen in der Demo beeindruckend aus und enttäuschen in der Praxis. Zwischen einem funktionierenden Prototyp und einem verlässlichen Produktivsystem liegen die eigentlichen technischen und strategischen Entscheidungen.
Neo NeumannAI Practice Lead13. Juli 2026Podcast anhören
3 min
Ein Legal-Team bei einer großen europäischen Bank hat sechs Monate damit verbracht, ein RAG-System zu bauen, mit dem Analysten interne Compliance-Dokumente durchsuchen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen. Die Demo war überzeugend. In der Produktion zitierte das System mit voller Überzeugung Richtliniendokumente, die zwei Jahre zuvor ersetzt worden waren, halluzinierte konkrete Klauselnummern und holte bei unklaren Anfragen regelmäßig die Regeln der falschen Jurisdiktion. Das Projekt wurde still beigelegt. Das Scheitern hatte nichts mit dem zugrunde liegenden Modell zu tun. Das Problem war die Retrieval-PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen →.
Dieses Muster ist 2026 verbreitet genug, um eine direkte Analyse zu verdienen und nicht einen freundlichen Leitfaden zum Thema „Erste Schritte mit RAG“.
Wie Enterprise-RAG im MaMaUsing software to automate repetitive marketing tasks and campaigns, enabling personalisation at scale across channels like email, web, and social.Vollständige Definition ansehen →ßstab wirklich aussieht
Retrieval-Augmented Generation sollte ein einfaches Problem lösen: Große Sprachmodelle kennen Ihre internen Daten nicht, also holt man zur Query-Zeit relevante Dokumente und schiebt sie ins Context WindowContext WindowThe context window is the maximum amount of text (measured in tokens) a language model can process at once, including both the input prompt and the generated output.Vollständige Definition ansehen →. Auf dem Whiteboard ist die Architektur sauber. In der Praxis bringen Deployments im Unternehmen ein halbes Dutzend Failure Modes zum Vorschein, mit denen Anbieter selten werben.
Der erste ist derQualitätsverfall des Retrieval über die Zeit. Die meisten Teams indexieren ihre Dokumente einmal und wenden sich dann anderen Dingen zu. Enterprise-Wissensbestände sind aber nicht statisch. Richtlinien werden aktualisiert, Organigramme ändern sich, Produktspezifikationen werden überarbeitet. Wenn der Retrieval-Index aus dem Takt mit der Source of Truth gerät, antwortet das Modell selbstsicher aus veralteten Chunks. Der Nutzer kann das nicht erkennen.
Der zweite betrifft Chunk-Grenzen. Übliche Chunking-Strategien, typischerweise ein Split alle 512 oder 1.024 TokensTokensA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →, zerschneiden routinemäßig genau den Satz, der die Antwort enthält. Der Retrieval-Schritt liefert benachbarte Chunks, die nach Cosine Similarity relevant aussehen, aber den eigentlichen Fakt verpassen. Deshalb schneiden RAG-Systeme bei breiten Fragen oft gut ab und bei spezifischen schlecht.
Drittens ist Hybrid Retrieval wichtiger, als die meisten frühen Implementierungen zugeben. Reine Vector Search scheitert bei Queries mit konkreten Identifikatoren: Vertragsnummern, Produktcodes, Mitarbeiter-IDs, Verweise auf Artikel in Regularien. Dense VectorDense VectorAn embedding is a numerical vector that represents data (text, images, or items) in a way that captures meaning, so similar items sit close together in space.Vollständige Definition ansehen → Retrieval mit BM25 oder ähnlichem Sparse Retrieval zu kombinieren, verbessert die Precision in diesen Fällen deutlich. Teams, die diesen Schritt überspringen, weil „das EmbeddingEmbeddingAn embedding is a numerical vector that represents data (text, images, or items) in a way that captures meaning, so similar items sit close together in space.Vollständige Definition ansehen →-Modell die Semantik schon abdeckt“, verschenken Performance.
Mehrere Enterprise-AI-Plattformen, darunter Microsofts Azure AI Search und Elastic (beide Anbieter mit offensichtlichen kommerziellen Interessen in diesem Feld, ihre Benchmarks sind entsprechend zu behandeln), haben interne Vergleiche veröffentlicht, nach denen Hybrid Retrieval bei domänenspezifischen Korpora die reine Vector Search in Precision-Metriken um 15 bis 30 Prozent übertrifft. Unabhängige Forscher am Center for Research on Foundation Models in Stanford haben in ihren Evaluationsarbeiten 2025 ähnliche Ergebnisse markiert.
Dann gibt es die Context-Window-Falle. Als Modelle auf 128K und längere Context Windows gingen, schlossen manche Teams, Retrieval sei nicht mehr nötig: einfach alle Dokumente hineinschütten. Bei kleinen, abgegrenzten Dokumentbeständen kann das funktionieren. Bei allem, was Maßstab hat, summieren sich die Kosten, es entstehen Distraction-Effekte (Modelle beachten irrelevantes Material) und eine Latenz, die die User Experience zerstört. Long-Context-Fähigkeit ist eine nützliche Rückfallebene, keine Retrieval-Strategie.
Was das für Teams bedeutet, die RAG bauen oder einkaufen
Die oben beschriebenen Failure Modes haben direkte operative Folgen, die die meisten Projektpläne ignorieren, bis es zu spät ist.
Index-Aktualität muss ein bewusst gestaltetes Feature sein, kein nachträglicher Gedanke. Das heißt entweder kontinuierliche Sync-Pipelines, die an Ihr Dokumentenmanagementsystem angebunden sind (SharePoint, Confluence, Google Drive, was auch immer Ihre Organisation nutzt), oder mindestens eine klare Regel zur Re-Indexing-Frequenz plus Metadaten, die dem Modell Dokument-Timestamps offenlegen. Nutzer sollten fragen können „Wann wurde das letzte Mal aktualisiert?“ und eine echte Antwort bekommen.
Die Evaluation ist der Teil, der Teams mit verlässlichen Systemen von Teams mit beeindruckenden Demos trennt. Sie brauchen ein Test-Set realer Queries mit bekannten korrekten Antworten, idealerweise aufgebaut aus Fragen, die Ihre tatsächlichen Nutzer gestellt haben. Tools wie Ragas (ein Open-Source-Evaluation-Framework für RAG-Pipelines) geben Ihnen strukturierte Metriken: Faithfulness, Answer Relevance, Context Recall. Evals vor jeder wesentlichen Änderung an der Pipeline zu fahren, ist nicht optional, wenn Ihnen Zuverlässigkeit in der Produktion wichtig ist.
Die Retrieval-Komponente sollte als erstklassiges Engineering-Problem behandelt werden, nicht als Parameter, den man einmal einstellt und dann vergisst. Das heißt A/B-Tests von Chunk-Größen, Tests verschiedener Embedding-Modelle gegen Ihre spezifischen Dokumenttypen und Messungen, ob ein zusätzlicher Reranker (Cohere etwa verkauft eine dedizierte Reranking-APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen →, die als kommerzielle Lösung neben Open-Source-Alternativen wie Cross-Encoder-Modellen eine Prüfung wert ist) die Antwortqualität am Ende tatsächlich verbessert.
Auf der Governance-Seite erzeugt RAG eine spezifische Verantwortungsfrage, die reine LLMLLMA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen →-Deployments nicht haben: Wer ist verantwortlich für das, was im Index steht? Wenn ein abgerufenes Dokument veraltete oder falsche Informationen enthält und das Modell sie als Fakt präsentiert, ist das ein Modellfehler oder ein Data-Governance-Fehler? In den meisten Unternehmenskontexten das Letztere, aber Organisationen legen die Zuständigkeit selten vor dem Deployment fest.
Vor Ihrem nächsten RAG-Sprint sollten Sie das abdecken
- Definieren Sie Freshness-SLAs für Ihren Dokumentenkorpus, bevor Sie eine Zeile Retrieval-Code schreiben. Wenn Sie sich nicht darauf verpflichten können, den Index aktuell zu halten, sind die Genauigkeitsgarantien, die Sie Nutzern geben, erfunden.
- Bauen Sie ein Evaluation-Set aus echten Nutzer-Queries, nicht aus synthetischen. Synthetische Benchmarks sagen Ihnen, wie das System im Durchschnitt abschneidet. Echte Queries sagen Ihnen, wo es auf die Weise bricht, die für Ihre Nutzer relevant ist.
- Setzen Sie Hybrid Retrieval von Anfang an ein, wenn Ihr Korpus strukturierte Identifikatoren oder Exact-Match-Use-Cases enthält. Es später zu ergänzen ist störender, als es gleich einzubauen.
- Machen Sie die Provenienz für Endnutzer sichtbar. Zeigen Sie das Quelldokument, den abgerufenen Abschnitt und den Timestamp. Nutzer kalibrieren Vertrauen besser, wenn sie die Belege prüfen können, und es senkt das Risiko, dass eine übermäßig selbstsichere Modellantwort ohne Prüfung umgesetzt wird.
- Benennen Sie einen Data Owner für den Retrieval-Index, mit derselben Befugnis, schlecht formatierte oder veraltete Dokumente abzulehnen, die ein Datenbankadministrator über eine Produktionsdatenbank hat.
Die Teams, die RAG in der Produktion zum Laufen bringen, nutzen keine anspruchsvolleren Modelle als die Teams, die scheitern. Sie stecken mehr Zeit in Dokumentenaufbereitung, Evaluation und Index-Pflege als in die Modellauswahl. Das ist ein unglamouröses Ergebnis, aber die Produktionslogs bestätigen es.
Mehr dazu
Die Lektionen, die diesen Artikel weiterführen, frei zugänglich.
- 1Retrieval-augmented generation (RAG): dem Modell Ihre Daten gebenBuilding with AI
- 2Outputs bewerten: Woher wissen Sie, dass es funktioniert?Building with AI
- 3Agentic RAG: Retrieval innerhalb der Agent-LoopAI Agents: Design, Aufbau und Betrieb
- 4Den richtigen Ansatz wählen: Prompt, RAG, Fine-Tuning oder AgentBuilding with AI
- 5Halluzinationen und Verifikation bei kritischen AufgabenVerantwortungsvolle und vertrauenswürdige KI
Artikel gelesen?
Bestätigen Sie Ihre Lektüre, um XP zu sammeln und Ihr Radar zu füttern.