Agentic RAG: Retrieval innerhalb der Agent-Loop
# Agentic RAG: Retrieval innerhalb der Agent-Loop
Fragen Sie einen Chatbot „Kann ein Contractor internationale Flüge abrechnen?", dann greift einfaches Retrieval die drei Textabschnitte heraus, die Ihrer Frage am ähnlichsten sehen, packt sie in den Prompt und antwortet. Steht die tatsächliche Regel in einem Abschnitt „Contractor Travel", in dem das Wort „abrechnen" nie vorkommt, bekommen Sie eine selbstbewusste, falsche Antwort.
Agentic RAG löst das, indem die KI sich wie ein Rechercheur verhält statt wie ein Automat. Sie sucht, liest, was zurückkam, merkt, dass die Antwort dünn ist, und sucht erneut mit besseren Begriffen. Dieselbe 500-seitige Policy-Sammlung. Sehr anderes Ergebnis.
Zuerst das Vokabular
RAG steht für Retrieval-Augmented Generation. Im Klartext: Bevor die KI antwortet, schlägt sie in Ihren Dokumenten nach und verwendet, was sie findet. So bleiben die Antworten in Ihren tatsächlichen Inhalten verankert statt im Gedächtnis des Modells.
Retrieval bedeutet hier die Suche in einer Vektordatenbank: ein Speicher, in dem Ihre Dokumente in Passagen zerlegt und nach Bedeutung indexiert sind, sodass eine Suche nach „Erstattung" auch eine Passage über „Rückzahlung von Kosten" zutage fördern kann.
One-shot RAG führt genau eine Suche aus und antwortet dann. Agentic RAG setzt Retrieval in eine Loop, sodass die KI mehrfach suchen und selbst entscheiden kann, wann sie genug hat.
One-shot RAG: schnell, günstig, manchmal falsch
Hier der klassische Ablauf für die Contractor-Frage:
1. Die Frage in eine Suche übersetzen.
2. Die 3 bis 5 besten passenden Passagen abrufen.
3. Sie an das Modell geben.
4. Modell antwortet.
Das funktioniert hervorragend, wenn die Antwort an einer offensichtlichen Stelle steht. „Wie hoch ist unsere PTO-Ansparrate?" steht fast immer in einem einzigen Absatz. Eine Suche findet es. Fertig. Ein Modellaufruf, geringe Kosten, schnell.
Das Problem sind Fragen, die sich über mehrere Abschnitte erstrecken. Unsere Contractor-Frage braucht eigentlich drei Fakten:
- Sind Contractor überhaupt reisekostenerstattungsberechtigt?
- Welche Regeln gelten für internationale Reisen?
- Gibt es eine Pflicht zur Vorabgenehmigung?
Das kann in drei verschiedenen Kapiteln stehen. Eine einzelne Suche, optimiert auf „contractor expense international flights", liefert vielleicht zwei relevante Passagen und eine über Kilometergeld im Inland. Das Modell antwortet auf unvollständiger Faktenlage und klingt dabei überzeugt.
Agentic RAG: Die KI gräbt weiter
Geben Sie dem Modell nun ein Tool, das es aufrufen kann: eine Funktion search_policies. Ein Tool ist einfach eine Aktion, die das Modell auslösen darf, etwa eine Suche ausführen und Ergebnisse zurückbekommen. Entscheidend: Das Modell wählt selbst, *wann* und *wonach* es sucht, und es kann das mehrfach tun.
Hier dieselbe Contractor-Frage, agentic:
1. Suche: „contractor travel reimbursement eligibility". Findet: Contractor sind berechtigt, wenn die Reise vorab genehmigt ist.
2. Lesen und Lücke bemerken: Berechtigung ist bestätigt, aber noch nichts zu internationalen Regeln.
3. Erneut suchen: „international flights travel policy limits". Findet: Internationale Reisen über 2.000 $ brauchen VPVPA clear statement of the benefits your product delivers, the problems it solves and why customers should choose you over alternatives.Vollständige Definition ansehen →-Freigabe.
4. Erneut suchen: „pre-approval process contractor". Findet das Genehmigungsformular und die Fristen.
5. Antwort: „Ja, unter zwei Bedingungen..." und zitiert alle drei Passagen.
Die KI hat entschieden, dass sie drei Abfragen braucht. Das hat niemand fest einprogrammiert. Sie hat die Zwischenergebnisse gelesen und als unzureichend beurteilt. Genau um dieses Urteil geht es.
Wie die Loop aussieht
Das Muster ist anbieterneutral. Jedes größere Agent-SDK (OpenAI Agents SDK, das Claude Agent SDK, Googles ADK) setzt dieselbe Form um: dem Modell ein Tool geben, es das Tool aufrufen lassen, Ergebnisse zurückspielen, wiederholen, bis es aufhört. Die genaue Syntax finden Sie in den Provider-Deep-Dive-Blöcken. Die Kernidee:
tools = [{
"name": "search_policies",
"description": "Search the company policy library. Returns top passages.",
"parameters": {"query": "string"}
}]
messages = [{"role": "user", "content": "Can a contractor expense international flights?"}]
for step in range(5): # Loop begrenzen, damit sie nicht endlos läuft
response = model.generate(messages, tools=tools)
if response.tool_call:
results = search_policies(response.tool_call.query) # Ihre Vektordatenbank
messages.append(response)
messages.append({"role": "tool", "content": results})
# nächste Runde: Das Modell liest die Ergebnisse und entscheidet den nächsten Schritt
else:
print(response.text) # Modell hat sich für eine Antwort entschieden, wir sind fertig
breakLesen Sie die Loop schlicht: Das Modell fragt entweder nach einer Suche oder gibt eine finale Antwort. Sucht es, führen wir die Suche aus, geben die Ergebnisse zurück und drehen noch eine Runde. Das range(5) ist eine Sicherheitsgrenze, damit ein verwirrter Agent nicht ewig weitersucht.
Wenn Sie vor der Agent-Loop eine solide, herstellerneutrale Einführung in RAG-Konzepte wollen: Die Hugging Face RAG documentation ist kostenlos und klar.
Agentic RAG Explained
Wann sich die zusätzliche Loop lohnt
Die Loop ist nicht umsonst. Jede Suche plus jeder Modellaufruf kostet Zeit und Geld. Drei Round-Trips machen aus einer 2-Sekunden-Antwort für einen Cent womöglich eine 8-Sekunden-Antwort für vier Cent. Multipliziert über tausende Fragen pro Tag fällt das ins Gewicht.
Nutzen Sie diese grobe Orientierung.
Greifen Sie zu agentic RAG, wenn:
- Die Antwort sich über mehrere Abschnitte erstreckt. Policy-Fragen, Rechtsfragen und „vergleiche A mit B"-Fragen tun das meistens.
- Die Formulierungen selten übereinstimmen. Nutzer sagen „Flüge abrechnen", das Dokument sagt „erstattungsfähige Flugreisen". Iteration lässt den Agent neue Formulierungen ausprobieren.
- Falsch zu liegen teuer ist. Compliance-, Medizin-, Finanz- oder Vertragsfragen rechtfertigen die zusätzliche Sorgfalt.
- Sie Quellenangaben brauchen. Ein Agent, der mehrere Passagen sammelt, kann auf jede einzelne verweisen.
Bleiben Sie bei one-shot RAG, wenn:
- Die Antwort an einer Stelle steht. Definitionen, Einzelfakt-Abfragen, FAQ-artige Fragen.
- Das Volumen riesig und der Einsatz gering ist. Ein Support-Bot, der eine Million Mal „Wie sind Ihre Öffnungszeiten?" beantwortet, sollte nicht loopen.
- Latenz kritisch ist. Ein Live-Telefonassistent kann nicht für vier Suchen pausieren.
Ein praktischer Mittelweg: standardmäßig one-shot laufen lassen und die Loop nur auslösen, wenn das erste Ergebnisset schwach aussieht. Viele Teams bewerten die abgerufenen Passagen und übergeben die Kontrolle an den Agent, wenn der beste Treffer unter einer Confidence-Schwelle liegt. Meistens günstig, gründlich, wenn es darauf ankommt.
Wissenscheck
1. Was ist der zentrale Unterschied zwischen one-shot RAG und agentic RAG?
2. Warum kann einfaches one-shot Retrieval bei der Contractor-Flugfrage eine selbstbewusste, aber falsche Antwort liefern?
3. Für welche Art von Frage ist one-shot RAG typischerweise am besten geeignet?
4. Wählen Sie ALLE richtigen Antworten. Welche Vorteile bietet agentic RAG gegenüber one-shot RAG?
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE richtigen Antworten. Welche Aussagen zu RAG und Vektordatenbanken treffen zu?
Wählen Sie alle richtigen Antworten aus.
Die Loop zuverlässig machen
Ein Agent, der frei suchen darf, kann auch entgleisen: zehnmal suchen, Nebenpfaden nachjagen oder dieselbe Query wiederholen. Drei Leitplanken halten ihn nützlich.
1. Iterationen begrenzen
Setzen Sie ein hartes Limit (das range(5) oben). Hat der Agent nach fünf Suchen nicht geantwortet, zwingen Sie ihn, mit dem zu antworten, was ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → hat, und niedrige Confidence zu kennzeichnen. Besser ein begrenztes „das habe ich gefunden" als eine Endlosschleife.
2. Sagen Sie ihm, wann ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → aufhören soll
Der System-Prompt sollte das Aufhören explizit machen. Etwa so:
> „Durchsuche die Policy-Bibliothek so oft wie nötig. Entscheide nach jedem Ergebnis: Habe ich genug, um vollständig zu antworten und Quellen zu zitieren? Wenn ja, antworte. Wenn nein, suche mit anderen Begriffen. Überschreite 5 Suchen nicht. Wenn du weiterhin unsicher bist, sage, was fehlt."
Ohne das suchen manche Modelle einmal und hören auf, andere suchen endlos. Die Anweisung formt das Verhalten.
3. Query variieren, nicht wiederholen
Ein häufiger Fehler: Der Agent führt dieselbe Suche zweimal aus und bekommt dieselben schwachen Ergebnisse. Gutes PromptingPromptingPrompt engineering is the practice of designing and refining text inputs to guide large language models toward accurate, relevant, and reliable outputs.Vollständige Definition ansehen → bewegt ihn zum *Umformulieren*: Synonyme probieren, auf einen Abschnitt eingrenzen oder eine zusammengesetzte Frage in Teile zerlegen. Aus „Contractor internationale Fluggenehmigung" werden drei gezielte Suchen, nicht dreimal dieselbe.
Ein konkretes Vorher-Nachher
Frage: „Kann ein Contractor internationale Flüge abrechnen?"
One-shot-RAG-Antwort:
> „Contractor kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen für vorab genehmigte Reisen erstattet werden." (Die Regel zur Freigabe bei internationalen Reisen komplett verpasst. Technisch richtig, praktisch unvollständig.)
Agentic-RAG-Antwort:
> „Ja, unter zwei Bedingungen. Contractor sind bei vorab genehmigten Reisen erstattungsberechtigt (Travel Policy, Abschn. 3.1). Internationale Flüge über 2.000 $ erfordern vor der Buchung eine VPVPA clear statement of the benefits your product delivers, the problems it solves and why customers should choose you over alternatives.Vollständige Definition ansehen →-Freigabe (Abschn. 4.2). Reichen Sie das Vorabgenehmigungsformular mindestens 10 Werktage vorher ein (Abschn. 4.5)."
Die zweite Antwort brauchte drei Suchen und kostete ein paar Cent mehr. Bei einer compliance-sensiblen Frage ist das ein leichter Handel. Bei „wann öffnet das Büro" wäre es Verschwendung.
Key Takeaways
- Agentic RAG = Retrieval in einer Loop. Das Modell sucht, liest und sucht erneut, bis es genug hat, statt einmal nachzuschlagen und zu hoffen.
- Methode zur Frage passend wählen. One-shot für Einzelfakt-, Hochvolumen- und risikoarme Anfragen. Agentic für abschnittsübergreifende, risikoreiche oder zitatlastige Fragen.
- Die Loop immer begrenzen. Ein hartes Limit (zum Beispiel 5 Suchen) plus eine klare „wann aufhören"-Anweisung verhindert ausufernde Kosten und Endlosschleifen.
- Auf Umformulieren prompten, nicht auf Wiederholen. Sagen Sie dem Agent, ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → soll die Suchbegriffe variieren, damit jede Iteration neue Belege liefert.
- Hybrid in Betracht ziehen. Standardmäßig one-shot, und nur zur Agent-Loop eskalieren, wenn die ersten Ergebnisse schwach aussehen. Das hält die Kosten niedrig und schützt die Qualität dort, wo sie zählt.
Verwandte Artikel
Aktuelle Blogartikel, die auf dieser Lektion aufbauen.
- KIWarum die meisten RAG-Deployments scheitern, bevor sie live gehenRetrieval-augmented Generation sollte Enterprise-KI auf eigenen Daten endlich nützlich machen. Die Lücke zwischen diesem Versprechen und der Produktionsrealität zeigt eine Reihe konkreter, behebbarer Probleme, auf die die meisten Teams immer in derselben Reihenfolge stoßen.
- KIWarum Ihr RAG-System in der Produktion immer wieder scheitertDie meisten RAG-Deployments im Unternehmen sehen in der Demo beeindruckend aus und enttäuschen in der Praxis. Zwischen einem funktionierenden Prototyp und einem verlässlichen Produktivsystem liegen die eigentlichen technischen und strategischen Entscheidungen.
- KIWarum Ihr RAG-System in der Produktion immer wieder scheitertDie meisten RAG-Deployments im Unternehmen wirken in Demos beeindruckend und bleiben in echten Workflows unter den Erwartungen. Genau zu verstehen, wo sie brechen und warum, unterscheidet Teams mit dauerhaftem Nutzen von denen, die in einer endlosen Pilotschleife feststecken.