RAG agentique : la recherche à l'intérieur de la boucle de l'agent
# RAG agentique : la recherche à l'intérieur de la boucle de l'agent
Demandez à un chatbot « Un prestataire peut-il se faire rembourser des vols internationaux ? » et la recherche classique récupère les trois passages de texte les plus proches de votre question, les glisse dans le prompt et répond. Si la vraie règle se trouve dans une section « Déplacements des prestataires » qui n'a jamais employé le mot « remboursement », vous obtenez une réponse fausse, énoncée avec assurance.
Le RAG agentique corrige cela en laissant l'IA se comporter comme un chercheur plutôt que comme un distributeur automatique. Elle cherche, lit ce qui remonte, constate que la réponse est mince, puis relance une recherche avec de meilleurs termes. La même bibliothèque de 500 pages de politiques internes. Un résultat très différent.
D'abord, le vocabulaire
RAG signifie Retrieval-Augmented Generation. En clair : avant de répondre, l'IA va chercher dans vos documents et s'appuie sur ce qu'elle trouve. Les réponses restent ancrées dans votre contenu réel plutôt que dans la mémoire du modèle.
Retrieval désigne ici la recherche dans une base vectorielle : un espace où vos documents sont découpés en passages et indexés par le sens, de sorte qu'une recherche sur « remboursement » puisse aussi faire remonter un passage sur « se faire rembourser des frais ».
Le RAG one-shot effectue exactement une recherche, puis répond. Le RAG agentique place la recherche dans une boucle : l'IA peut chercher plusieurs fois et décider quand elle en sait assez.
RAG one-shot : rapide, peu coûteux, parfois faux
Voici le déroulé classique pour la question sur le prestataire :
1. Convertir la question en recherche.
2. Récupérer les 3 à 5 passages les plus proches.
3. Les transmettre au modèle.
4. Le modèle répond.
C'est très bien quand la réponse se trouve à un endroit évident. « Quel est notre taux d'acquisition de congés payés ? » tient presque toujours dans un paragraphe. Une recherche le trouve. Terminé. Un appel modèle, coût faible, rapide.
Le problème, ce sont les questions qui traversent plusieurs sections. Notre question sur le prestataire a en fait besoin de trois faits :
- Les prestataires sont-ils éligibles au remboursement des déplacements ?
- Quelles sont les règles pour les déplacements internationaux ?
- Une validation préalable est-elle exigée ?
Cela peut se trouver dans trois chapitres différents. Une recherche unique optimisée pour « prestataire remboursement vols internationaux » peut renvoyer deux passages pertinents et un troisième sur les indemnités kilométriques nationales. Le modèle répond à partir de preuves incomplètes, et il a l'air sûr de lui.
RAG agentique : l'IA continue de creuser
Donnez maintenant au modèle un tool qu'il peut appeler : une fonction search_policies. Un tool n'est rien d'autre qu'une action que le modèle est autorisé à déclencher, comme lancer une recherche et en récupérer les résultats. Point clé : le modèle choisit *quand* et *quoi* chercher, et il peut le faire plusieurs fois.
Voici la même question sur le prestataire, version agentique :
1. Recherche : « éligibilité remboursement déplacement prestataire ». Trouve : les prestataires sont éligibles si le déplacement est validé au préalable.
2. Lecture et détection d'une lacune : l'éligibilité est confirmée, mais rien encore sur les règles internationales.
3. Nouvelle recherche : « limites politique de déplacement vols internationaux ». Trouve : un déplacement international de plus de 2 000 $ requiert l'accord d'un VPVPFormulation claire des bénéfices apportés par votre produit, des problèmes qu'il résout et des raisons pour lesquelles les clients doivent vous choisir plutôt qu'une alternative.Voir la définition complète →.
4. Nouvelle recherche : « processus de validation préalable prestataire ». Trouve le formulaire de validation et les délais.
5. Réponse : « Oui, sous deux conditions… » avec citation des trois passages.
L'IA a décidé qu'il lui fallait trois recherches. Personne ne l'a codé en dur. Elle a lu les résultats intermédiaires et les a jugés insuffisants. Ce jugement, c'est tout l'enjeu.
À quoi ressemble la boucle
Le schémamaUtiliser un logiciel pour automatiser les tâches et campagnes marketing répétitives, afin de personnaliser à grande échelle sur des canaux comme l'email, le web et le social.Voir la définition complète → est indépendant du fournisseur. Tous les grands SDK d'agents (OpenAI Agents SDK, Claude Agent SDK, l'ADK de Google) implémentent la même forme : donner un tool au modèle, le laisser l'appeler, lui renvoyer les résultats, répéter jusqu'à ce qu'il s'arrarrL'Annual Recurring Revenue (ARR) est le revenu normalisé et prévisible qu'une entreprise par abonnement attend de ses contrats actifs sur une année.Voir la définition complète →ête. Voir les blocs d'approfondissement par fournisseur pour la syntaxe exacte. L'idée centrale :
tools = [{
"name": "search_policies",
"description": "Search the company policy library. Returns top passages.",
"parameters": {"query": "string"}
}]
messages = [{"role": "user", "content": "Can a contractor expense international flights?"}]
for step in range(5): # borner la boucle pour qu'elle ne tourne pas indéfiniment
response = model.generate(messages, tools=tools)
if response.tool_call:
results = search_policies(response.tool_call.query) # votre base vectorielle
messages.append(response)
messages.append({"role": "tool", "content": results})
# on reboucle : le modèle lit les résultats et décide de la suite
else:
print(response.text) # le modèle a choisi de répondre, c'est terminé
breakLisez la boucle simplement : le modèle demande soit une recherche, soit donne une réponse finale. S'il cherche, on exécute la recherche, on lui renvoie les résultats et on recommence. Le range(5) est une limite de sécurité pour qu'un agent perdu ne cherche pas à l'infini.
Si vous voulez une introduction solide et indépendante des fournisseurs sur les concepts du RAG avant d'ajouter la boucle agentique, la documentation RAG de Hugging Face est gratuite et claire.
Agentic RAG Explained
Quand la boucle supplémentaire en vaut la peine
La boucle n'est pas gratuite. Chaque recherche et chaque appel modèle coûtent du temps et de l'argent. Trois allers-retours peuvent transformertransformerUn Transformer est une architecture de réseau de neurones qui utilise le self-attention pour traiter des séquences en parallèle. Elle est au cœur de la plupart des modèles de langage et d'IA générative actuels.Voir la définition complète → une réponse de 2 secondes à un centime en une réponse de 8 secondes à quatre centimes. Multipliez par des milliers de questions quotidiennes et cela compte.
Voici un repère approximatif.
Optez pour le RAG agentique quand :
- La réponse s'étale sur plusieurs sections. Les questions de politique interne, les questions juridiques et les questions « comparer A et B » sont généralement dans ce cas.
- Les formulations concordent rarement. L'utilisateur dit « rembourser des vols », le document dit « déplacements aériens remboursables ». L'itération permet à l'agent de tester d'autres formulations.
- Se tromper coûte cher. Les questions de conformité, médicales, financières ou contractuelles justifient le surcroît de soin.
- Vous avez besoin de citations. Un agent qui rassemble plusieurs passages peut pointer chacun d'eux.
Restez sur le RAG one-shot quand :
- La réponse est à un seul endroit. Définitions, recherche d'un fait unique, questions de type FAQ.
- Le volume est énorme et l'enjeu faible. Un bot de support qui répond « quels sont vos horaires ? » un million de fois ne doit pas boucler.
- La latence est critique. Un assistant téléphonique en direct ne peut pas s'interrompre pour quatre recherches.
Une voie médiane pratique : exécuter le one-shot par défaut, et ne déclencher la boucle que si le premier jeu de résultats paraît faible. Beaucoup d'équipes notent les passages récupérés et, si la meilleure correspondance passe sous un seuil de confiance, passent la main à l'agent pour creuser. Peu coûteux la plupart du temps, minutieux quand il le faut.
Vérification des acquis
1. Quelle est la distinction clé entre le RAG one-shot et le RAG agentique ?
2. Pourquoi une simple recherche one-shot peut-elle donner une réponse assurée mais fausse à la question sur les vols des prestataires ?
3. Pour quel type de question le RAG one-shot est-il généralement le plus adapté ?
4. Sélectionnez TOUTES les bonnes réponses. Quels avantages le RAG agentique offre-t-il par rapport au RAG one-shot ?
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les bonnes réponses. Quelles affirmations sur le RAG et les bases vectorielles sont exactes ?
Sélectionnez toutes les réponses correctes.
Fiabiliser la boucle
Un agent qui peut chercher librement peut aussi partir en vrille : chercher dix fois, poursuivre des digressions, ou boucler sur la même requête. Trois garde-fous le maintiennent utile.
1. Plafonner les itérations
Fixez une limite stricte (le range(5) ci-dessus). Si l'agent n'a pas répondu après cinq recherches, forcez-le à répondre avec ce qu'il a et à signaler une confiance faible. Mieux vaut un « voici ce que j'ai trouvé » borné qu'une boucle infinie.
2. Lui dire quand s'arrarrL'Annual Recurring Revenue (ARR) est le revenu normalisé et prévisible qu'une entreprise par abonnement attend de ses contrats actifs sur une année.Voir la définition complète →êter
Le system prompt doit rendre l'arrarrL'Annual Recurring Revenue (ARR) est le revenu normalisé et prévisible qu'une entreprise par abonnement attend de ses contrats actifs sur une année.Voir la définition complète →êt explicite. Quelque chose comme :
> « Cherche dans la bibliothèque de politiques autant de fois que nécessaire. Après chaque résultat, décide : ai-je assez d'éléments pour répondre complètement et citer mes sources ? Si oui, réponds. Sinon, relance une recherche avec d'autres termes. Ne dépasse pas 5 recherches. Si tu n'es toujours pas sûr, indique ce qui manque. »
Sans cela, certains modèles cherchent une fois et s'arrarrL'Annual Recurring Revenue (ARR) est le revenu normalisé et prévisible qu'une entreprise par abonnement attend de ses contrats actifs sur une année.Voir la définition complète →êtent ; d'autres cherchent sans fin. L'instruction façonne le comportement.
3. Varier la requête, pas la répéter
Un échec courant : l'agent lance deux fois la même recherche et obtient les mêmes résultats faibles. Un bon prompt l'incite à *reformuler* : essayer des synonymes, cibler une section, ou décomposer une question composite. « Validation vol international prestataire » devient trois recherches ciblées, pas trois fois la même.
Un avant/après concret
Question : « Un prestataire peut-il se faire rembourser des vols internationaux ? »
Réponse du RAG one-shot :
> « Les prestataires peuvent être remboursés des déplacements validés au préalable. » (Rate entièrement la règle de validation pour l'international. Techniquement vraie, pratiquement incomplète.)
Réponse du RAG agentique :
> « Oui, sous deux conditions. Les prestataires sont éligibles au remboursement des déplacements validés au préalable (Politique de déplacement, sec. 3.1). Les vols internationaux de plus de 2 000 $ nécessitent l'accord d'un VPVPFormulation claire des bénéfices apportés par votre produit, des problèmes qu'il résout et des raisons pour lesquelles les clients doivent vous choisir plutôt qu'une alternative.Voir la définition complète → avant réservation (sec. 4.2). Soumettez le formulaire de validation préalable au moins 10 jours ouvrés à l'avance (sec. 4.5). »
La seconde réponse a nécessité trois recherches et coûté quelques centimes de plus. Pour une question sensible en matière de conformité, l'arbitrage est simple. Pour « à quelle heure ouvre le bureau », ce serait du gâchis.
À retenir
- RAG agentique = recherche en boucle. Le modèle cherche, lit et cherche encore jusqu'à en savoir assez, au lieu de faire une seule recherche en espérant que ça suffise.
- Adaptez la méthode à la question. One-shot pour les requêtes à fait unique, à fort volume et à faible enjeu. Agentique pour les questions multi-sections, à fort enjeu, ou demandant beaucoup de citations.
- Plafonnez toujours la boucle. Une limite stricte (par exemple 5 recherches) plus une consigne claire de « quand s'arrarrL'Annual Recurring Revenue (ARR) est le revenu normalisé et prévisible qu'une entreprise par abonnement attend de ses contrats actifs sur une année.Voir la définition complète →êter » évitent les dérives de coût et les boucles infinies.
- Demandez-lui de reformuler, pas de répéter. Dites à l'agent de varier les termes de recherche pour que chaque itération apporte de nouvelles preuves.
- Envisagez une approche hybride. One-shot par défaut, escalade vers la boucle agentique seulement quand les premiers résultats paraissent faibles. Cela maintient les coûts bas tout en protégeant la qualité là où elle compte.
Articles liés
Les articles récents du blog qui s'appuient sur cette leçon.
- IARAG en entreprise : ce qui fonctionne vraiment en 2026Le RAG (Retrieval-Augmented Generation) est aujourd'hui déployé dans des centaines d'organisations, mais les résultats varient considérablement selon les choix d'architecture et de gouvernance. Voici ce que les déploiements réussis ont en commun, et pourquoi la majorité des projets pilotes n'atteignent jamais la production.
- IARAG en entreprise : ce qui fonctionne vraiment en 2026La génération augmentée par récupération suscite beaucoup d'attentes dans les organisations, mais les déploiements réels révèlent des écarts importants entre la promesse et la pratique. Voici ce que les professionnels qui pilotent ces projets apprennent à leurs dépens.
- IARAG en entreprise : ce qui fonctionne vraiment en 2026La génération augmentée par récupération suscite beaucoup d'attentes dans les organisations, mais les déploiements réels révèlent des écarts importants entre la promesse et la pratique. Voici ce que les professionnels qui utilisent RAG au quotidien ont appris à leurs dépens.