Choisir la bonne approche : prompt, RAG, fine-tuning ou agent
Une startup a passé quatre mois et 80 000 $ à fine-tuner un modèle pour répondre aux questions des clients sur son produit. Puis un concurrent a livré la même fonctionnalité en un week-end en collant sa documentation d'aide dans un prompt. Le concurrent a gagné. Choisir la mauvaise approche est l'erreur la plus coûteuse d'un projet IA, et elle est presque toujours évitable.
Il existe quatre façons courantes de construire avec des grands modèles de langage (LLMLLMUn Large Language Model est un système d'IA entraîné sur d'énormes volumes de texte pour prédire et générer du langage, ce qui permet de rédiger, résumer ou répondre à des questions.Voir la définition complète →, l'IA derrière ChatGPT, Claude et Gemini). Chacune résout un problème différent. La plupart des gens optent pour la solution compliquée alors que la simple aurait suffi.
Corrigeons cela.
Les quatre approches en clair
Prompting. Vous écrivez de bonnes instructions et vous les envoyez au modèle. Aucune mise en place, aucun code requis.
RAG (Retrieval-Augmented Generation). Vous donnez au modèle vos propres documents à lire avant qu'il réponde. « Retrieval » signifie qu'il va chercher l'information ; « augmented » signifie qu'il utilise ce qu'il a trouvé pour écrire une meilleure réponse.
Fine-tuning. Vous entraînez le modèle sur de nombreux exemples pour qu'il absorbe durablement un style, un format ou un comportement spécialisé.
Agents. Vous laissez le modèle agir : chercher sur le web, envoyer un email, interroger une base de données, exécuter d'autres outils, en boucle, jusqu'à ce que la tâche soit accomplie.
Voici l'ordre dans lequel les envisager : le prompt d'abord, puis le RAG, puis l'agent, et le fine-tuning presque en dernier. L'approche la plus simple qui fonctionne est la bonne.
Un arbre de décision réellement utilisable
Ancrons tout dans un scénario concret : vous dirigez un cabinet d'avocats de taille moyenne et vous voulez que l'IA aide à rédiger des contrats et à répondre aux questions les concernant.
Descendons l'arbre.
Question 1 : un prompt intelligent et bien écrit suffit-il ?
Essayez cela en premier. Toujours.
Les modèles actuels (GPT-5, Claude 4.5, Gemini 2.5) sont extrêmement performants d'emblée. Si votre tâche repose sur des connaissances générales ou du raisonnement, un prompt peut suffire.
Pour le cabinet : « Expliquez la différence entre une clause d'indemnisation et une clause de garantie en langage clair » ne demande aucune mise en place. Il suffit de demander.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5",
input="Explain the difference between an indemnity "
"and a warranty clause in a commercial contract, "
"in plain English, for a non-lawyer."
)
print(response.output_text)Si un prompt répond à votre question de façon fiable, arrêtez-vous là. C'est terminé. Ne construisez rien d'autre.
Pour un guide plus approfondi sur l'écriture de prompts efficaces, la documentation Anthropic sur le prompt engineering est gratuite et excellente.
Question 2 : la tâche nécessite-t-elle VOS informations spécifiques ?
Le modèle ne connaît ni vos contrats, ni vos clients, ni vos politiques internes. Si la réponse se trouve dans vos documents, il vous faut du RAG.
Pour le cabinet : « Quel est le délai de préavis de résiliation dans le contrat du compte Henderson ? » Le modèle n'a jamais vu ce contrat. Alors vous le lui donnez.
Comment fonctionne le RAGRAGMéthode qui permet à un modèle d'IA de répondre à partir de vos propres documents, en récupérant les passages pertinents avant de générer une réponse.Voir la définition complète → en trois étapes :
- Découpez vos documents en chunks et stockez-les dans une base consultable (une « base vectorielle » qui retrouve du texte par le sens, pas seulement par mots-clés).
- Quand une question arrive, récupérez les chunks les plus pertinents.
- Collez ces chunks dans le prompt pour que le modèle réponde à partir de vos données réelles.
Une version minimale se résume à un copier-coller intelligent :
relevant_clause = search_contracts("Henderson termination notice")
prompt = f"""Using ONLY the contract text below, answer the question.
If the answer isn't present, say so.
CONTRACT TEXT:
{relevant_clause}
QUESTION: What is the termination notice period?"""
response = client.responses.create(model="gpt-5", input=prompt)
print(response.output_text)Le RAG est le cheval de trait de l'IA en entreprise en 2026. Support client, bases de connaissances internes, questions-réponses sur documents : l'essentiel repose sur du RAG. Il maintient les réponses ancrées dans vos données réelles et à jour, et réduit les réponses inventées (les « hallucinations »).
Raccourci pour les petits corpus documentaires : les modèles actuels ont d'énormes fenêtres de contexte (Gemini 2.5 gère plus d'un million de tokenstokensUn token est l'unité de base de texte que traitent les modèles de langage : le plus souvent un fragment de mot, un mot entier ou un signe de ponctuation, plutôt qu'un simple caractère.Voir la définition complète →, soit quelques milliers de pages). Si vous n'avez qu'une poignée de documents, vous pouvez vous passer de la base vectorielle et tout coller directement. Ne construisez le pipelinepipelineL'ensemble des opportunités commerciales actives réparties selon les étapes du processus de vente, avec leur valeur potentielle cumulée et leur probabilité de conclusion.Voir la définition complète → RAG complexe que lorsque votre pile de documents devient trop volumineuse.
Question 3 : faut-il AGIR, et pas seulement répondre ?
Si la tâche implique de faire des choses dans le monde réel (plusieurs étapes, usage d'outils, décisions en cours de route), il vous faut un agent.
Pour le cabinet : « Examinez ce nouveau contrat, signalez toute clause en conflit avec nos conditions standard, vérifiez si la contrepartie a des litiges passés dans notre système, et rédigez un email de synthèse à l'associé. » Ce n'est pas une réponse unique. C'est une séquence d'actions avec usage d'outils.
Un agent boucle : réfléchir, agir, observer le résultat, réfléchir à nouveau, jusqu'à ce que le travail soit terminé.
response = client.responses.create(
model="gpt-5",
input="Review the attached contract. Flag clauses that "
"conflict with our standard terms, look up the "
"counterparty in our disputes database, and draft "
"a summary email to the partner.",
tools=[
{"type": "file_search"}, # lire le contrat
{"type": "function", "name": "query_disputes_db"},
{"type": "function", "name": "draft_email"}
]
)Les agents sont puissants et constituent le sujet brbrLe pourcentage de visiteurs qui repartent après avoir vu une seule page, souvent le signe d'une pertinence insuffisante, d'un décalage d'intention ou d'une expérience utilisateur faible.Voir la définition complète →ûlant de 2026, mais ils sont plus difficiles à contrôler et peuvent échouer de façon surprenante. Donnez à un agent le plus petit jeu d'outils dont il a besoin, et gardez un humain qui valide tout ce qui est risqué (comme l'envoi de cet email). Démarrez les agents sur un périmètre étroit.
RAG vs Fine-Tuning vs Prompt Engineering
Vérification des acquis
1. Selon la leçon, dans quel ordre faut-il envisager les quatre approches lorsqu'on construit avec des LLM ?
2. Qu'est-ce qui décrit le mieux l'objectif central du RAG (Retrieval-Augmented Generation) ?
3. Dans l'exemple du cabinet d'avocats, la question « Expliquez la différence entre une clause d'indemnisation et une clause de garantie en langage clair » relève de quelle approche, et pourquoi ?
4. Sélectionnez TOUTES les affirmations qui distinguent correctement les quatre approches décrites dans la leçon.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les raisons données par la leçon expliquant pourquoi le choix de l'approche compte et pourquoi le plus simple est souvent préférable.
Sélectionnez toutes les réponses correctes.
Question 4 : avez-vous besoin d'un STYLE ou d'un FORMAT constant que le modèle refuse de suivre ?
C'est là qu'intervient le fine-tuningfine-tuningLe fine-tuning adapte un modèle pré-entraîné à une tâche ou un domaine précis en poursuivant son entraînement sur un jeu de données plus petit et ciblé, ce qui améliore la précision et le style pour ce cas d'usage.Voir la définition complète →, et s'il vient en dernier, ce n'est pas un hasard.
Fine-tuner, c'est montrer au modèle des centaines ou des milliers d'exemples jusqu'à ce qu'un comportement devienne une seconde nature. C'est le bon outil quand :
- Vous avez besoin d'un ton ou d'un format très précis à chaque fois (le style de rédaction contractuelle propre à votre cabinet).
- Vous disposez de nombreux exemples de grande qualité pour l'entraînement.
- Le promptingpromptingLe prompt engineering consiste à concevoir et affiner des instructions textuelles pour guider les grands modèles de langage vers des réponses justes, pertinentes et fiables.Voir la définition complète → et le RAG ont réellement échoué, pas seulement à votre première tentative.
Pour le cabinet : si vous avez 2 000 contrats passés rédigés dans la voix distinctive de votre cabinet et que vous voulez que chaque projet la respecte à la lettre, le fine-tuning peut intégrer ce style en profondeur.
La distinction critique que l'on rate souvent : le fine-tuning enseigne un *style et un comportement*, pas des *faits*. Il est mauvais sur la connaissance. Si vous fine-tunez pour ajouter des informations sur le contrat Henderson, le modèle inventera des détails avec assurance. Pour les faits, utilisez le RAG. Pour le style, envisagez le fine-tuning.
# Fine-tuning starts with example pairs, not live questions
{"messages": [
{"role": "user", "content": "Draft a confidentiality clause."},
{"role": "assistant", "content": "<your firm's exact house style here>"}
]}
# Vous en fournissez des centaines, puis vous entraînez un modèle personnalisé.Le fine-tuning est ce qui coûte le plus cher en temps, en données et en argent. D'ici 2026, moins de projets en ont besoin qu'on ne le suppose, car les modèles de base et le RAG ne cessent de s'améliorer. N'y recourez que lorsque les outils plus simples ont échoué.
Assembler le tout : les approches se combinent
Ce ne sont pas des rivales. Les meilleurs systèmes les empilent.
L'outil final de notre cabinet pourrait être : un agent qui utilise le RAG pour lire les contrats, tourne sur un modèle fine-tuné pour le style maison, le tout piloté par des prompts soigneusement rédigés.
Mais ils n'ont pas construit cela dès le premier jour. Ils ont commencé par un prompt. Puis ils ont ajouté le RAG quand il a fallu leurs documents. Puis un agent quand il a fallu agir. Ils n'ont envisagé le fine-tuning qu'une fois tout le reste solide.
Cette séquence, c'est tout l'enjeu. Chaque étape ajoute du coût et de la complexité : il faut mériter de monter l'échelon suivant.
Aide-mémoire
- Prompt : connaissances générales ou raisonnement. Aucune mise en place. *« Expliquez cette clause. »*
- RAG : réponses à partir de vos propres documents. *« Que dit notre contrat Henderson ? »*
- Agent : tâches en plusieurs étapes et usage d'outils. *« Examinez, vérifiez la base, rédigez l'email. »*
- Fine-tuning : style ou format constant à partir de nombreux exemples. *« Écrivez toujours dans notre voix maison. »*
Points clés à retenir
- Commencez toujours par un prompt. C'est gratuit, immédiat et étonnamment performant. La plupart des idées devraient être testées ici avant de construire quoi que ce soit.
- Utilisez le RAG pour les faits, le fine-tuning pour le style. Confondre les deux est l'erreur la plus fréquente et la plus coûteuse. Vos documents vont dans le RAG ; votre ton va dans le fine-tuning.
- Méritez chaque échelon. Prompt, puis RAG, puis agent, et fine-tuning presque en dernier. Chaque étape ajoute du coût : ne montez que lorsque la plus simple échoue de façon démontrée.
- Pour les petits corpus documentaires, oubliez le RAG. Les grandes fenêtres de contexte actuelles permettent de coller quelques documents directement dans le prompt. Ne construisez le pipeline que lorsque la pile devient trop grosse.
- Combinez les approches dans les systèmes réels, mais ajoutez-les une à une. Validez chaque couche avant d'empiler la suivante.
À faire, tiré de cette leçon
Ces actions sont compilées dans le plan d'action du rôle.
- Montez les échelons dans l'ordre : prompt, RAG, agent, puis fine-tuning
- Utilisez le RAG pour les faits et le fine-tuning pour le style
- Passez le RAG et collez de petits ensembles de documents directement dans le prompt
Articles liés
Les articles récents du blog qui s'appuient sur cette leçon.
- IALa dépense IA par employé recule : alerte ou ajustement normal ?En août 2026, les dépenses IA par employé ont chuté dans plusieurs grandes entreprises, au moment même où les hyperscalers misaient sur une adoption en accélération. Avant de conclure à un essoufflement, il faut regarder ce que ces chiffres mesurent réellement, et ce qu'ils occultent.
- IABloomberg et les LLM : pourquoi ils ont choisi le fine-tuning plutôt que le RAG, et ce que ça révèleBloomberg a entraîné son propre modèle de langage sur 700 milliards de tokens financiers plutôt que de s'appuyer sur une architecture de récupération documentaire. Ce choix, documenté et assumé, illustre une décision d'architecture que beaucoup d'entreprises affrontent sans en mesurer les implications réelles.
- IAAncrer l'IA dans la connaissance de votre entreprise : le playbook opérationnelUn LLM généraliste ne connaît ni vos produits, ni vos processus, ni votre historique client. Ce playbook décrit, étape par étape, comment construire un système RAG qui répond à partir de vos données réelles, sans halluciner et sans exposer ce qui ne devrait pas l'être.