+160 XP

Choisir la bonne approche : prompt, RAG, fine-tuning ou agent

Une startup a passé quatre mois et 80 000 $ à fine-tuner un modèle pour répondre aux questions des clients sur son produit. Puis un concurrent a livré la même fonctionnalité en un week-end en collant sa documentation d'aide dans un prompt. Le concurrent a gagné. Choisir la mauvaise approche est l'erreur la plus coûteuse d'un projet IA, et elle est presque toujours évitable.

Il existe quatre façons courantes de construire avec des grands modèles de langage (LLM, l'IA derrière ChatGPT, Claude et Gemini). Chacune résout un problème différent. La plupart des gens optent pour la solution compliquée alors que la simple aurait suffi.

Corrigeons cela.

Les quatre approches en clair

Prompting. Vous écrivez de bonnes instructions et vous les envoyez au modèle. Aucune mise en place, aucun code requis.

RAG (Retrieval-Augmented Generation). Vous donnez au modèle vos propres documents à lire avant qu'il réponde. « Retrieval » signifie qu'il va chercher l'information ; « augmented » signifie qu'il utilise ce qu'il a trouvé pour écrire une meilleure réponse.

Fine-tuning. Vous entraînez le modèle sur de nombreux exemples pour qu'il absorbe durablement un style, un format ou un comportement spécialisé.

Agents. Vous laissez le modèle agir : chercher sur le web, envoyer un email, interroger une base de données, exécuter d'autres outils, en boucle, jusqu'à ce que la tâche soit accomplie.

Voici l'ordre dans lequel les envisager : le prompt d'abord, puis le RAG, puis l'agent, et le fine-tuning presque en dernier. L'approche la plus simple qui fonctionne est la bonne.

Un arbre de décision réellement utilisable

Ancrons tout dans un scénario concret : vous dirigez un cabinet d'avocats de taille moyenne et vous voulez que l'IA aide à rédiger des contrats et à répondre aux questions les concernant.

Descendons l'arbre.

Question 1 : un prompt intelligent et bien écrit suffit-il ?

Essayez cela en premier. Toujours.

Les modèles actuels (GPT-5, Claude 4.5, Gemini 2.5) sont extrêmement performants d'emblée. Si votre tâche repose sur des connaissances générales ou du raisonnement, un prompt peut suffire.

Pour le cabinet : « Expliquez la différence entre une clause d'indemnisation et une clause de garantie en langage clair » ne demande aucune mise en place. Il suffit de demander.

python
from openai import OpenAI
client = OpenAI()

response = client.responses.create(
    model="gpt-5",
    input="Explain the difference between an indemnity "
          "and a warranty clause in a commercial contract, "
          "in plain English, for a non-lawyer."
)
print(response.output_text)

Si un prompt répond à votre question de façon fiable, arrêtez-vous là. C'est terminé. Ne construisez rien d'autre.

Pour un guide plus approfondi sur l'écriture de prompts efficaces, la documentation Anthropic sur le prompt engineering est gratuite et excellente.

Question 2 : la tâche nécessite-t-elle VOS informations spécifiques ?

Le modèle ne connaît ni vos contrats, ni vos clients, ni vos politiques internes. Si la réponse se trouve dans vos documents, il vous faut du RAG.

Pour le cabinet : « Quel est le délai de préavis de résiliation dans le contrat du compte Henderson ? » Le modèle n'a jamais vu ce contrat. Alors vous le lui donnez.

Comment fonctionne le RAG en trois étapes :

  1. Découpez vos documents en chunks et stockez-les dans une base consultable (une « base vectorielle » qui retrouve du texte par le sens, pas seulement par mots-clés).
  2. Quand une question arrive, récupérez les chunks les plus pertinents.
  3. Collez ces chunks dans le prompt pour que le modèle réponde à partir de vos données réelles.

Une version minimale se résume à un copier-coller intelligent :

python
relevant_clause = search_contracts("Henderson termination notice")

prompt = f"""Using ONLY the contract text below, answer the question.
If the answer isn't present, say so.

CONTRACT TEXT:
{relevant_clause}

QUESTION: What is the termination notice period?"""

response = client.responses.create(model="gpt-5", input=prompt)
print(response.output_text)

Le RAG est le cheval de trait de l'IA en entreprise en 2026. Support client, bases de connaissances internes, questions-réponses sur documents : l'essentiel repose sur du RAG. Il maintient les réponses ancrées dans vos données réelles et à jour, et réduit les réponses inventées (les « hallucinations »).

Raccourci pour les petits corpus documentaires : les modèles actuels ont d'énormes fenêtres de contexte (Gemini 2.5 gère plus d'un million de tokens, soit quelques milliers de pages). Si vous n'avez qu'une poignée de documents, vous pouvez vous passer de la base vectorielle et tout coller directement. Ne construisez le pipeline RAG complexe que lorsque votre pile de documents devient trop volumineuse.

Question 3 : faut-il AGIR, et pas seulement répondre ?

Si la tâche implique de faire des choses dans le monde réel (plusieurs étapes, usage d'outils, décisions en cours de route), il vous faut un agent.

Pour le cabinet : « Examinez ce nouveau contrat, signalez toute clause en conflit avec nos conditions standard, vérifiez si la contrepartie a des litiges passés dans notre système, et rédigez un email de synthèse à l'associé. » Ce n'est pas une réponse unique. C'est une séquence d'actions avec usage d'outils.

Un agent boucle : réfléchir, agir, observer le résultat, réfléchir à nouveau, jusqu'à ce que le travail soit terminé.

python
response = client.responses.create(
    model="gpt-5",
    input="Review the attached contract. Flag clauses that "
          "conflict with our standard terms, look up the "
          "counterparty in our disputes database, and draft "
          "a summary email to the partner.",
    tools=[
        {"type": "file_search"},      # lire le contrat
        {"type": "function", "name": "query_disputes_db"},
        {"type": "function", "name": "draft_email"}
    ]
)

Les agents sont puissants et constituent le sujet brûlant de 2026, mais ils sont plus difficiles à contrôler et peuvent échouer de façon surprenante. Donnez à un agent le plus petit jeu d'outils dont il a besoin, et gardez un humain qui valide tout ce qui est risqué (comme l'envoi de cet email). Démarrez les agents sur un périmètre étroit.

RAG vs Fine-Tuning vs Prompt Engineering

Watch on YouTube

Vérification des acquis

1. Selon la leçon, dans quel ordre faut-il envisager les quatre approches lorsqu'on construit avec des LLM ?

2. Qu'est-ce qui décrit le mieux l'objectif central du RAG (Retrieval-Augmented Generation) ?

3. Dans l'exemple du cabinet d'avocats, la question « Expliquez la différence entre une clause d'indemnisation et une clause de garantie en langage clair » relève de quelle approche, et pourquoi ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les affirmations qui distinguent correctement les quatre approches décrites dans la leçon.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les raisons données par la leçon expliquant pourquoi le choix de l'approche compte et pourquoi le plus simple est souvent préférable.

Sélectionnez toutes les réponses correctes.

Question 4 : avez-vous besoin d'un STYLE ou d'un FORMAT constant que le modèle refuse de suivre ?

C'est là qu'intervient le fine-tuning, et s'il vient en dernier, ce n'est pas un hasard.

Fine-tuner, c'est montrer au modèle des centaines ou des milliers d'exemples jusqu'à ce qu'un comportement devienne une seconde nature. C'est le bon outil quand :

  • Vous avez besoin d'un ton ou d'un format très précis à chaque fois (le style de rédaction contractuelle propre à votre cabinet).
  • Vous disposez de nombreux exemples de grande qualité pour l'entraînement.
  • Le prompting et le RAG ont réellement échoué, pas seulement à votre première tentative.

Pour le cabinet : si vous avez 2 000 contrats passés rédigés dans la voix distinctive de votre cabinet et que vous voulez que chaque projet la respecte à la lettre, le fine-tuning peut intégrer ce style en profondeur.

La distinction critique que l'on rate souvent : le fine-tuning enseigne un *style et un comportement*, pas des *faits*. Il est mauvais sur la connaissance. Si vous fine-tunez pour ajouter des informations sur le contrat Henderson, le modèle inventera des détails avec assurance. Pour les faits, utilisez le RAG. Pour le style, envisagez le fine-tuning.

python
# Fine-tuning starts with example pairs, not live questions
{"messages": [
    {"role": "user", "content": "Draft a confidentiality clause."},
    {"role": "assistant", "content": "<your firm's exact house style here>"}
]}
# Vous en fournissez des centaines, puis vous entraînez un modèle personnalisé.

Le fine-tuning est ce qui coûte le plus cher en temps, en données et en argent. D'ici 2026, moins de projets en ont besoin qu'on ne le suppose, car les modèles de base et le RAG ne cessent de s'améliorer. N'y recourez que lorsque les outils plus simples ont échoué.

Assembler le tout : les approches se combinent

Ce ne sont pas des rivales. Les meilleurs systèmes les empilent.

L'outil final de notre cabinet pourrait être : un agent qui utilise le RAG pour lire les contrats, tourne sur un modèle fine-tuné pour le style maison, le tout piloté par des prompts soigneusement rédigés.

Mais ils n'ont pas construit cela dès le premier jour. Ils ont commencé par un prompt. Puis ils ont ajouté le RAG quand il a fallu leurs documents. Puis un agent quand il a fallu agir. Ils n'ont envisagé le fine-tuning qu'une fois tout le reste solide.

Cette séquence, c'est tout l'enjeu. Chaque étape ajoute du coût et de la complexité : il faut mériter de monter l'échelon suivant.

Aide-mémoire

  • Prompt : connaissances générales ou raisonnement. Aucune mise en place. *« Expliquez cette clause. »*
  • RAG : réponses à partir de vos propres documents. *« Que dit notre contrat Henderson ? »*
  • Agent : tâches en plusieurs étapes et usage d'outils. *« Examinez, vérifiez la base, rédigez l'email. »*
  • Fine-tuning : style ou format constant à partir de nombreux exemples. *« Écrivez toujours dans notre voix maison. »*

Points clés à retenir

  1. Commencez toujours par un prompt. C'est gratuit, immédiat et étonnamment performant. La plupart des idées devraient être testées ici avant de construire quoi que ce soit.
  2. Utilisez le RAG pour les faits, le fine-tuning pour le style. Confondre les deux est l'erreur la plus fréquente et la plus coûteuse. Vos documents vont dans le RAG ; votre ton va dans le fine-tuning.
  3. Méritez chaque échelon. Prompt, puis RAG, puis agent, et fine-tuning presque en dernier. Chaque étape ajoute du coût : ne montez que lorsque la plus simple échoue de façon démontrée.
  4. Pour les petits corpus documentaires, oubliez le RAG. Les grandes fenêtres de contexte actuelles permettent de coller quelques documents directement dans le prompt. Ne construisez le pipeline que lorsque la pile devient trop grosse.
  5. Combinez les approches dans les systèmes réels, mais ajoutez-les une à une. Validez chaque couche avant d'empiler la suivante.

À faire, tiré de cette leçon

Ces actions sont compilées dans le plan d'action du rôle.

  • Montez les échelons dans l'ordre : prompt, RAG, agent, puis fine-tuning
  • Utilisez le RAG pour les faits et le fine-tuning pour le style
  • Passez le RAG et collez de petits ensembles de documents directement dans le prompt
Voir le plan d'action complet →

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.