Hallucinations : pourquoi des réponses assurées peuvent être fausses
En 2023, un avocat new-yorkais nommé Steven Schwartz a déposé un mémoire juridique citant six décisions de justice : *Varghese v. China Southern Airlines*, *Martinez v. Delta Air Lines*, et quatre autres. Elles avaient des noms, des numéros de dossier, des citations, des juges. Elles semblaient parfaites.
Elles étaient aussi entièrement fausses. ChatGPT les avait toutes inventées. Le juge a infligé une amende de 5 000 dollars à Schwartz et à son confrère, et l'affaire a fait le tour du monde.
Voici le point dérangeant : ChatGPT n'a pas « menti ». Il a fait exactement ce pour quoi il a été conçu. Comprendre pourquoi est la chose la plus utile que vous puissiez apprendre sur l'IA.
Ce qu'est réellement une hallucinationhallucinationUne hallucination, c'est lorsqu'un modèle d'IA produit une réponse fluide et assurée mais factuellement fausse, inventée, ou non étayée par ses données sources.Voir la définition complète →
Une hallucination, c'est quand un modèle d'IA produit un texte fluide, assuré et faux. Pas « faux » comme une coquille. Faux comme inventer une décision de justice, un article de recherche, une citation ou une statistique qui n'a jamais existé.
Le mot est un peu trompeur. Le modèle ne « voit » rien. Il génère la suite de mots la plus plausible, et parfois la réponse la plus plausible n'est pas la vraie.
Pourquoi cela arrive
Un grand modèle de langage (un « LLMLLMUn Large Language Model est un système d'IA entraîné sur d'énormes volumes de texte pour prédire et générer du langage, ce qui permet de rédiger, résumer ou répondre à des questions.Voir la définition complète → », la technologie derrière ChatGPT, Claude et Gemini) fait une seule chose essentielle : il prédit le mot suivant, encore et encore, à partir de motifs appris sur d'énormes quantités de texte.
Il ne dispose pas d'une base de faits qu'il consulterait. Il a des *motifs*. Quand vous demandez une référence juridique, il sait à quoi ressemble une référence : un nom d'affaire, « v. », deux parties, une juridiction, une année. Il produit donc quelque chose qui a exactement la forme d'une vraie référence, que l'affaire existe ou non.
Voyez-le comme un acteur d'improvisation brillant. Demandez-lui un film de science-fiction bulgare des années 1990 et il en nommera un avec assurance, décrira l'intrigue et fera l'éloge de l'acteur principal. La performance est irréprochable. Le film est une fiction.
Pourquoi cela sonne si assuré
C'est ce qui a trompé l'avocat, et cela trompe tout le monde au début.
Les LLM sont entraînés à produire un texte clair, fluide, au ton faisant autorité. Ils ne sont pas entraînés à exprimer le doute avec justesse. Un modèle n'a aucune perception interne de « je sais vraiment ceci » par opposition à « je devine ». Les deux sortent avec la même voix lisse et professionnelle.
Une référence inventée se lit donc exactement comme une vraie. Pas de vacillement, pas d'hésitation, pas de « je crois mais je n'en suis pas sûr ». La fluidité n'est pas l'exactitude, mais notre cerveau les traite comme la même chose.
C'est pourquoi « ça avait l'air tellement sûr » est la pire raison possible de faire confiance à une réponse.
Où les hallucinations sont les plus dangereuses
Certaines questions sont beaucoup plus risquées que d'autres. Méfiez-vous quand vous demandez :
- Des références, sources ou URL précises. Les modèles adorent inventer des liens et des titres d'articles crcrLe pourcentage de visiteurs ou de prospects qui réalisent une action attendue (achat, inscription, formulaire de contact), calculé en divisant les conversions par le nombre total d'opportunités.Voir la définition complète →édibles.
- Des chiffres, dates et statistiques exacts. « 73 % des entreprises » a l'air précis. C'est souvent une supposition.
- Des citations attribuées à des personnes réelles. Faciles à fabriquer, difficiles à repérer.
- Des points juridiques, médicaux ou financiers précis. Enjeux élevés, et le modèle n'a aucune habilitation.
- Des événements récents hors du périmètre d'entraînement du modèle, sauf s'il fait une recherche active sur le web.
- Des sujets de niche ou obscurs pour lesquels il y avait peu de données d'entraînement.
Le principe : plus une affirmation est précise et vérifiable, plus vous devriez la vérifier.
Un exemple réel que vous pouvez tester
Posez cette question à n'importe quel chatbot :
« Donne-moi trois études évaluées par des pairs sur l'effet des plantes d'intérieur sur la productivité au bureau, avec les auteurs et les noms des revues. »
Vous obtiendrez souvent des références nettes, assurées, magnifiquement formatées. Essayez ensuite de les trouver sur Google Scholar. Certaines seront peut-être réelles. Certaines auront de vrais auteurs mais un titre inventé. Certaines n'existeront pas du tout. Cet exercice unique enseigne la leçon mieux que n'importe quel avertissement.
Les habitudes simples qui permettent de les repérer
Pas besoin d'être technique pour vous protéger. Il vous faut quelques réflexes.
1. Traitez la sortie de l'IA comme un brouillon, pas comme un verdict
Le modèle vous donne un point de départ. Vous êtes l'éditeur. Pour tout ce qui compte, vérifiez avant d'utiliser.
2. Demandez les sources, puis vérifiez-les vraiment
Demander « quelle est ta source ? » aide un peu, mais le modèle peut aussi inventer des sources. La vraie étape, c'est de cliquer. Si un lien ne s'ouvre pas ou si une affaire n'apparaît pas dans une vraie base de données, abandonnez l'affirmation.
3. Utilisez des outils qui cherchent sur le web
En 2026, ChatGPT, Claude et Gemini savent tous naviguer sur le web et citer des pages en direct. Cela réduit fortement les hallucinations sur les faits d'actualité, parce que le modèle lit de vraies sources au lieu de rappeler des motifs. Activez cette option pour tout ce qui est factuel :
- Dans ChatGPT, utilisez le mode recherche ou les outils de recherche approfondie.
- Dans Claude, activez la recherche web.
- Dans Gemini, il s'appuie sur Google Search et affiche les liens.
Cliquez toujours sur les liens affichés. Une source citée n'est utile que si elle dit effectivement ce que le modèle affirme.
4. Demandez au modèle de signaler sa propre incertitude
Ce prompt aide :
« Réponds à la question. Puis indique quelles affirmations précises te semblent fiables et lesquelles sont incertaines ou relèvent peut-être d'une supposition. »
Ce n'est pas parfait, mais cela fait souvent remonter les parties fragiles.
5. Recoupez avec deux modèles
Si ChatGPT et Gemini donnent indépendamment la même réponse, votre confiance peut monter. S'ils divergent, vous avez trouvé exactement l'endroit à creuser.
Vérification des acquis
1. D'après la leçon, quelle est la définition la plus juste d'une « hallucination » d'IA ?
2. Pourquoi un LLM invente-t-il une référence juridique qui a l'air parfaitement réelle ?
3. Selon la leçon, pourquoi les hallucinations paraissent-elles si convaincantes et assurées ?
4. Sélectionnez TOUTES les affirmations qui reflètent correctement le raisonnement de la leçon sur les hallucinations.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les descriptions exactes du fonctionnement d'un grand modèle de langage, selon la leçon.
Sélectionnez toutes les réponses correctes.
Une habitude légèrement technique : ancrer la réponse
Si vous développez avec les outils d'IA (via leur interface pour développeurs, appelée APIAPIApplication Programming Interface : une interface standardisée qui permet aux applications de communiquer et d'échanger des données sans connaître leur fonctionnement interne respectif.Voir la définition complète →, un moyen pour des programmes d'envoyer des requêtes au modèle), vous pouvez réduire les hallucinations en fournissant vous-même le texte source au modèle. On appelle cela le grounding : au lieu de demander au modèle de se souvenir, vous lui remettez les faits et lui demandez de répondre uniquement à partir de ceux-ci.
Voici l'idée dans un court extrait Python utilisant l'API OpenAI :
from openai import OpenAI
client = OpenAI()
source_text = """
Our return policy: customers can return items within 30 days
for a full refund. Electronics must be returned within 14 days.
"""
response = client.chat.completions.create(
model="gpt-4o",
messages=[
{
"role": "system",
"content": (
"Answer ONLY using the provided policy text. "
"If the answer is not in the text, say 'Not specified.'"
),
},
{"role": "user", "content": source_text + "\nHow long do I have to return a laptop?"},
],
)
print(response.choices[0].message.content)L'instruction « si la réponse n'est pas dans le texte, dis 'Not specified' » donne au modèle la permission d'admettre qu'il ne sait pas. Cette seule ligne évite beaucoup de suppositions assurées. Le modèle devrait répondre « 14 days » ici, et refuser d'inventer une politique que vous ne lui avez jamais donnée.
Pas besoin de coder pour utiliser cette idée. Même dans la fenêtre de chat, coller le document réel et dire « réponds uniquement à partir de ce texte » fonctionne de la même façon.
Ce que les hallucinations ne sont pas
Une précision rapide, parce qu'on met souvent en cause la mauvaise chose.
Une hallucination n'est pas un bug qui sera corrigé le mois prochain. C'est un effet secondaire du fonctionnement de ces modèles. Les modèles plus récents de 2026 hallucinent moins, surtout lorsqu'ils cherchent sur le web, mais aucun modèle n'est à zéro. Construisez vos habitudes comme si cela pouvait toujours arriver, parce que c'est le cas.
Ce n'est pas non plus de la malveillance de la part du modèle. Il n'y a pas d'intention. C'est une complétion de motifs qui a abouti à une fausseté assurée.
Retour à l'avocat
La véritable erreur de Schwartz n'a pas été d'utiliser ChatGPT. Beaucoup d'avocats utilisent bien l'IA. Son erreur a été de faire confiance à une sortie assurée sur une tâche à fort enjeu et très facilement vérifiable, sans contrôler une seule référence.
Une recherche dans une base de données juridique l'aurait détecté en quelques minutes. L'outil n'était pas en cause. C'est l'habitude de vérification qui manquait.
Toute la leçon est là : l'IA est un assistant rapide, fluide, parfois faux. Votre jugement est le contrôle de sécurité.
Points clés
- La fluidité n'est pas l'exactitude. Une réponse assurée et soignée peut être totalement fabriquée. Ne prenez jamais le ton pour une preuve.
- Vérifiez tout ce qui est précis et à fort enjeu : références, chiffres, citations, liens, et affirmations juridiques, médicales ou financières. Remontez jusqu'à une vraie source.
- Activez la recherche web dans ChatGPT, Claude ou Gemini pour les questions factuelles, et contrôlez les liens cités au lieu de leur faire aveuglément confiance.
- Ancrez le modèle en collant le texte source réel et en lui demandant de répondre uniquement à partir de celui-ci, et de dire « non précisé » quand la réponse est absente.
- Traitez chaque réponse d'IA comme un brouillon à éditer, pas comme un verdict à publier. C'est vous le contrôle final, à chaque fois.
À faire, tiré de cette leçon
Ces actions sont compilées dans le plan d'action du rôle.
- Vérifier toutes les citations, chiffres, dates, noms et affirmations sensibles auprès des sources
- Ancrez le modèle en collant le texte source et en limitant les réponses à ce texte
- Demandez au modèle d'utiliser des outils pour les calculs et la recherche web pour les faits
- Traitez chaque réponse de l'IA comme un brouillon que vous éditez
Articles liés
Les articles récents du blog qui s'appuient sur cette leçon.
- IAShopify ouvre le checkout aux agents IA, et le droit à l'erreur rétrécitShopify étend son support WebMCP au checkout, permettant à des agents IA de finaliser des achats au nom d'un acheteur. Quand un modèle hallucine une adresse, un produit ou un montant à ce stade du tunnel, les conséquences ne sont plus théoriques.
- IAUne hallucination d'IA a failli déclencher une frappe militaire américaine sur des installations nucléaires chinoisesUn modèle de langage utilisé par des analystes militaires américains a produit des informations fausses sur des composants nucléaires chinois, poussant des décideurs à envisager une réponse armée. Ce cas illustre ce qui arrive quand on confie une décision à enjeux extrêmes à un système conçu pour prédire des tokens, non pour vérifier des faits.
- IAQuand l'IA se trompe sur le réseau électrique : ce que les décideurs de l'énergie doivent comprendreUn modèle de langage qui hallucine une donnée de réseau peut déclencher une action opérationnelle aux conséquences réelles. Pour les responsables IA dans le secteur de l'énergie et des utilities, comprendre la mécanique de cet échec n'est pas une option théorique.