Ce que fait réellement un modèle : de la prédiction, pas de la compréhension
Tapez « La capitale de la France est » dans n'importe quel outil d'IA et il répondra « Paris ». On a l'impressionimpressionLe nombre total de fois qu'une publicité ou un contenu est affiché, indépendamment des clics. Chaque affichage compte pour une impression, même auprès de la même personne.Voir la définition complète → que le modèle *sait*. Ce n'est pas le cas. Il a simplement calculé que « Paris » était le mot le plus probable pour continuer la phrase, à partir des régularités observées dans des milliards de phrases sur lesquelles il a été entraîné. La réponse est juste, mais le mécanisme est la prédiction, pas la connaissance.
Cette seule idée explique presque tout ce qui paraît bizarre quand on travaille avec l'IA : pourquoi les prompts comptent autant, pourquoi la même question donne des réponses différentes, et à quel moment il faut vérifier avant de faire confiance.
L'autocomplétion extrêmement bien lue
Vous utilisez déjà la prédiction tous les jours. Votre téléphone suggère le mot suivant quand vous écrivez un message. Tapez « J'arrive dans cinq » et il propose « minutes ». C'est une minuscule autocomplétion entraînée sur des expressions courantes.
Un grand modèle de langage (LLMLLMUn Large Language Model est un système d'IA entraîné sur d'énormes volumes de texte pour prédire et générer du langage, ce qui permet de rédiger, résumer ou répondre à des questions.Voir la définition complète →, la technologie derrière ChatGPT, Claude et Gemini) est la même idée, à une échelle massivement supérieure. Il a lu une part énorme d'internet, de livres et de code, et appris les régularités statistiques de la façon dont le langage s'enchaîne.
Quand vous lui demandez quelque chose, il ne va pas chercher une réponse dans une base de données. Il génère une réponse un tokentokenUn token est l'unité de base de texte que traitent les modèles de langage : le plus souvent un fragment de mot, un mot entier ou un signe de ponctuation, plutôt qu'un simple caractère.Voir la définition complète → à la fois. Un token est un morceau de texte, généralement un mot ou une partie de mot (« marchant » peut être « march » + « ant »). Pour chaque token, le modèle se demande : *compte tenu de tout ce qui précède, que vient-il ensuite ?*
Il choisit un token probable, l'ajoute, puis recommence. Un texte entier n'est que ce jeu de devinettes répété des milliers de fois.
Pourquoi le « bien lu » compte
Parce qu'il a vu énormément de texte, les prédictions du modèle sont souvent réellement utiles. Il a absorbé la façon dont se formulent les contrats juridiques, la structure des fonctions Python, l'ouverture d'un email courtois. C'est du pattern-matching réel et précieux.
Mais ça reste du pattern-matching. **Le modèle n'a aucune notion de *vrai* ou *faux***. Il a une notion de *probable* ou *improbable*. Le plus souvent, les deux se recouvrent. Parfois non, et c'est dans cet écart que les choses dérapent.
Pourquoi la même question donne des réponses différentes
Demandez trois fois à ChatGPT « Donne-moi un nom pour mon café » et vous obtiendrez trois listes différentes. Ça surprend. Un ordinateur ne devrait-il pas être constant ?
Voici pourquoi il ne l'est pas. À chaque étape, le modèle ne choisit pas simplement le token le plus probable. Il choisit parmi un éventail d'options probables, avec une part d'aléatoire. C'est piloté par un réglage appelé temperaturetemperatureUn reglage qui controle le caractere aleatoire ou previsible des reponses d'un modele d'IA : bas pour la coherence, haut pour la creativite.Voir la définition complète →.
- Temperature basse (proche de 0) : le modèle prend presque toujours le token le plus probable. La sortie est répétitive et prévisible.
- Temperature plus élevée (autour de 0,7 à 1,0) : le modèle prend plus de risques. La sortie est plus crcrLe pourcentage de visiteurs ou de prospects qui réalisent une action attendue (achat, inscription, formulaire de contact), calculé en divisant les conversions par le nombre total d'opportunités.Voir la définition complète →éative et variée.
La plupart des outils de chat tournent par défaut à une temperature moyenne, d'où des réponses inédites à chaque fois. Si vous utilisez l'APIAPIApplication Programming Interface : une interface standardisée qui permet aux applications de communiquer et d'échanger des données sans connaître leur fonctionnement interne respectif.Voir la définition complète → (l'interface développeur pour envoyer des requêtes directement au modèle), vous pouvez la régler vous-même :
from openai import OpenAI
client = OpenAI()
response = client.chat.completions.create(
model="gpt-5",
temperature=0.2, # basse = réponses plus constantes et ciblées
messages=[
{"role": "user", "content": "Name 3 ideas for a coffee shop."}
]
)
print(response.choices[0].message.content)Mettez temperature=0.2 et lancez deux fois : les réponses seront très proches. Mettez 1.0 et les listes divergeront fortement. Même prompt, autre lancer de dés.
À retenir en pratique : pour du brainstorming créatif, profitez de la variation. Pour les tâches où vous avez besoin de constance (extraction de données, classification, mise en forme), baissez la temperature ou passez par l'API où vous la contrôlez.
Pourquoi la prédiction explique les hallucinations
Une hallucinationhallucinationUne hallucination, c'est lorsqu'un modèle d'IA produit une réponse fluide et assurée mais factuellement fausse, inventée, ou non étayée par ses données sources.Voir la définition complète →, c'est quand le modèle affirme quelque chose de faux avec une totale assurance. Il invente une décision de justice, un article de recherche, une citation ou une statistique qui n'existe pas.
Dès qu'on a compris la prédiction, ça n'a plus rien de mystérieux. Le travail du modèle est de produire du texte *plausible*. Une fausse référence comme « Smith et al., 2019, *Journal of Applied Linguistics* » ressemble exactement à une vraie. Elle colle au motif. Le modèle n'a pas de vérificateur interne qui dirait « attends, cet article existe-t-il vraiment ? ». Il poursuit simplement la séquence la plus probable.
C'est pourquoi les hallucinations sont les plus dangereuses quand :
- Vous demandez des faits précis sur lesquels le modèle est incertain (dates exactes, noms, chiffres, références juridiques).
- Le sujet est de niche et sous-représenté dans ses données d'entraînement.
- Vous formulez une question comme si une prémisse fausse était vraie. Demandez « Pourquoi Einstein a-t-il gagné deux prix Nobel ? » et le modèle pourra inventer un second prix, parce que « répondre à la question » est le motif probable, même si Einstein n'en a reçu qu'un.
Le modèle préfère vous donner une mauvaise réponse assurée et fluide que dire « je ne sais pas », parce que les réponses fluides sont ce qu'il a été entraîné à produire.
Large Language Models explained briefly
Comment cela change votre façon de prompter
Si le modèle prédit à partir du contexte, alors le contexte que vous lui donnez est votre volant. Un meilleur input veut dire de meilleures prédictions.
Donnez-lui le bon motif de départ
Le modèle poursuit le motif que vous installez. Alors installez-en un bon.
Prompt faible :
Écris sur le marketing.
Prompt solide :
Tu es conseiller marketing pour une petite boulangerie. Rédige 3 idées précises de posts Instagram pour promouvoir un nouveau pain au levain. Garde chaque idée sous 40 mots.
Le second prompt donne au modèle un rôle, un sujet, un format et une contrainte. Cela resserre la prédiction vers exactement ce que vous voulez.
Fournissez les faits vous-même
Ne comptez pas sur le modèle pour se souvenir de détails obscurs. Collez-les. Si vous voulez le résumé d'un rapport précis, donnez-lui le rapport. Cette technique, qui consiste à alimenter le modèle avec la source, réduit fortement l'hallucination puisque le modèle prédit désormais à partir de *votre* texte, pas de sa mémoire floue.
Voici nos données de ventes du T3 : [coller]. Résume les 3 principales tendances en langage simple.
Demandez-lui d'exprimer son incertitude
Vous pouvez demander au modèle de signaler quand il devine :
Réponds à cette question. Si tu n'es pas sûr ou si tu n'as pas l'information, dis-le explicitement plutôt que de deviner.
Cela ne rend pas le modèle parfait, mais pousse le texte prédit vers l'honnêteté. Pour un guide gratuit et plus approfondi sur la rédaction de prompts efficaces, le guide de prompt engineering d'OpenAI est un bon point de départ.
Vérification des acquis
1. Quand un outil d'IA répond correctement que la capitale de la France est Paris, que se passe-t-il réellement selon la leçon ?
2. La leçon dit que le modèle a une notion de « probable » ou « improbable » mais pas de « vrai » ou « faux ». Pourquoi cette distinction compte-t-elle ?
3. Pourquoi poser trois fois la même question sur un nom de café produit-il trois listes différentes ?
4. Sélectionnez TOUTES les affirmations qui décrivent correctement la façon dont un grand modèle de langage génère une réponse.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les affirmations correctes sur l'analogie entre un LLM et l'autocomplétion du téléphone.
Sélectionnez toutes les réponses correctes.
Quand lui faire confiance, et quand vérifier
La prédiction est fiable pour certaines tâches et risquée pour d'autres. Voici une règle simple, fondée sur ce que le modèle fait réellement.
Globalement sans risque (le modèle transforme un texte que vous avez fourni) :
- Réécrire, résumer ou traduire un texte que vous avez fourni.
- Brainstormer des idées (où « se tromper » n'a pas d'importance).
- Produire une structure : plans, modèles d'email, premiers jets.
- Expliquer des concepts connus et largement documentés.
À vérifier soigneusement (le modèle se souvient ou invente des faits) :
- Statistiques, dates, noms et citations précis.
- Points juridiques, médicaux ou financiers précis.
- Références et sources (vérifiez toujours qu'elles existent).
- Événements récents proches de la date de coupure d'entraînement du modèle ou postérieurs.
Un raccourci mental utile : le modèle est le plus fort quand il *traite* une information que vous lui avez remise, et le plus faible quand il *récupère* une information en mémoire.
Une remarque sur les outils qui cherchent sur le web
Les versions modernes de ChatGPT, Claude et Gemini peuvent désormais naviguer sur le web ou utiliser des outils connectés. Quand un modèle fait une recherche et cite une source en ligne, il est bien plus fiable, car il prédit à partir d'un texte réellement récupéré plutôt que de sa mémoire. Mais cliquez quand même sur le lien. Il arrive que le modèle résume mal une source ou cite une page qui ne dit pas ce qu'il affirme.
Le changement d'état d'esprit
ArrArrL'Annual Recurring Revenue (ARR) est le revenu normalisé et prévisible qu'une entreprise par abonnement attend de ses contrats actifs sur une année.Voir la définition complète →êtez de traiter l'IA comme un moteur de recherche ou un oracle. Traitez-la comme un stagiaire brillant, rapide et un peu trop sûr de lui, qui a tout lu mais retient les détails imparfaitement.
Vous n'enverriez pas le premier jet d'un stagiaire à un client sans le lire. Vous ne feriez pas confiance à son souvenir d'une clause juridique précise sans vérifier le document. Mais vous l'utiliseriez sans hésiter pour rédiger, brainstormer, remettre en forme et expliquer.
C'est exactement la bonne relation avec un LLM. Il prédit ; vous vérifiez et décidez.
À retenir
- Le modèle prédit le token suivant, il ne « sait » pas des faits. Fluide et assuré ne veut pas dire juste. Traitez chaque affirmation précise comme un brouillon à vérifier.
- Des réponses différentes à la même question, c'est normal. L'aléatoire (temperature) est intégré. Baissez-la pour la constance, gardez-la plus haute pour la créativité.
- Les hallucinations viennent de la recherche de plausibilité du modèle. Il préfère produire une mauvaise réponse crédible qu'admettre son ignorance. Soyez particulièrement sceptique sur les faits de niche, les dates, les chiffres et les références.
- Pilotez par le contexte. Donnez au modèle un rôle clair, un format et le matériau source lui-même. Il prédit à partir de ce que vous fournissez : un bon input produit un bon output.
- Faites-lui confiance pour transformer, vérifiez-le quand il se souvient. Résumer votre document est sans risque ; réciter une statistique de mémoire ne l'est pas.
À faire, tiré de cette leçon
Ces actions sont compilées dans le plan d'action du rôle.
- Vérifier toutes les citations, chiffres, dates, noms et affirmations sensibles auprès des sources
- Ancrez le modèle en collant le texte source et en limitant les réponses à ce texte
- Rédigez des prompts précis, avec exemples, rôle et contraintes de format
- Réglez une température basse pour le factuel, haute pour le brainstorming créatif
- Traitez chaque réponse de l'IA comme un brouillon que vous éditez
Articles liés
Les articles récents du blog qui s'appuient sur cette leçon.
- IAUne hallucination d'IA a failli déclencher une frappe militaire américaine sur des installations nucléaires chinoisesUn modèle de langage utilisé par des analystes militaires américains a produit des informations fausses sur des composants nucléaires chinois, poussant des décideurs à envisager une réponse armée. Ce cas illustre ce qui arrive quand on confie une décision à enjeux extrêmes à un système conçu pour prédire des tokens, non pour vérifier des faits.
- IATempérature, tokens, contexte : ce que tout utilisateur d'IA devrait comprendre sur le fonctionnement des LLMsLes grands modèles de langage produisent des résultats très différents selon la façon dont on les sollicite, et la plupart des utilisateurs ignorent pourquoi. Comprendre quelques mécanismes fondamentaux change radicalement la qualité du travail produit avec ces outils.
- IATempérature, top-p, contexte : ce que chaque professionnel devrait comprendre sur le fonctionnement des LLMsLes grands modèles de langage produisent des résultats très différents selon la façon dont on les configure et les sollicite. Comprendre les mécanismes fondamentaux, même sans formation technique, change radicalement la qualité de ce qu'on en obtient.