Tokens, training et inference : ce qui se passe quand vous appuyez sur entrée
Tapez « Paris est la capitale de » dans ChatGPT, Claude ou Gemini, et il terminera presque à coup sûr par « la France ». Nous expliquons en détail pourquoi le modèle fait cela dans « Ce qu'un modèle fait réellement : de la prédiction, pas de la compréhension ».
Ouvrons le capot. Trois idées expliquent tout le pipelinepipelineL'ensemble des opportunités commerciales actives réparties selon les étapes du processus de vente, avec leur valeur potentielle cumulée et leur probabilité de conclusion.Voir la définition complète → : les tokenstokensUn token est l'unité de base de texte que traitent les modèles de langage : le plus souvent un fragment de mot, un mot entier ou un signe de ponctuation, plutôt qu'un simple caractère.Voir la définition complète →, le training et l'inferenceinferenceLe moment où un modèle d'IA entraîné se met au travail : il reçoit une donnée nouvelle et produit une réponse, une prédiction ou un contenu.Voir la définition complète →.
Étape 1 : les tokens (comment le modèle lit)
Un large language modellarge language modelUn Large Language Model est un système d'IA entraîné sur d'énormes volumes de texte pour prédire et générer du langage, ce qui permet de rédiger, résumer ou répondre à des questions.Voir la définition complète → (LLM) ne lit pas les mots comme vous. Il découpe le texte en tokens : de petits fragments qui sont souvent des mots entiers, parfois des morceaux de mots.
Voici la surprise classique. Le mot « strawberry » n'est pas une seule unité pour le modèle. Il est généralement lu comme « straw » + « berry ». C'est pourquoi les modèles ont longtemps eu du mal à compter les lettres de « strawberry » : ils n'ont jamais vu les lettres individuelles, seulement les fragments.
Un ordre de grandeur en anglais : 1 token vaut environ 4 caractères, soit à peu près 3/4 de mot. Donc 100 tokens font environ 75 mots.
Quelques exemples rapides de découpage :
- « cat » → 1 token
- « unbelievable » → « un » + « believ » + « able » (3 tokens)
- « GPT-4 » → « G » + « PT » + « - » + « 4 » (plusieurs tokens)
- Une espace devant un mot fait généralement partie du token (« France » avec espace est différent de « France »)
Vous pouvez le constater vous-même avec le Tokenizer gratuit d'OpenAI. Collez une phrase et regardez-la se découper en fragments colorés.
Pourquoi les tokens vous concernent
Les tokens sont l'unité de tarification et de limite. Quand un outil annonce une « context windowcontext windowLa context window est la quantité maximale de texte (mesurée en tokens) qu'un modèle de langage peut traiter en une seule fois, prompt d'entrée et sortie générée compris.Voir la définition complète → de 200 000 tokens », cela signifie qu'environ 150 000 mots peuvent tenir dans une seule conversation. Quand une APIAPIApplication Programming Interface : une interface standardisée qui permet aux applications de communiquer et d'échanger des données sans connaître leur fonctionnement interne respectif.Voir la définition complète → facture « 3 $ par million de tokens en entrée », elle compte ces fragments, pas des mots.
À retenir en pratique : des prompts plus courts coûtent moins cher et laissent plus de place. Et les comportements étranges sur l'orthographe, les rimes ou le comptage de lettres viennent souvent de la tokenisation.
Étape 2 : le training (comment le modèle a appris)
Avant que vous ne tapiez quoi que ce soit, le modèle est passé par le training : un processus long et coûteux d'apprentissage à partir de quantités énormes de texte (livres, sites web, code, articles).
La tâche centrale est d'une simplicité déroutante. On montre au modèle une séquence de texte dont le dernier token est masqué, et il doit prédire le token suivant.
Montrez-lui « The sky is » et il apprend à prédire « blue ». Montrez-lui « 2 + 2 = » et il apprend à prédire « 4 ». Faites cela sur des milliers de milliards de tokens, des milliards de fois, et le modèle ajuste peu à peu ses réglages internes (appelés paramètres, les nombres qu'il affine) pour mieux deviner.
Personne n'a codé à la main la règle « Paris va avec France ». Le modèle a vu ce schéma des millions de fois dans son texte d'entraînement et a appris le lien statistique tout seul.
Deux phases à connaître
Le training comporte deux grandes étapes :
- Pre-training : le modèle lit l'immense masse de texte et apprend la prédiction du token suivant. Cela produit un modèle « brut », riche en connaissances mais peu serviable ni policé.
- Fine-tuning et alignement : des humains et des retours automatisés apprennent au modèle à suivre des instructions, à être utile et à éviter les réponses nuisibles. C'est ce qui transforme un prédicteur de texte en ChatGPT.
C'est aussi pourquoi les modèles ont un knowledge cutoff. Le training s'est déroulé à un moment donné, donc un modèle peut ignorer les événements postérieurs à cette date, sauf s'il peut chercher sur le web. En 2026, ChatGPT, Claude et Gemini proposent tous une recherche web en direct pour combler ce trou, mais la connaissance de base reste figée au moment du training.
Étape 3 : l'inference (ce qui se passe quand vous appuyez sur entrée)
L'inference, c'est le moment de l'usage : le modèle a fini d'apprendre et produit désormais des prédictions pour vous, en temps réel.
Voici la séquence complète quand vous appuyez sur Entrée :
- Votre prompt est découpé en tokens.
- Le modèle lit ces tokens et prédit le token suivant le plus probable.
- Il ajoute ce token à la séquence, puis prédit le suivant.
- Il répète, un token à la fois, jusqu'à estimer que la réponse est complète.
Cet affichage mot à mot que vous voyez dans l'interface ? C'est littéralement le modèle qui génère un token, puis le suivant, puis le suivant. Vous regardez l'inference en direct.
Pourquoi vous obtenez des réponses différentes au même prompt
Si le modèle choisissait toujours le token le plus probable, il serait répétitif et robotique. Il existe donc un réglage appelé temperaturetemperatureUn reglage qui controle le caractere aleatoire ou previsible des reponses d'un modele d'IA : bas pour la coherence, haut pour la creativite.Voir la définition complète → qui ajoute une part d'aléatoire contrôlée.
- Temperature basse (proche de 0) : prévisible, focalisée, reproductible. Bien pour les tâches factuelles, le code, l'extraction de données.
- Temperature haute (proche de 1 ou au-delà) : variée, crcrLe pourcentage de visiteurs ou de prospects qui réalisent une action attendue (achat, inscription, formulaire de contact), calculé en divisant les conversions par le nombre total d'opportunités.Voir la définition complète →éative, surprenante. Bien pour le brainstorming, les idées de récit, les textes marketing.
C'est pourquoi demander deux fois « donne-moi une accroche pour mon café » donne deux accroches différentes. L'aléatoire est une fonctionnalité, pas un bug.
Voir l'inference dans le code
Si vous voulez observer le pipeline concrètement, voici un exemple court et exécutable avec l'API OpenAI. (Il vous faut une clé d'API ; le même principe fonctionne avec les API Claude d'Anthropic et Gemini de Google.)
from openai import OpenAI
client = OpenAI() # utilise votre clé d'API
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "user", "content": "Paris is the capital of"}
],
temperature=0, # proche de zéro = token le plus probable, très prévisible
max_tokens=5 # limite la réponse à quelques tokens
)
print(response.choices[0].message.content)
# Sortie attendue : FranceDeux choses à noter. temperature=0 dit au modèle de jouer la sécurité et de choisir la continuation la plus probable. max_tokens=5 plafonne la longueur de la réponse en tokens, pas en mots, ce qui renvoie directement à l'étape 1.
Vérification des acquis
1. Pourquoi les modèles de langage ont-ils longtemps eu du mal à compter les lettres d'un mot comme « strawberry » ?
2. Un outil annonce une « context window de 200 000 tokens ». Que cela vous indique-t-il en pratique ?
3. D'après la leçon, quelle est la tâche centrale que le modèle apprend pendant le training ?
4. Sélectionnez TOUTES les affirmations correctes sur les tokens et leur importance.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUS les enseignements pratiques qui découlent correctement du fonctionnement de la tokenisation.
Sélectionnez toutes les réponses correctes.
Tout assembler : le pipeline complet
Suivons un prompt réel de bout en bout. Vous tapez :
« Résume cet e-mail en une phrase : [collage d'un long e-mail] »
- Tokens : votre instruction plus l'e-mail entier sont découpés en tokens. Un e-mail de 500 mots fait environ 650 tokens.
- Training (déjà fait) : le modèle a appris depuis longtemps ce que « résumer » signifie et comment un résumé est structuré, à partir d'innombrables exemples.
- Inference : le modèle lit tous ces tokens et génère un résumé d'une phrase, un token à la fois, jusqu'à atteindre un point d'arrêt naturel.
Aucune consultation de base. Juste une très, très bonne prédiction du token suivant, façonnée par le training et propulsée par l'inference.
Pourquoi ce modèle mental vous rend meilleur avec l'IA
Dès que vous voyez le modèle comme un prédicteur de token suivant, beaucoup de conseils pratiques s'éclairent :
- Donnez le contexte d'emblée. Le modèle prédit uniquement à partir des tokens qu'il a devant lui. Si vous ne collez pas l'e-mail, il ne peut pas le résumer. Il n'y a aucune mémoire cachée de vos fichiers.
- Les exemples orientent les prédictions. Montrer au modèle deux résumés types dans votre style préféré le pousse à prédire ce même style. C'est pourquoi « montrer, pas seulement dire » fonctionne si bien dans les prompts.
- Soyez précis pour resserrer les suppositions. « Écris un tweet » laisse la prédiction grande ouverte. « Écris un tweet de 280 caractères, ton amical, un emoji, sans hashtags » contraint fortement ce qui vient ensuite.
- Les hallucinations sont des prédictions trop confiantes. Quand le modèle invente une source fictive, il prédit du texte qui *ressemble* à ce qu'il faut selon les schémas appris, même si c'est faux. C'est pourquoi vous vérifiez tout ce qui compte.
Pour une explication plus poussée mais toujours lisible, l'article Wikipédia sur les large language models est une référence gratuite solide et raisonnablement claire.
À retenir
- Le modèle lit en tokens, pas en mots. Environ 4 caractères par token. Cela détermine la tarification, les limites de contexte et des bizarreries comme le mauvais comptage des lettres de « strawberry ». Essayez le Tokenizer une fois pour rendre cela concret.
- Le training, c'est de la prédiction du token suivant à très grande échelle. Le modèle a appris des schémas comme « Paris → France » en devinant le fragment suivant sur des milliers de milliards de tokens, pas en mémorisant une base de faits.
- L'inference est ce qui tourne quand vous appuyez sur Entrée : un token prédit à la fois, renvoyé en flux. La sortie mot à mot en direct, c'est la prédiction en temps réel.
- Utilisez la temperature à bon escient. Basse pour le factuel et le reproductible ; haute pour le brainstorming créatif.
- Donnez au modèle du contexte et des exemples. Il ne prédit qu'à partir des tokens que vous lui fournissez : des prompts précis avec des exemples clairs produisent des réponses plus nettes et plus utiles.
À faire, tiré de cette leçon
Ces actions sont compilées dans le plan d'action du rôle.
- Rédigez des prompts précis, avec exemples, rôle et contraintes de format
- Réglez une température basse pour le factuel, haute pour le brainstorming créatif
- Calibrer la consommation de tokens par rapport aux limites de contexte avec le tokenizer
Articles liés
Les articles récents du blog qui s'appuient sur cette leçon.
- IALa dépense IA par employé recule : alerte ou ajustement normal ?En août 2026, les dépenses IA par employé ont chuté dans plusieurs grandes entreprises, au moment même où les hyperscalers misaient sur une adoption en accélération. Avant de conclure à un essoufflement, il faut regarder ce que ces chiffres mesurent réellement, et ce qu'ils occultent.
- IAFenêtre de contexte : ce que ce paramètre change concrètement dans votre travailLa fenêtre de contexte d'un LLM détermine combien d'information le modèle peut traiter en une seule fois. Comprendre ce mécanisme change radicalement la façon dont on structure ses prompts, ses workflows, et ses attentes.
- IACe qui arrive vraiment à vos données quand vous les confiez à un modèle d'IAChaque requête envoyée à un modèle d'IA embarque potentiellement des informations sensibles sur votre entreprise, vos clients ou vos contrats. Comprendre exactement où vont ces données et dans quelles conditions elles peuvent être réutilisées est devenu une compétence de base pour tout professionnel qui utilise ces outils.