+140 XP

La context window : la mémoire de travail du modèle

Collez un PDF de 40 pages dans Claude et demandez un résumé. Ça marche immédiatement. Collez un roman de 900 pages et vous butez sur un mur : « Ce message dépasse la longueur maximale. » Même outil, même prompt, résultat totalement différent. La différence, c'est la context window, et une fois que vous l'avez comprise, la moitié des comportements bizarres des chatbots IA devient soudain logique.

La première chose à comprendre

Un LLM (large language model, la technologie derrière ChatGPT, Claude et Gemini) n'a aucune mémoire entre les conversations. Quand vous ouvrez un nouveau chat, le modèle ne sait rien du précédent. Il ne se « souvient » pas de vous comme le ferait un collègue.

Tout ce que le modèle « sait » pendant un échange se trouve à un seul endroit : la context window.

Voyez la context window comme la mémoire de travail du modèle, comme l'espace du bureau devant vous. Tout ce qui tient sur le bureau, le modèle peut le voir et l'utiliser. Ce qui tombe du bord disparaît.

Cela inclut :

  • Vos messages
  • Les réponses du modèle
  • Les fichiers ou textes que vous avez collés
  • Les instructions système cachées que l'application ajoute en coulisses

Tout cela occupe le même bureau. Et le bureau a une taille fixe.

Les tokens : le budget que vous dépensez

La taille de la context window se mesure en tokens, pas en mots.

Un token est un fragment de texte. En gros, 1 token équivaut à environ 4 caractères, soit trois quarts de mot. Donc 100 tokens représentent environ 75 mots.

Exemples rapides :

  • « cat » = 1 token
  • « unbelievable » = souvent 3 ou 4 tokens (découpé en morceaux)
  • Une page de texte typique = environ 500 à 700 tokens

Vous pouvez le constater vous-même avec le Tokenizer gratuit d'OpenAI. Collez n'importe quel texte et regardez-le se découper en tokens colorés. C'est le moyen le plus rapide de faire tilt.

Pourquoi est-ce important ? Parce que la context window est un budget, et les tokens en sont la monnaie.

Début 2026, les limites typiques ressemblent à ceci :

  • ChatGPT (modèles de classe GPT-5) : environ 128 000 à 256 000 tokens selon l'offre
  • Claude (Sonnet et Opus 4.x) : 200 000 tokens, avec des options entreprise bien supérieures
  • Gemini 2.x : jusqu'à 1 000 000 de tokens ou plus dans certaines versions

Un million de tokens semble infini. Ça ne l'est pas. Faisons le calcul.

Pourquoi le PDF de 40 pages passe (et pas le roman)

Un PDF de 40 pages représente environ 20 000 à 28 000 tokens. Placé dans une fenêtre de 200 000 tokens, vous avez utilisé peut-être 12 % du bureau. Il reste largement de la place pour vos questions et les réponses du modèle.

Un roman de 900 pages représente environ 400 000 à 500 000 tokens. Cela déborde même d'une fenêtre de 200 000 tokens. L'application le refuse parce qu'il ne peut physiquement pas tenir sur le bureau.

Voici la règle pratique :

Si votre contenu tient dans la fenêtre, le modèle peut raisonner sur l'ensemble d'un seul coup. Sinon, il faut le découper.

Quand un contenu est trop volumineux, vos options sont :

  1. Le découper en morceaux et les traiter un par un.
  2. Résumer au fil de l'eau, en transmettant les résumés plutôt que le texte intégral.
  3. Utiliser un modèle avec une fenêtre plus large (c'est exactement pour cela que la fenêtre d'un million de tokens de Gemini est utile pour les documents très volumineux).

Pourquoi les longs chats se mettent à « oublier » le début

Voici le comportement qui déroute le plus.

Vous en êtes au 50e message d'un long brainstorming. Vous demandez au modèle de retrouver un détail mentionné tout au début. Il se trompe, ou invente quelque chose.

Le modèle n'est pas paresseux. Le début de votre conversation est tombé du bureau.

Rappelez-vous : chaque message, le vôtre comme celui du modèle, consomme du budget en tokens. Une longue conversation ne cesse d'ajouter des tokens. Quand le total dépasse la fenêtre, le contenu le plus ancien est évacué pour faire de la place au plus récent.

Donc, dans un chat très long, le modèle peut littéralement ne plus voir ce que vous avez dit il y a une heure. Ce n'est plus dans la mémoire de travail.

Un modèle mental simple :

[ CONTEXT WINDOW = 200,000 tokens ]

Earliest messages  -->  pushed out when full
   ...
Recent messages    -->  always visible
Your latest prompt -->  always visible

C'est aussi pour cela que le modèle peut se contredire lors de longues sessions. L'instruction donnée au message 3 (« réponds toujours en anglais britannique ») peut avoir disparu au message 80.

« Mais ChatGPT retient mon prénom d'un chat à l'autre ? »

Bien vu. Les applications modernes ajoutent des fonctionnalités par-dessus la context window brute :

  • Memory (ChatGPT, Gemini) : l'application enregistre quelques faits vous concernant et les réinjecte discrètement dans les nouveaux chats.
  • Projects (Claude, ChatGPT) : un espace partagé où instructions et fichiers persistent d'une conversation à l'autre.

Ce n'est pas le modèle qui se souvient. C'est l'application qui réinjecte l'information dans la context window à chaque fois. La fenêtre reste la seule chose que le modèle voit réellement.

Vérification des acquis

1. Quelle est la meilleure façon de décrire le rôle de la context window pour un modèle de langage ?

2. Pourquoi un PDF de 40 pages se résume sans problème alors qu'un roman de 900 pages déclenche une erreur « le message dépasse la longueur maximale » ?

3. Un collègue affirme : « l'IA se souviendra de notre conversation de la semaine dernière quand j'ouvrirai un nouveau chat. » D'après la leçon, quelle est la correction exacte ?

CHOIX MULTIPLES

4. Sélectionnez TOUS les éléments qui occupent de l'espace dans la context window (le « bureau » du modèle).

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les affirmations qui décrivent correctement le fonctionnement des tokens selon la leçon.

Sélectionnez toutes les réponses correctes.

Travailler avec la fenêtre, pas contre elle

Dès que vous traitez les tokens comme un budget, vous faites de meilleurs choix. Voici l'état d'esprit pratique.

1. Repartir de zéro pour chaque nouveau sujet

Ne faites pas passer toute votre semaine dans un seul chat interminable. Un chat surchargé gaspille du budget sur un historique hors sujet et augmente le risque de confusion. Nouvelle tâche, nouveau chat.

2. Mettre l'essentiel en avant

Placez vos instructions les plus importantes et vos documents de référence près de votre question réelle, pas enfouis 40 messages plus haut. Si une règle compte, répétez-la.

3. Coller la partie pertinente, pas tout

Vous n'avez pas besoin de coller un contrat de 200 pages pour poser une question sur la clause de résiliation. Collez la clause et un peu de contexte autour. Moins de bruit, réponses plus précises, coût plus faible.

4. Résumer pour « sauvegarder » un long chat

Quand une longue conversation devient poussive ou amnésique, demandez :

« Résume tout ce que nous avons décidé jusqu'ici sous forme de liste à puces que je puisse coller dans un nouveau chat. »

Puis démarrez un chat propre avec ce résumé en tête. Vous avez compressé des heures de travail en quelques centaines de tokens.

5. Utiliser les Projects pour le travail au long cours

Si vous revenez régulièrement au même matériau (un manuscrit, une spec produit, un compte client), placez-le dans un Project pour qu'il soit toujours chargé sans avoir à le recoller.

Un exemple concret : compter votre budget

Si vous développez avec l'API (l'interface développeur de ces modèles), la consommation de tokens vous est rapportée directement. Même les non-développeurs gagnent à la voir une fois.

python
# pip install anthropic
import anthropic

client = anthropic.Anthropic()  # utilise votre clé API

response = client.messages.create(
    model="claude-sonnet-4-5",
    max_tokens=300,
    messages=[
        {"role": "user", "content": "Summarize the causes of WWI in 5 bullets."}
    ],
)

print(response.content[0].text)

# Le modèle vous indique exactement le budget dépensé :
print("Input tokens:", response.usage.input_tokens)
print("Output tokens:", response.usage.output_tokens)

input_tokens correspond à ce que vous avez envoyé (votre prompt plus les fichiers collés). output_tokens correspond à ce que le modèle a écrit en retour. Les deux comptent dans les limites et, sur les offres payantes, dans le coût. Observer ces chiffres rend le concept tangible.

Idées reçues, mises au clair

« Une context window plus grande signifie un modèle plus intelligent. » Non. Cela signifie un bureau plus grand, pas un esprit plus aiguisé. Un modèle doté d'une fenêtre énorme peut toujours mal lire ce qui est posé sur le bureau.

« Le modèle lit tout mon document attentivement à chaque fois. » Pas exactement. Avec des entrées très volumineuses, les modèles peuvent passer à côté de détails enfouis au milieu, un phénomène connu parfois appelé « lost in the middle ». Les instructions importantes doivent figurer près du début ou de la fin de votre entrée.

« Une fois que je lui ai dit quelque chose, il le sait pour toujours. » Seulement dans ce chat, et seulement tant que ça reste dans la fenêtre. D'un chat à l'autre, seuls Memory ou Projects le transmettent.

Points clés

  • La context window est la mémoire de travail du modèle. Tout ce que le modèle peut « voir » (vos messages, ses réponses, les fichiers collés) s'y trouve, et elle a une taille fixe mesurée en tokens.
  • Les tokens sont un budget : environ 75 mots pour 100 tokens. Un PDF de 40 pages tient sans problème dans une fenêtre de 200 000 tokens ; un roman complet, non.
  • Les longs chats oublient le début parce que les anciens messages sont évacués quand la fenêtre se remplit. Répétez les instructions importantes, et ouvrez de nouveaux chats pour les nouveaux sujets.
  • Résumez pour préserver le travail : demandez au modèle de lister vos décisions à puces, puis collez cela dans un chat propre pour récupérer du budget.
  • Memory et Projects ne sont pas une vraie mémoire. Ils réinjectent des faits dans la fenêtre à chaque session : utilisez-les pour le matériau que vous réutilisez, et ne collez que les parties pertinentes pour tout le reste.

À faire, tiré de cette leçon

Ces actions sont compilées dans le plan d'action du rôle.

  • Répétez les instructions clés au début ou à la fin des inputs longs
  • Résumer les décisions en puces et les coller dans de nouveaux chats
  • Calibrer la consommation de tokens par rapport aux limites de contexte avec le tokenizer
Voir le plan d'action complet →

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.