Glossaire
IA

Context Window

Aussi : Context Length, Token Window, Maximum Context Length

La context window est la quantité maximale de texte (mesurée en tokens) qu'un modèle de langage peut traiter en une seule fois, prompt d'entrée et sortie générée compris.

De quoi il s'agit

La context window est la limite fixe de texte qu'un large language model (LLM) peut prendre en compte simultanément. Elle se mesure en tokens, pas en mots ni en caractères. Un token est un fragment de texte, environ 3 à 4 caractères en anglais : 1 000 tokens représentent donc à peu près 750 mots.

La context window couvre tout ce qui entre dans une interaction :

  • Le system prompt (les instructions qui définissent le comportement du modèle)
  • L'input utilisateur (votre question ou votre tâche)
  • Les documents récupérés ou le contenu collé
  • L'historique de conversation dans un chat
  • La réponse du modèle au fur et à mesure de sa génération

Si le total dépasse la fenêtre, le contenu le plus ancien ou le moins pertinent doit être écarté ou tronqué.

Pourquoi c'est important

La context window définit les limites pratiques de ce sur quoi un modèle peut raisonner. Un modèle ne peut pas utiliser une information qu'il n'a jamais reçue, et il ne peut rien mémoriser en dehors de la fenêtre courante, sauf si cette information y est réinjectée.

Principales implications :

  • Les fenêtres larges permettent de traiter de longs documents, des codebases entières ou des chats prolongés, mais coûtent plus cher et peuvent ralentir les réponses.
  • Les fenêtres réduites obligent à résumer, découper ou récupérer le contenu de façon sélective.
  • La précision des modèles peut se dégrader au milieu d'inputs très longs, un effet souvent appelé « lost in the middle ».

Usage en pratique

Les praticiens gèrent la context window avec plusieurs techniques :

  • Chunking : découper les longs documents en morceaux plus petits.
  • Retrieval Augmented Generation (RAG) : ne faire entrer dans la fenêtre que les passages les plus pertinents.
  • Summarization : condenser les tours de conversation antérieurs pour libérer de l'espace.
  • Prompt budgeting : réserver assez de tokens pour la sortie.

Exemple concret

Supposons un modèle doté d'une context window de 8 000 tokens. Vous collez un contrat de 6 000 tokens et posez une question qui en consomme 200. Il reste environ 1 800 tokens pour le system prompt et la réponse. Si vous collez plutôt un contrat de 9 000 tokens, il ne tiendra pas : il faudra le résumer ou n'en récupérer que les clauses pertinentes. Raisonner à partir de ce budget est indispensable pour des applications IA fiables et rentables.

Context Window (token budget)Total limit: 8,000 tokensSystempromptInput + retrieved docs+ chat historyReservedfor outputfreeIf content exceeds the limit:Oldest text droppedor summarizedor retrieved
Every part of a request shares one fixed token budget; overflow must be dropped, summarized, or selectively retrieved.

Questions fréquentes

Qu'est-ce qu'une context window dans un LLM ?

La context window est la quantité maximale de texte qu'un grand modèle de langage peut prendre en compte en une seule interaction, mesurée en tokens et non en mots. Elle inclut le système prompt, votre question, les documents collés ou récupérés, l'historique de conversation et la réponse en cours de génération. Tout ce qui dépasse cette limite est tronqué, écarté ou doit être résumé.

Comment convertir des tokens en mots ?

En anglais, un token représente environ 3 à 4 caractères, donc 1 000 tokens correspondent à peu près à 750 mots. C'est le nombre de tokens, pas le nombre de mots, qui est comparé à la limite du modèle et qui sert généralement de base de facturation. Estimer un prompt en tokens reste le seul moyen fiable de savoir si un document tiendra.

La réponse du modèle est-elle comptée dans la context window ?

Oui. La réponse générée consomme des tokens dans la même fenêtre que l'entrée, d'où l'intérêt du prompt budgeting. Si vous remplissez presque toute la fenêtre avec un document collé, il ne reste plus de place pour répondre et la sortie se retrouve tronquée. Réservez des tokens pour la sortie avant de décider du volume à coller.

Une context window plus grande donne-t-elle toujours de meilleurs résultats ?

Non. Une fenêtre plus large permet de traiter des documents longs, une base de code entière ou de longues conversations, mais elle coûte plus cher et ralentit les réponses. Les modèles perdent aussi en précision sur les informations situées au milieu d'entrées très longues, un effet appelé « lost in the middle ». Envoyer moins de passages, mieux ciblés, donne souvent de meilleurs résultats.

Que faire quand un document dépasse la context window ?

Quatre techniques couvrent la plupart des cas : le chunking, qui découpe le document en morceaux, le Retrieval Augmented Generation (RAG), qui n'injecte que les passages pertinents, la synthèse des tours de conversation antérieurs pour libérer de la place, et le prompt budgeting pour réserver des tokens à la sortie. Concrètement, avec une fenêtre de 8 000 tokens, un contrat de 9 000 tokens ne passe pas : il faut le résumer ou ne remonter que les clauses utiles.