Token
Aussi : Tokens, Subword unit, BPE token
Un token est l'unité de base de texte que traitent les modèles de langage : le plus souvent un fragment de mot, un mot entier ou un signe de ponctuation, plutôt qu'un simple caractère.
Ce qu'est un token
Un token est la plus petite unité de texte qu'un modèle de langage lit et génère. Les tokens ne correspondent pas toujours à des mots entiers. Selon le tokenizer du modèle, un token peut être un mot complet, un morceau de mot (un sous-mot), un seul caractère ou un signe de ponctuation. Par exemple, le mot « unbelievable » peut se découper en tokens comme `un`, `believ` et `able`, alors qu'un mot courant comme « the » forme généralement un token unique.
Les modèles ne voient pas le texte brut. Le tokenizer convertit d'abord le texte en une séquence d'identifiants de tokens (des entiers), et le modèle ne travaille qu'avec ces nombres. Après avoir généré les identifiants de tokens en sortie, le tokenizer les reconvertit en texte lisible.
Pourquoi les tokens comptent
Les tokens sont l'unité de mesure de presque tout ce qui est concret dans le travail avec les modèles d'IA :
- Coût : la plupart des fournisseurs d'API facturent au token, séparément pour l'entrée (prompt) et la sortie (complétion).
- Limites de contexte : chaque modèle a une fenêtre de contexte maximale mesurée en tokens (par exemple 8 000, 128 000, voire plus). Le prompt et la réponse doivent tenir dedans.
- Latence : le temps de génération augmente à peu près proportionnellement au nombre de tokens en sortie.
- Contrôle qualité : les stratégies de troncature, de résumé et de découpage dépendent toutes du nombre de tokens.
Comment on utilise les tokens en pratique
Une règle approximative en anglais : 1 token vaut environ 4 caractères ou 0,75 mot, donc 1 000 tokens représentent à peu près 750 mots. Les langues et les systèmes d'écriture se tokenisent différemment, si bien que le texte non anglophone consomme souvent plus de tokens par mot.
Quand elles construisent des applications, les équipes :
- Comptent les tokens avant d'envoyer les requêtes, pour rester dans les limites et estimer le coût.
- Découpent les documents longs en chunks calibrés en tokens pour les systèmes de retrieval.
- Définissent un paramètre `max_tokens` pour plafonner la longueur des réponses.
- Suivent la consommation de tokens pour prévoir la dépense.
Exemple concret
La phrase « AI changes how we work. » peut se tokeniser en sept tokens : `AI`, ` changes`, ` how`, ` we`, ` work`, `.`, plus un marqueur de fin. Notez que les espaces initiales font partie des tokens. Si un fournisseur facture 0,50 USD par million de tokens en entrée, traiter un million de phrases de ce type (environ 7 millions de tokens) coûterait à peu près 3,50 USD. Comprendre les tokens permet de prévoir et de maîtriser à la fois le comportement et le budget.
Voir aussi
Questions fréquentes
Qu'est-ce qu'un token dans un modèle de langage ?
Un token est la plus petite unité de texte qu'un modèle de langage lit et produit. Ce n'est pas toujours un mot entier : selon le tokenizer, un token peut être un mot complet, un fragment de mot (subword), un caractère isolé ou un signe de ponctuation. « the » compte généralement pour un token, alors que « unbelievable » peut se découper en `un`, `believ` et `able`.
Pourquoi un dirigeant devrait-il raisonner en tokens plutôt qu'en mots ?
Parce que le token, et non le mot, est l'unité de facturation et de capacité des modèles d'IA. Les fournisseurs d'API facturent au token, en distinguant l'entrée et la sortie ; chaque modèle a une fenêtre de contexte exprimée en tokens ; et le temps de génération croît à peu près avec le nombre de tokens produits. Les prévisions de dépense et la conception des prompts reposent donc sur des comptages de tokens.
Comment convertir rapidement des mots en tokens ?
En anglais, retenez qu'un token vaut environ 4 caractères ou 0,75 mot : 1 000 tokens correspondent donc à peu près à 750 mots. Cela reste une approximation, car les autres langues et systèmes d'écriture se découpent différemment et consomment souvent plus de tokens par mot. Dès que le coût ou la limite de contexte est en jeu, comptez les tokens avec le tokenizer du modèle plutôt que d'estimer.
Quelle différence entre tokens d'entrée et tokens de sortie ?
Les tokens d'entrée sont ceux que vous envoyez (le prompt), les tokens de sortie ceux que le modèle génère (la complétion). Les fournisseurs les facturent généralement à des tarifs différents, et les deux doivent tenir ensemble dans la fenêtre de contexte du modèle. Les tokens de sortie pèsent aussi sur la latence, d'où l'usage du paramètre `max_tokens` pour plafonner la longueur des réponses.
Comment une équipe pilote-t-elle sa consommation de tokens en production ?
Quatre pratiques couvrent l'essentiel : compter les tokens avant l'envoi d'une requête pour rester dans la fenêtre de contexte et estimer le coût, découper les documents longs en chunks calibrés en tokens pour les systèmes de retrieval, fixer `max_tokens` pour plafonner la longueur des réponses, et suivre la consommation pour prévoir la dépense. Troncature, résumé et chunking se ramènent tous à des comptages de tokens.