Glossaire
IA

Chain-of-Thought

Aussi : CoT, Chain of Thought Prompting, Step-by-Step Reasoning

Technique de prompting qui amène un modèle de langage à produire des étapes de raisonnement intermédiaires avant de donner sa réponse finale, ce qui améliore la précision sur les tâches complexes.

De quoi il s'agit

Le Chain-of-Thought (CoT) est une technique de prompting et de raisonnement utilisée avec les grands modèles de langage (LLM), dans laquelle le modèle génère une suite d'étapes de raisonnement intermédiaires avant de produire une réponse finale. Plutôt que de sauter directement à la conclusion, le modèle est incité à « penser à voix haute », en décomposant un problème en parties plus petites et logiquement liées.

La technique peut être déclenchée de plusieurs façons : en ajoutant une instruction du type « Réfléchissons étape par étape », en fournissant des exemples résolus qui incluent le raisonnement (few-shot CoT), ou via un entraînement du modèle qui fait du raisonnement pas à pas un comportement par défaut.

Pourquoi c'est important

Beaucoup de tâches, comme l'arithmétique à plusieurs étapes, les problèmes de logique ou les décisions complexes, sont difficiles à résoudre en une seule passe. Le Chain-of-Thought améliore les performances car il :

  • Décompose la complexité : les gros problèmes sont découpés en étapes gérables.
  • Réduit les erreurs : chaque étape s'appuie sur un résultat intermédiaire vérifié.
  • Augmente la transparence : la trace de raisonnement visible facilite l'audit et le debug du comportement du modèle.
  • Améliore la fiabilité : les études montrent systématiquement une meilleure précision sur les benchmarks de raisonnement par rapport au prompting à réponse directe.

Comment on l'utilise en pratique

  • Few-shot CoT : inclure 2 à 5 exemples dans le prompt qui démontrent le raisonnement, puis poser la nouvelle question.
  • Zero-shot CoT : ajouter simplement une amorce du type « Explique ton raisonnement étape par étape ».
  • Self-consistency : générer plusieurs chemins de raisonnement et retenir la réponse majoritaire pour gagner en robustesse.
  • Raisonnement masqué : en production, le raisonnement peut être généré en interne puis retiré de la sortie visible par l'utilisateur, pour garder des réponses nettes.

Une mise en garde pratique : un raisonnement exposé peut divulguer une logique sensible ou être verbeux, d'où la pratique fréquente de séparer le raisonnement de la réponse finale affichée aux utilisateurs.

Exemple concret

Prompt : « Un magasin vend les crayons 3 pour 2 $. Combien coûtent 12 crayons ? Réfléchis étape par étape. »

Sortie du modèle :

1. 12 crayons répartis en groupes de 3 donnent 4 groupes.

2. Chaque groupe coûte 2 $.

3. 4 groupes fois 2 $ égalent 8 $.

Réponse finale : 8 $.

Sans les étapes, un modèle pourrait se tromper. Avec le Chain-of-Thought, le chemin structuré mène à un résultat correct et vérifiable.

Direct Answer vs Chain-of-ThoughtQuestionDirectAnswerHigher riskQuestionStep 1Step 2ReasonedAnswerLower riskWithout CoTWith CoT
Direct answering skips intermediate steps, while Chain-of-Thought adds reasoning steps that lead to more reliable answers.

Questions fréquentes

Qu'est-ce que le Chain-of-Thought ?

Le Chain-of-Thought (CoT) est une technique où un grand modèle de langage produit une suite d'étapes de raisonnement intermédiaires avant de donner sa réponse finale, au lieu de sauter directement à la conclusion. On le déclenche par une instruction du type « procédons étape par étape », par des exemples résolus qui montrent le raisonnement, ou par un entraînement qui fait du raisonnement pas à pas le comportement par défaut du modèle. On parle aussi de CoT ou de raisonnement pas à pas.

Dans quels cas le Chain-of-Thought améliore-t-il vraiment les résultats ?

Sur les tâches qu'on ne peut pas résoudre d'un seul coup : arithmétique à plusieurs étapes, énigmes logiques, décisions complexes. Le Chain-of-Thought aide parce que chaque étape s'appuie sur un résultat intermédiaire vérifié, ce qui réduit les erreurs, et parce que la trace de raisonnement visible facilite l'audit et le débogage du modèle. Les benchmarks de raisonnement montrent régulièrement une précision supérieure au prompting à réponse directe.

Quelle différence entre Chain-of-Thought zero-shot et few-shot ?

Le CoT zero-shot ajoute simplement une consigne au prompt, du type « explique ton raisonnement étape par étape », sans aucun exemple. Le CoT few-shot insère 2 à 5 exemples dans le prompt qui montrent explicitement le raisonnement, avant de poser la nouvelle question. Le few-shot coûte plus de tokens mais vous donne la main sur la forme du raisonnement attendu.

Faut-il montrer les étapes de raisonnement aux utilisateurs finaux ?

En général non. Un raisonnement exposé peut divulguer une logique métier sensible et reste souvent verbeux : les équipes le génèrent en interne puis le retirent de la sortie affichée, une approche dite hidden reasoning. Le raisonnement demeure disponible pour l'audit et le débogage interne, tandis que l'utilisateur ne voit qu'une réponse finale propre.

Qu'est-ce que la self-consistency et quel lien avec le Chain-of-Thought ?

La self-consistency consiste à générer plusieurs chemins de raisonnement indépendants pour une même question, puis à retenir la réponse majoritaire. Elle s'appuie sur le Chain-of-Thought : une chaîne unique peut dérailler à une étape, alors que l'accord entre plusieurs chaînes rend la réponse finale plus robuste. La contrepartie est le coût, puisque le modèle est appelé plusieurs fois par question.