+130 XP

Ce que les LLM font très bien (et ce qu'ils font mal)

Demandez à ChatGPT, Claude ou Gemini combien de fois la lettre « r » apparaît dans « strawberry », et il y a de bonnes chances qu'il réponde « deux ». La bonne réponse est trois. C'est un modèle capable de rédiger une synthèse juridique, d'expliquer l'effet tunnel quantique et d'écrire du code qui fonctionne, et pourtant il bute sur une question qu'un enfant de six ans résout.

Toute la leçon tient dans cette contradiction. Une fois que vous comprenez *pourquoi* elle se produit, vous pouvez prédire où ces outils excellent et où ils échouent discrètement.

Un mot rapide sur ce que fait réellement un LLM

LLM signifie « large language model ». C'est le moteur derrière ChatGPT, Claude et Gemini. En clair : c'est un système entraîné à prédire le prochain morceau de texte le plus probable, à partir des régularités observées dans une énorme quantité d'écrits.

Ce n'est pas une calculatrice. Ce n'est pas une base de données. C'est un compléteur de motifs linguistiques très sophistiqué.

Gardez cette idée en tête et la plupart de ses comportements cessent d'être surprenants.

Le problème de la fraise, expliqué

Les LLM ne lisent pas les lettres comme vous. Avant de traiter votre texte, ils le découpent en tokens : des morceaux de texte, souvent des mots entiers ou des fragments de mots. « Strawberry » peut devenir un ou deux tokens, pas sept lettres individuelles.

Donc quand vous lui demandez de compter les « r », il travaille sur une version floue et pré-découpée du mot. Il n'a jamais vraiment vu les lettres une par une. Il devine à partir de motifs, et deviner est exactement le mauvais outil pour un décompte exact.

Le même angle mort apparaît avec :

  • L'arithmétique exacte sur de grands nombres (48 271 × 9 330)
  • Le comptage de mots, de caractères ou d'éléments dans une longue liste
  • Tout ce qui demande une comptabilité précise et mécanique

Essayez ceci et observez-le patauger :

« Combien de mots contient cette phrase, et combien commencent par une voyelle ? »

Il donnera souvent un nombre faux, avec assurance.

La solution : donnez-lui des outils

Les versions actuelles de ChatGPT, Claude et Gemini peuvent exécuter du code ou appeler une calculatrice en coulisses. Quand elles le font, la précision grimpe, parce que le calcul réel est pris en charge par un vrai ordinateur, pas par une devinette statistique.

Si vous disposez d'un modèle capable d'exécuter du code, ce prompt force le chemin fiable :

Count the letter "r" in "strawberry" by writing and running 
Python code, then show me the result.
python
word = "strawberry"
print(word.count("r"))  # 3

La leçon : quand vous avez besoin d'un nombre exact, **demandez au modèle d'*utiliser un outil*, ou faites cette étape vous-même**.

Là où les LLM excellent vraiment

Maintenant, la bonne nouvelle. La même complétion de motifs qui échoue au comptage est *brillante* sur le travail linguistique. Ce sont les gains sur lesquels vous devriez vous appuyer tous les jours.

Réécrire et changer de ton

C'est sans doute la chose la plus utile que font les LLM. Collez un texte maladroit et demandez un ton précis.

« Réécris cet e-mail pour qu'il soit plus chaleureux et plus court, et supprime les excuses au début. »

Il n'y a pas de réponse « correcte » unique ici, et c'est précisément pour cela que le modèle s'épanouit. Il remixe du langage, il ne calcule pas un fait.

Résumer

Déposez un long article, une transcription ou un fil de discussion et demandez l'essentiel.

« Résume ce rapport de 2 000 mots en 5 puces qui intéresseraient un manager pressé. »

Il est très bon à cela. Rappelez-vous simplement : il peut parfois omettre ou déformer un détail, donc vérifiez tout chiffre ou nom qui compte.

Brainstormer et rédiger

Les problèmes de page blanche, c'est là que les LLM ressemblent à de la magie. Noms, plans, angles, premiers jets.

« Donne-moi 10 objets d'e-mail pour une invitation à un webinaire sur l'IA pour les experts-comptables. Mélange curieux, direct et légèrement joueur. »

Vous ne demandez pas *la* bonne réponse. Vous demandez de nombreuses options plausibles auxquelles réagir. C'est le terrain de jeu du modèle.

Un gain de rédaction net, côte à côte

Voici le contraste qui résume tout le paysage.

L'échec (tâche de précision) :

« Combien de r dans strawberry ? » → « Il y a deux r. » (Faux.)

Le gain (tâche linguistique) :

« Transforme ces notes brutes en un point client poli de 3 phrases : projet retardé, nouvelle date le 14 mars, plan révisé envoyé vendredi. »
→ « Bonjour Sarah, je voulais vous signaler que le calendrier du projet a bougé, notre nouvelle date cible est désormais le 14 mars. Nous préparons un plan révisé et vous l'enverrons d'ici vendredi. Merci de votre patience, et n'hésitez pas à revenir vers nous pour toute question. »

Même outil, même minute. L'un est une devinette déguisée en fait. L'autre est exactement ce pour quoi ces systèmes ont été conçus.

Le schéma à retenir

Il existe un test simple pour savoir si une tâche joue sur les forces d'un LLM.

Joue sur les forces : la tâche admet de nombreuses réponses acceptables, et l'objectif est « assez bon et fluide ». Réécrire, résumer, expliquer, brainstormer, traduire, rédiger.

Joue sur les faiblesses : la tâche a exactement une réponse correcte qui dépend d'un comptage précis, d'un calcul ou de faits actuels. Maths, comptage de caractères, données en temps réel, citations exactes.

Quand vous êtes en territoire « une seule réponse correcte », donnez un outil au modèle ou vérifiez la sortie vous-même.

Why Can't ChatGPT Count the R's in Strawberry?

Watch on YouTube

Vérification des acquis

1. D'après la leçon, quelle est la description la plus juste de ce que fait fondamentalement un LLM ?

2. Pourquoi un LLM compte-t-il souvent mal la lettre « r » dans « strawberry » ?

3. Vous avez besoin qu'un LLM produise un résultat exact pour « 48 271 × 9 330 ». D'après la leçon, quelle est la meilleure approche ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les tâches que la leçon identifie comme des angles morts où les LLM échouent sans outils.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les affirmations qui reflètent correctement le raisonnement de la leçon sur les réussites et les échecs des LLM.

Sélectionnez toutes les réponses correctes.

L'autre grande faiblesse : les réponses fausses assénées avec assurance

Nous approfondirons ce point dans la leçon sur les hallucinations, mais il a aussi sa place ici. Une hallucination, c'est quand un LLM affirme quelque chose de faux en toute confiance : une fausse citation, une statistique inventée, une décision de justice qui n'a jamais existé.

Ce n'est pas du mensonge. Le modèle fait son travail, prédire un texte qui sonne plausible, et « plausible » n'est pas la même chose que « vrai ».

Les tâches les plus risquées combinent deux caractéristiques :

  1. Il existe une réponse précise et vérifiable.
  2. Le modèle n'a aucun outil pour la vérifier.

C'est pourquoi « Quelle est la population de Lyon en 2026 ? » ou « Cite trois études évaluées par les pairs sur X » sont des zones dangereuses. Le modèle inventera volontiers une réponse d'apparence impeccable.

Défense pratique

Utilisez le modèle pour la *forme* du travail, et vérifiez les *faits*.

« Rédige un paragraphe sur les bénéfices du télétravail. Marque toute statistique précise avec [VERIFY] pour que je sache quoi vérifier. »

La plupart des modèles actuels signalent leurs incertitudes quand vous le leur demandez. Vous pouvez aussi activer la recherche web (disponible dans ChatGPT, Claude et Gemini) pour que les affirmations factuelles soient ancrées dans des sources réelles sur lesquelles vous pouvez cliquer.

Pour une lecture gratuite et plus approfondie sur le fonctionnement de ces systèmes et sur leurs dérapages, le cours [Elements of AI](https://www.elementsofai.com/) est un excellent point de départ, sans jargon.

Comment organiser votre travail autour de cela

Pas besoin de mémoriser une liste. Triez simplement chaque tâche avant de prompter.

Étape 1 : nommez le type de tâche. Est-ce un travail de *langage* (réécrire, résumer, brainstormer) ou un travail de *précision* (compter, calculer, trouver un fait) ?

Étape 2 : adaptez l'approche.

  • Travail de langage → promptez librement, itérez, choisissez la meilleure version.
  • Travail de précision → demandez au modèle d'utiliser un outil (code, calculatrice, recherche web), ou faites cette partie vous-même.

Étape 3 : vérifiez ce qui est vérifiable. Chiffres, noms, dates et citations méritent un second coup d'œil rapide. Le ton et la formulation, non.

Un prompt combiné qui exploite correctement chaque force :

Summarize the attached sales notes into 4 bullets for my boss. 
For any total or percentage, calculate it using code and double 
check it. Flag anything you're unsure about with [VERIFY].

Cela confie le travail linguistique au modèle et les maths à un outil, d'un seul coup. C'est l'état d'esprit : laissez le LLM faire du langage, et ne lui faites jamais confiance par défaut comme calculatrice ou comme encyclopédie.

Points clés

  • Les LLM prédisent du langage, ils ne calculent pas des faits. C'est pourquoi ils réussissent la réécriture et ratent le comptage des « r » dans « strawberry ».
  • Appuyez-vous sur eux pour les travaux de langage : réécriture, résumé, brainstorming, rédaction, traduction. Toute tâche admettant de nombreuses réponses acceptables est une force.
  • Soyez prudent sur les travaux de précision : maths exactes, comptage, données en temps réel et citations. Soit vous dites au modèle d'utiliser un outil, soit vous vérifiez vous-même.
  • Forcez le chemin fiable par le prompt. Demandez-lui d'« utiliser du code » pour les maths, activez la recherche web pour les faits, et exigez des marqueurs [VERIFY] sur tout ce qui est vérifiable.
  • Vérifiez ce qui est vérifiable, détendez-vous sur le reste. Recontrôlez chiffres, noms et dates ; laissez passer le ton et la formulation.

À faire, tiré de cette leçon

Ces actions sont compilées dans le plan d'action du rôle.

  • Classez chaque tâche en travail de langage ou travail de précision avant de rédiger le prompt
  • Vérifier toutes les citations, chiffres, dates, noms et affirmations sensibles auprès des sources
  • Demandez au modèle d'utiliser des outils pour les calculs et la recherche web pour les faits
  • Demandez des marqueurs [VERIFY] sur toute affirmation vérifiable dans la sortie
Voir le plan d'action complet →

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.