IAAgents IA

Anthropic garde la main sur Claude, et voilà pourquoi c'est plus difficile qu'il n'y paraît

Anthropic vient de révéler que son laboratoire de biologie a produit des résultats inattendus avec Claude, mais a pris soin de préciser que des humains restent dans la boucle à chaque étape. Ce détail, souvent traité comme une formalité, cache une difficulté d'ingénierie que la plupart des équipes sous-estiment sérieusement.

Neo NeumannNeo NeumannRéférent IA23 septembre 2026

La supervision humaine dans les workflows d'agents fait partie des principes que tout le monde cite et que peu d'équipes savent réellement mettre en place. Quand un agent se contente de produire du texte, la supervision reste gérée : un humain relit, valide, corrige. Mais dès que l'agent dispose d'outils réels, la donne change. Il peut envoyer un e-mail, modifier une base de données, déclencher une commande API, réserver un vol. À ce moment-là, "garder un humain dans la boucle" cesse d'être un principe et devient un problème d'architecture.

Le cas Anthropic mérite d'être lu de près. La société a annoncé que son laboratoire de biologie interne avait produit des découvertes potentiellement importantes en faisant travailler Claude sur des tâches de recherche. Ce qui frappe dans la couverture de TechCrunch, c'est la précision ajoutée presque en passant : Anthropic n'a pas laissé Claude opérer en autonomie totale. Des chercheurs humains valident les étapes, examinent les résultats, décident des directions suivantes. Pour une entreprise dont le modèle de langage est parmi les plus avancés disponibles en 2026, ce choix de retenue dit quelque chose d'utile sur la difficulté réelle du problème.

Supervision des agents : un problème de périmètre avant d'être technique

Un manager qui déploie un agent connecté à ses outils métier n'a pas besoin de comprendre le code sous-jacent. En revanche, il doit comprendre ce que l'agent peut faire sans lui demander la permission, et dans quelles conditions ce périmètre change.

La tentation courante est de traiter la supervision comme un interrupteur binaire : soit l'agent est autonome, soit un humain valide tout. En pratique, la question porte sur la granularité. Quelles actions déclenchent une validation humaine ? À quel moment dans le flux ? Par qui ? Avec quel délai acceptable ?

Ces questions ne sont pas théoriques. Un agent commercial connecté à un CRM peut mettre à jour des fiches clients, envoyer des e-mails de relance, créer des opportunités dans le pipeline. Si la supervision ne définit pas exactement où l'humain intervient, l'agent prend des décisions qui affectent de vraies relations commerciales sans que personne s'en aperçoive avant qu'il soit trop tard pour corriger.

L'autre enjeu tient à la vitesse. Un agent qui s'arrête pour validation à chaque action perd l'essentiel de sa valeur. Un agent qui ne s'arrête jamais expose l'organisation à des erreurs irréversibles. Trouver l'équilibre entre ces deux positions constitue le vrai travail.

Comment insérer une validation humaine dans un agent outillé ?

Quand un agent dispose d'outils via function calling, chaque appel d'outil représente un point de décision. L'agent reçoit un résultat de l'outil, l'interprète, décide de l'étape suivante. C'est à ces points de décision que la supervision s'insère, ou pas.

Prenons un agent de traitement des commandes fournisseurs, connecté à un ERP, à un système de messagerie et à un outil de signature électronique. Une commande arrive, l'agent vérifie les stocks, compare les prix, prépare un bon de commande, l'envoie pour signature. Si chaque étape s'enchaîne sans validation humaine, l'agent a engagé l'entreprise contractuellement avant que quiconque ait vu le document.

La supervision bien conçue dans ce scénario ressemble à ceci : l'agent traite les étapes de vérification et de préparation en autonomie, mais une règle explicite l'arrête avant l'appel à l'outil de signature. Un humain reçoit une notification avec le récapitulatif, valide ou modifie, et l'agent reprend. Ce que cela demande techniquement, c'est une définition claire des actions à fort impact, un mécanisme d'interruption dans le flux, et un registre de ce qui s'est passé avant la pause.

Le modèle MCP (Model Context Protocol), que O'Reilly Radar décrit comme bien plus qu'un simple standard d'intégration d'outils, complique légèrement l'image : quand les connecteurs gèrent eux-mêmes une partie des permissions, la supervision ne peut plus reposer uniquement sur la logique de l'agent. Il faut aussigouverner ce que les connecteurs autorisent, couche par couche.

Ce que l'exemple d'Anthropic illustre bien : même avec un modèle très capable, la décision de maintenir une validation humaine sur les étapes clés n'est pas un aveu de faiblesse du modèle. C'est une réponse aux propriétés du domaine. En biologie, une erreur de direction sur une expérience coûte des semaines. Dans un ERP, une commande signée par erreur déclenche des pénalités contractuelles. La supervision s'ajuste à l'irréversibilité des actions, pas au niveau de confiance abstrait dans le modèle.

Fatigue d'approbation : quand la supervision humaine devient du théâtre

La supervision humaine dans un workflow d'agent apporte une valeur réelle dans trois situations précises : quand les actions ont des effets irréversibles à court terme, quand le domaine implique des jugements normatifs que le modèle ne peut pas trancher seul (éthique, politique interne, relation client sensible), et quand les données d'entraînement du modèle couvrent mal le contexte spécifique de l'organisation.

Elle devient un problème quand elle est mal positionnée. Les points de validation placés trop tôt dans le flux, sur des décisions de faible impact, génèrent de la fatigue d'approbation. Les équipes valident mécaniquement, sans vraiment lire, et la supervision ne protège plus de rien. C'est l'équivalent organisationnel du "cliquer sur OK" sans lire les conditions générales.

L'autre piège tient au volume. Un agent qui traite cent interactions par jour avec un point de validation humain sur chacune n'est pas un agent : c'est un assistant sous-utilisé qui génère une file d'attente. Pourcalibrer où l'humain apporte vraiment de la valeur dans le flux, il faut analyser les types d'erreurs que l'agent produit, leur fréquence et leur impact, avant de décider des points de contrôle.

La supervision intelligente n'est pas non plus figée. Elle évolue à mesure que l'agent accumule un historique vérifiable. Un agent commercial qui gère mille relances sans erreur peut progressivement opérer avec moins de validations sur les cas standards, tout en maintenant les contrôles sur les exceptions.

Ce que le choix d'Anthropic dans son laboratoire de biologie montre, c'est que la maturité d'un système agent ne se mesure pas à l'autonomie accordée au modèle, mais à la précision avec

Questions fréquentes

Pourquoi Anthropic n'a pas laissé Claude travailler en autonomie dans son laboratoire de biologie ?

Anthropic fait valider par des chercheurs humains les étapes de recherche menées avec Claude parce que le domaine est peu tolérant à l'erreur : une mauvaise direction expérimentale coûte des semaines de travail. Ce choix répond aux propriétés du domaine, pas à une faiblesse du modèle.

À quel moment placer un point de validation humaine dans un workflow d'agent ?

Le point de validation se place juste avant les actions irréversibles : envoi d'un bon de commande à la signature électronique, modification définitive d'une base, engagement contractuel. Les étapes de vérification et de préparation peuvent rester en autonomie, avec un registre de ce qui s'est passé avant la pause.

Qu'est-ce que la fatigue d'approbation dans les workflows d'agents IA ?

La fatigue d'approbation apparaît quand les points de validation sont placés trop tôt et sur des décisions de faible impact : les équipes valident mécaniquement, sans lire, et le contrôle ne protège plus de rien. Un agent traitant cent interactions par jour avec une validation sur chacune génère surtout une file d'attente.

Le Model Context Protocol change-t-il la façon de superviser un agent ?

Oui, car avec MCP une partie des permissions est gérée par les connecteurs eux-mêmes. La supervision ne peut donc plus reposer uniquement sur la logique de l'agent : il faut gouverner couche par couche ce que chaque connecteur autorise.

Pour aller plus loin

Les leçons qui prolongent cet article, en accès libre.

  1. 1Guardrails, permissions et human-in-the-loopAgents IA : concevoir, construire, exploiter
  2. 2Tools et function calling : donner des mains à votre agentAgents IA : concevoir, construire, exploiter
  3. 3Évaluer et déboguer les agents : traces, evals et modes de défaillanceAgents IA : concevoir, construire, exploiter
  4. 4Agents vs workflows vs automations : choisir le bon niveau d'autonomieAgents IA : concevoir, construire, exploiter
  5. 5Sécurité, permissions et gouvernance des connecteursClaude et l'écosystème Anthropic

Vous avez lu cet article ?

Validez votre lecture pour gagner de l’XP et alimenter votre radar.