Model Evaluation
Aussi : Model Assessment, AI Model Evaluation, Model Validation, Évaluation de modèle, Modellbewertung, Modell-Evaluierung, Model Benchmarking
Le processus qui mesure si un modèle d'IA est assez performant, et assez sûr, pour la décision qu'il doit soutenir.
De quoi il s'agit
Le model evaluation est le contrôle rigoureux de la qualité du travail d'un modèle d'IA ou statistique, avant et après sa mise en production. Il répond à une seule question : peut-on faire suffisamment confiance à ce modèle pour agir sur ses résultats ? Un modèle qui repère les clients à risque de départ, un modèle de tarification, un modèle de langage qui rédige des e-mails clients : chacun est mesuré sur des preuves, pas sur la promesse du fournisseur. L'évaluation compare les prédictions du modèle aux résultats connus, puis chiffre l'écart.
Pourquoi c'est important
Un modèle impressionnant en démonstration peut échouer discrètement sur vos données réelles, et le coût retombe sur l'activité, pas sur l'équipe data. Un modèle de crédit globalement précis mais faux pour un segment de clientèle crée à la fois une perte de revenus et un risque réglementaire. Pour un CFO, l'évaluation distingue une prévision présentable au conseil d'un simple pari. Pour un CMO, elle décide si un modèle de scoring de leads mérite le budget publicitaire qu'il redirige. L'évaluation révèle aussi les biais, la dérive (le modèle qui se dégrade quand le monde change) et les hallucinations des outils génératifs. Y renoncer, c'est apprendre l'échec par un client ou un régulateur.
Comment ça marche
L'équipe met de côté une partie des données que le modèle n'a jamais vues à l'entraînement, puis le teste dessus. Les résultats prennent la forme de métriques : exactitude, précision, rappel, taux d'erreur, ou pour les modèles de langage, des scores sur des jeux de questions et une revue humaine. La bonne métrique dépend du coût métier d'une erreur, donc le rôle du dirigeant est de dire quelle erreur coûte le plus cher. Manquer une fraude et signaler un client fidèle ne sont pas des erreurs équivalentes. L'évaluation continue après le lancement via un suivi, car la performance se dégrade avec le temps. En pratique, un CDO pose trois questions avant d'approuver un modèle : contre quoi a-t-il été testé, comment se comporte-t-il sur notre pire segment, et comment saurons-nous qu'il ne fonctionne plus.