Glossaire
IADatageneral

MLOps

Aussi : MLOps, Machine Learning Operations, ML Ops, LLMOps, ModelOps

Machine Learning Operations : combinaison des pratiques ML et DevOps pour industrialiser, déployer, monitorer et réentraîner les modèles de façon fiable en production.

De quoi il s'agit

Le MLOps (Machine Learning Operations) désigne l'ensemble des pratiques, outils et disciplines organisationnelles qui permettent de faire passer les modèles de machine learning de l'expérimentation à une production fiable et reproductible. Il applique l'automatisation et la rigueur du DevOps aux enjeux propres au ML : pipelines de données, entraînement des modèles, versioning, déploiement et monitoring continu.

Contrairement à un logiciel classique, un système ML dépend des données autant que du code. Un modèle qui fonctionnait le trimestre dernier peut se dégrader silencieusement à mesure que les comportements clients, les prix ou les conditions de marché évoluent. Le MLOps existe pour piloter cette cible mouvante.

Pourquoi c'est important

La plupart des projets ML n'atteignent jamais la production, et beaucoup de ceux qui y arrivent échouent sans bruit. Le MLOps comble l'écart entre un prototype prometteur et une capacité métier fiable.

  • Fiabilité : les modèles se comportent de façon prévisible et peuvent être rollbackés.
  • Reproductibilité : tout résultat peut être rattaché à des données, un code et des paramètres précis.
  • Vitesse : les nouvelles versions sortent en heures ou en jours, pas en mois.
  • Gouvernance : pistes d'audit, contrôle des accès et lineage documenté au service de la conformité.
  • Maîtrise des coûts : le réentraînement et le monitoring automatisés évitent des défaillances silencieuses coûteuses.

Comment on l'utilise en pratique

Un dispositif MLOps mature couvre généralement :

  • Pipelines de données et de features : versionnés, validés, reproductibles.
  • Experiment tracking : enregistrement des paramètres, métriques et artefacts.
  • Model registry : un catalogue des versions de modèles validées et de leur statut.
  • CI/CD pour les modèles : tests, packaging et déploiement automatisés.
  • Monitoring : suivi de la latence, de la précision et du data drift (évolution des données d'entrée dans le temps).
  • Réentraînement automatisé : déclenché selon un calendrier ou par la détection d'un drift.

Ces pratiques s'appliquent aussi bien aux modèles prédictifs classiques qu'aux systèmes LLM appliqués (où les prompts, les sources de retrieval et les jeux d'évaluation doivent eux aussi être versionnés et monitorés, ce qu'on appelle parfois LLMOps).

Un exemple concret

Une banque déploie un modèle de credit scoring.

1. Les data scientists entraînent un modèle ; le run est loggé avec sa version de dataset et ses métriques.

2. Le modèle passe les tests automatisés d'équité et de précision, puis entre dans le registry en statut « staging ».

3. Après validation humaine, il est promu en « production » et exposé via une API.

4. Le monitoring signale que la distribution des revenus des demandeurs a changé (drift) et que les taux d'acceptation grimpent.

5. Un pipeline automatisé réentraîne le modèle sur des données fraîches, la nouvelle version est testée et remplace l'ancienne avec un historique d'audit complet.

Sans MLOps, l'étape 4 pourrait passer inaperçue jusqu'à ce que des pertes ou un régulateur mettent le problème au jour.

The MLOps lifecycle Data and features Train and track Registry and deploy Serve in production Monitor and detect drift Retrain (automated)
MLOps as a closed loop: data and training feed deployment, while monitoring and drift detection trigger automated retraining.

Questions fréquentes

Qu'est-ce que le MLOps, en termes simples ?

Le MLOps (Machine Learning Operations) regroupe les pratiques, outils et disciplines d'organisation qui font passer un modèle de machine learning de l'expérimentation à une production fiable et reproductible. Il applique l'automatisation et la rigueur du DevOps aux problèmes propres au ML : pipelines de données, entraînement, versioning, déploiement et monitoring continu. La différence avec un logiciel classique : un système ML dépend des données autant que du code, donc un modèle performant le trimestre dernier peut se dégrader silencieusement quand les comportements ou les conditions de marché changent.

Quelle différence entre MLOps et DevOps ?

Le DevOps industrialise du code ; le MLOps industrialise du code, des données et des modèles. Une application classique se comporte à l'identique tant que personne ne touche au code, alors qu'un modèle ML peut perdre en performance sans aucune modification de code, simplement parce que les données entrantes ont changé. Le MLOps ajoute donc aux pipelines CI/CD habituels les pipelines de données et de features, l'experiment tracking, un model registry, le monitoring de drift et le réentraînement automatisé.

Qu'est-ce que le data drift et pourquoi impose-t-il un réentraînement ?

Le data drift désigne l'évolution, dans le temps, des données reçues en production par rapport à celles sur lesquelles le modèle a été entraîné. Comme le modèle a appris des relations sur l'ancienne distribution, ses prédictions deviennent progressivement moins fiables, souvent sans erreur visible. C'est le monitoring du drift qui déclenche le réentraînement, soit selon un calendrier, soit automatiquement dès qu'un écart est détecté.

Que contient concrètement un dispositif MLOps mature ?

Six briques : des pipelines de données et de features versionnés et validés, l'experiment tracking (paramètres, métriques, artefacts), un model registry recensant les versions approuvées et leur statut, du CI/CD pour tester, packager et déployer les modèles, le monitoring de la latence, de la performance et du data drift, et un réentraînement automatisé déclenché par calendrier ou par détection de drift. L'ensemble apporte fiabilité, reproductibilité, mises en production plus rapides, pistes d'audit pour la gouvernance et protection contre les défaillances silencieuses coûteuses.

Les pratiques MLOps s'appliquent-elles aux projets LLM, ou est-ce autre chose ?

Elles s'appliquent, et cette variante est parfois appelée LLMOps. La même discipline vaut pour les systèmes LLM appliqués, à ceci près que les prompts, les sources de retrieval et les jeux d'évaluation doivent eux aussi être versionnés et monitorés, en plus du modèle. La logique reste identique : tracer chaque résultat vers des entrées précises, tester avant de promouvoir, surveiller après le déploiement.