Glossaire
IA

Model Distillation

Aussi : Knowledge Distillation, Teacher-Student Training

La model distillation entraîne un petit modèle « élève » à imiter un grand modèle « professeur », transférant son comportement dans une forme plus rapide, moins coûteuse et plus facile à déployer.

De quoi il s'agit

La model distillation (aussi appelée knowledge distillation) est une technique de transfert des capacités d'un modèle large et précis (le teacher) vers un modèle plus petit et plus efficace (le student). Au lieu d'entraîner l'élève uniquement sur des hard labels (la bonne réponse), la distillation lui apprend à reproduire les sorties plus riches du professeur : distributions de probabilités complètes, représentations intermédiaires ou réponses générées.

L'idée centrale : les soft outputs d'un professeur portent plus d'information qu'un simple label. Quand un professeur attribue 70 % à « chat », 25 % à « chien » et 5 % à « renard », il révèle des relations de similarité entre classes qu'un hard label masque. L'élève apprend ces nuances et atteint souvent une précision proche du professeur pour une fraction de la taille.

Pourquoi c'est important

  • Coût réduit : les modèles plus petits demandent moins de compute et de mémoire, ce qui réduit la facture d'inférence.
  • Inférence plus rapide : la latence réduite permet des usages temps réel et on device.
  • Déploiement edge : les modèles distillés peuvent tourner sur des téléphones, des navigateurs ou du matériel embarqué.
  • Efficacité énergétique : moins de paramètres signifie une consommation plus faible à l'échelle.

Comment on l'utilise en pratique

1. Entraîner ou se procurer un teacher performant.

2. Faire tourner le teacher sur un dataset pour collecter les soft targets (logits, probabilités ou texte généré).

3. Entraîner le student à reproduire ces cibles, souvent en combinaison avec les labels d'origine.

4. Un paramètre de température adoucit les distributions de probabilités pour exposer plus de détail.

5. Évaluer le student sur la précision, la latence et la taille, puis itérer.

Parmi les variantes : la distillation basée sur les réponses (reproduire les sorties), la distillation basée sur les features (reproduire les couches cachées) et la self distillation (un modèle qui enseigne à une copie de lui-même).

Exemple concret

Une entreprise exploite un modèle de langage de 70 milliards de paramètres qui répond avec précision aux tickets de support, mais coûte trop cher par requête. Elle l'utilise comme teacher pour générer des milliers de réponses de qualité, puis distille ce comportement dans un student de 7 milliards de paramètres. Le student traite les tickets courants à un dixième du coût avec une qualité comparable, tandis que le grand modèle est réservé aux escalades complexes.

Arbitrages

La distillation égale rarement parfaitement le teacher, et le student hérite de ses biais et de ses erreurs. La qualité dépend fortement des données de distillation et de l'objectif retenu.

Model Distillation FlowTeacherlarge, accurateStudentsmall, fastsoft targets(probabilities)Student learns to mimic teacher outputsResult: near teacher quality at lower cost and latency
A teacher model's soft outputs guide a smaller student model toward similar behavior.

Voir aussi

Questions fréquentes

Qu'est-ce que la distillation de modèle, en une phrase ?

La distillation de modèle est une technique d'entraînement où un petit modèle (le student) apprend à reproduire le comportement d'un modèle plus grand et plus précis (le teacher). Le student ne s'entraîne pas seulement sur les bonnes réponses, mais sur les sorties plus riches du teacher : distributions de probabilités complètes, représentations internes ou textes générés. On parle aussi de knowledge distillation ou de teacher-student training.

Pourquoi ne pas simplement déployer le gros modèle ?

Parce que le coût d'inférence, la latence et les contraintes matérielles le rendent souvent impraticable. Un modèle distillé consomme moins de compute et de mémoire : la facture par requête baisse, le temps de réponse devient compatible avec le temps réel, et le modèle peut tourner sur un téléphone, dans un navigateur ou sur du matériel embarqué. Le schéma courant consiste à traiter le trafic routinier avec le petit modèle et à réserver le grand aux cas complexes.

Quelle différence entre la distillation et l'entraînement d'un petit modèle de zéro ?

Un petit modèle entraîné de zéro ne voit que des labels durs, une seule bonne réponse par exemple. La distillation lui fournit en plus les sorties souples du teacher, qui révèlent les proximités entre options : un teacher qui attribue 70 % à « chat », 25 % à « chien » et 5 % à « renard » transmet une information qu'un label unique masque. C'est ce signal supplémentaire qui permet au student distillé d'approcher la précision du teacher pour une taille bien moindre.

Quelles sont les étapes d'un projet de distillation ?

Cinq étapes : obtenir ou entraîner un teacher solide, le faire tourner sur un jeu de données pour collecter les cibles souples (logits, probabilités ou textes générés), entraîner le student à reproduire ces cibles, souvent en combinaison avec les labels d'origine, régler le paramètre de température qui adoucit les distributions pour exposer plus de détail, puis évaluer le student sur la précision, la latence et la taille, et itérer.

Quelles sont les limites d'un modèle distillé ?

Un student égale rarement exactement son teacher, et il hérite de ses biais et de ses erreurs en même temps que de ses capacités. La qualité finale dépend fortement des données de distillation et de l'objectif retenu : distillation sur les sorties, distillation sur les couches cachées, ou self-distillation où un modèle entraîne une copie de lui-même. Prévoyez une évaluation qui mesure la précision réellement perdue, pas seulement la taille gagnée.