Glossaire
IA

Inference

Aussi : Model Inference, AI Inference, Inferencing, Inference serving, Inférence, Inférence de modèle, Modell-Inferenz

Le moment où un modèle d'IA entraîné se met au travail : il reçoit une donnée nouvelle et produit une réponse, une prédiction ou un contenu.

De quoi il s'agit

L'inference est la phase d'exécution d'un modèle d'IA. L'entraînement, c'est quand le modèle apprend à partir de données ; l'inference, c'est quand il applique ce qu'il a appris à une donnée nouvelle. Chaque fois qu'un utilisateur pose une question à un chatbot et obtient une réponse, ce cycle demande-réponse est une inference. Un CMO rencontre l'inference quand un moteur de recommandation évalue un visiteur et choisit l'offre à afficher. Un CFO la rencontre quand un modèle de fraude signale une transaction en temps réel. Le modèle ne change plus, il produit une sortie.

Pourquoi c'est important

L'inference est le point où l'IA rejoint votre compte de résultat, car c'est la partie que vous payez de façon répétée. L'entraînement a lieu de temps en temps, mais l'inference tourne à chaque utilisation, et le coût croît avec le volume. Un modèle peu coûteux à construire peut rester cher à exploiter si des millions d'inferences s'exécutent chaque jour. Pour les dirigeants, cela redéfinit la discussion budgétaire : la vraie question n'est pas seulement "combien coûte la construction" mais "combien coûte chaque réponse, multiplié par le nombre de réponses par mois". L'inference détermine aussi directement l'expérience client. Une inference lente donne un assistant qui rame ; une inference peu fiable envoie de mauvaises recommandations aux clients. La latence, le coût par appel et la précision au moment de l'inference sont les mesures qui décident si une fonctionnalité IA est lancée ou reste au laboratoire.

Comment ça marche

Au moment de l'inference, le modèle entraîné se trouve derrière une API ou intégré dans une application. Une requête arrive (un prompt, une image, un ensemble d'attributs client), le modèle la traite et renvoie un résultat, généralement en quelques millisecondes à quelques secondes. Plus le modèle est lourd, plus chaque inference consomme de puissance de calcul, d'où l'arbitrage entre taille du modèle, vitesse et coût. Des techniques comme la distillation de modèle et des fenêtres de contexte réduites existent en grande partie pour rendre l'inference moins chère et plus rapide. En tant que dirigeant, vous rencontrerez l'inference dans les tarifs des fournisseurs (souvent facturés au token ou à l'appel), dans les niveaux de service de latence, et dans la planification des capacités quand une fonctionnalité devient soudain populaire.