Embedding
Aussi : Vector embedding, Vector representation, Feature vector, Dense vector
Un embedding est un vecteur numérique qui représente des données (texte, images ou items) en capturant leur sens, de sorte que les éléments similaires se retrouvent proches dans l'espace.
De quoi il s'agit
Un embedding est une liste de nombres (un vecteur) qui représente une donnée : un mot, une phrase, une image, un produit ou un utilisateur. Plutôt que de traiter la donnée comme un symbole brut, un modèle la projette dans un espace vectoriel continu où la distance traduit la similarité. Les éléments de sens proche se retrouvent côte à côte, les éléments sans rapport restent éloignés.
Par exemple, les mots « voiture » et « automobile » auraient des vecteurs voisins, alors que « voiture » et « banane » seraient très éloignés. Le vecteur lui-même peut compter des centaines ou des milliers de dimensions (par exemple 384, 768 ou 1536 valeurs).
Pourquoi c'est important
Un ordinateur ne peut pas comparer directement le sens d'un texte brut ou de pixels. Les embeddings transforment des données non structurées en une forme numérique structurée que les algorithmes peuvent mesurer, rechercher et comparer.
- Recherche sémantique : trouver des résultats par le sens, pas seulement par correspondance de mots-clés.
- Recommandations : proposer des items proches de ce que l'utilisateur a apprécié.
- Clustering et classification : regrouper ou labelliser les données automatiquement.
- Retrieval pour l'IA : fournir le contexte pertinent aux grands modèles de langage (RAG).
Les embeddings sont ainsi une brique de base des systèmes d'IA modernes, en data, en marketing comme en finance.
Comment on l'utilise en pratique
1. Générer : passer les données dans un modèle d'embedding pour obtenir des vecteurs.
2. Stocker : enregistrer les vecteurs dans une base vectorielle (par exemple une base qui gère des index pour une recherche rapide).
3. Comparer : mesurer la proximité avec la cosine similarity ou la distance euclidienne.
4. Agir : renvoyer les plus proches voisins comme résultats de recherche, recommandations ou contexte.
La similarité se calcule souvent avec la cosine similarity, qui regarde l'angle entre deux vecteurs plutôt que leur longueur.
Exemple concret
Une équipe marketing dispose de 50 000 tickets de support. Elle transforme chaque ticket en vecteur, puis regroupe les vecteurs par clustering. Les tickets portant sur des « erreurs de facturation » se regroupent naturellement, même quand les clients ont employé des formulations différentes (« mauvais prélèvement », « surfacturé », « facture incorrecte »). L'équipe identifie un problème récurrent sans lire tous les tickets.
En finance, les embeddings de documents réglementaires permettent aux analystes de retrouver des passages traitant du « risque de liquidité » même lorsque ces mots exacts sont absents, ce qui fait remonter plus vite les informations pertinentes.
Points clés
- Les embeddings capturent le sens, pas l'orthographe exacte.
- Leur qualité dépend du modèle utilisé pour les créer.
- Ils alimentent la recherche, les recommandations, le clustering et le retrieval pour l'IA.
Voir aussi
Questions fréquentes
Qu'est-ce qu'un embedding, en termes simples ?
Un embedding est une liste de nombres (un vecteur) qui représente une donnée : un mot, une phrase, une image, un produit, un utilisateur. Le modèle place cette donnée dans un espace vectoriel où la distance traduit la similarité, si bien que « voiture » et « automobile » se retrouvent proches alors que « voiture » et « banane » sont éloignés. Un embedding compte souvent des centaines ou des milliers de dimensions, par exemple 384, 768 ou 1536 valeurs.
Pourquoi les systèmes d'IA ont-ils besoin d'embeddings ?
Parce qu'une machine ne sait pas comparer du sens dans du texte brut ou des pixels. Les embeddings transforment des données non structurées en une forme numérique que les algorithmes peuvent mesurer, chercher et comparer : c'est ce qui rend possibles la recherche sémantique, les recommandations, le clustering et la récupération de contexte pour les grands modèles de langage (RAG).
Quelle différence entre un embedding et un index de recherche par mots-clés ?
Un index par mots-clés compare des orthographes exactes ; un embedding capte le sens. C'est pourquoi des embeddings de documents financiers permettent à un analyste de retrouver les passages qui traitent du risque de liquidité même quand ces mots précis n'y figurent pas, là où une recherche par mots-clés ne renverrait rien.
Comment passe-t-on de données brutes à une chaîne d'embeddings opérationnelle ?
En quatre étapes. Générer les vecteurs en faisant passer les données dans un modèle d'embedding, les stocker dans une vector database dotée d'un index pour des recherches rapides, les comparer via la cosine similarity ou la distance euclidienne, puis exploiter les plus proches voisins comme résultats de recherche, recommandations ou contexte pour un modèle.
Pourquoi utilise-t-on la cosine similarity pour comparer deux embeddings ?
La cosine similarity mesure l'angle entre deux vecteurs, pas leur longueur : elle indique si deux éléments pointent dans la même direction sémantique, indépendamment de leur magnitude. La distance euclidienne est l'autre option courante. En pratique, la qualité de la comparaison dépend surtout du modèle d'embedding retenu, bien plus que de la métrique de distance.