+70 XP

Systèmes de recommandation : architectures et personnalisation éthique

Toute organisation qui sert plus de quelques centaines de clients laisse déjà passer des opportunités de personnalisation. La segmentation manuelle (5 à 10 segments de clients, chacun recevant la même expérience) laisse beaucoup de valeur de côté. La personnalisation pilotée par l'IA, qui traite chaque client comme un segment d'une personne, est la norme chez les leaders de la consommation et devient accessible à tous.

Le spectre de la personnalisation

Personnalisation rule-based : des règles explicites (« si le client est dans le segment X et possède le produit Y, afficher le message Z »). Transparente, explicable, mais ne passe pas à l'échelle : vous ne pouvez pas écrire de règles pour chaque situation.

Personnalisation ML-based : les modèles apprennent des patterns à partir du comportement et du contexte pour prédire le bon contenu, produit ou message pour chaque individu. Passe à l'échelle de millions d'utilisateurs. Netflix, Amazon et Spotify opèrent entièrement à ce niveau.

Personnalisation générative : les LLM génèrent du contenu personnalisé (emails, descriptions produit, explications) adapté au contexte individuel. Encore émergente, mais de plus en plus praticable.

La plupart des organisations devraient viser la personnalisation ML-based. Le rule-based est un point de départ, pas une destination.

Building Recommendation Systems

Watch on YouTube

Vérification des acquis

1. Quelle est la principale limite de la personnalisation rule-based qui la rend inadaptée comme destination finale pour la plupart des organisations ?

2. Un service de streaming veut recommander des contenus à un tout nouvel utilisateur sans historique d'interactions. Quelle approche répond le mieux à ce défi ?

3. Qu'est-ce qui décrit le mieux le mécanisme central d'un two-tower neural network pour la recommandation ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les affirmations correctes sur le spectre de la personnalisation décrit dans la leçon.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les affirmations correctes distinguant le collaborative filtering du content-based filtering.

Sélectionnez toutes les réponses correctes.

Architectures de systèmes de recommandation

Collaborative filtering : recommande à partir de ce que des utilisateurs similaires ont aimé. « Les utilisateurs comme vous ont aussi apprécié X. » Fonctionne bien avec des données abondantes, mais souffre du problème du cold-start (pas de recommandation pour un nouvel utilisateur sans historique).

Content-based filtering : recommande à partir des attributs des items. « Vous avez aimé des documentaires sur le changement climatique, en voici d'autres. » Nécessite des métadonnées riches sur les items. Ne nécessite pas d'historique utilisateur (résout le cold-start). Moins de sérendipité.

Factorisation matricielle : décompose la matrice d'interactions utilisateur-item en facteurs latents représentant les préférences des utilisateurs et les caractéristiques des items. Efficace à grande échelle. Utilisée par Netflix (l'approche primée) et Spotify (Discover Weekly).

Two-tower neural networks : l'état de l'art actuel pour la recommandation à grande échelle. Un « tower » encode les utilisateurs, l'autre encode les items. Les items dont les vecteurs sont les plus proches du vecteur de l'utilisateur sont recommandés. Google, YouTube et Pinterest utilisent cette architecture.

Recommandations session-based : recommande à partir du contexte de la session en cours, pas du comportement historique. Essentiel pour les utilisateurs anonymes ou les recommandations très dépendantes du contexte (quoi acheter en complément de l'article actuellement dans le panier).

Le cas de la personnalisation e-commerce

Amazon attribue 35 % de son chiffre d'affaires aux systèmes de recommandation. Leur approche couvre toutes les surfaces : page d'accueil (« D'après votre navigation »), fiche produit (« Les clients ont aussi acheté »), email (« Cela pourrait vous plaire ») et checkout (« Fréquemment achetés ensemble »).

L'infrastructure derrière : les événements de comportement utilisateur (vues, clics, achats) arrivent en temps réel dans un feature store. Les items candidats sont récupérés via des embeddings (recherche approximative des plus proches voisins). Les candidats sont classés par un modèle de scoring en temps réel qui intègre prix, stock, pertinence et marge. Les top-K items sont affichés.

L'ensemble du pipeline s'exécute en moins de 100 ms à chaque chargement de page.

Éthique et équité de la personnalisation

La personnalisation soulève des questions éthiques que les CDO doivent traiter :

Bulles de filtre : ne recommander que ce que les utilisateurs aiment déjà réduit l'exposition à de nouvelles idées. Dans les contextes d'actualité et d'information, cela a des implications sociétales. Intégrez une diversité intentionnelle dans les systèmes de recommandation.

Manipulation vs pertinence : optimiser pour l'engagement (temps passé, clics) peut conduire à promouvoir des contenus addictifs ou nuisibles. Définissez soigneusement l'objectif d'optimisation. Chez Netflix, la métrique principale est la satisfaction des abonnés à long terme, pas l'engagement immédiat.

Transparence : les utilisateurs devraient comprendre pourquoi ils voient une recommandation. « Parce que vous avez regardé X » est un mécanisme de transparence simple mais puissant, qui construit aussi la confiance.

Caractéristiques protégées : la personnalisation ne doit pas discriminer sur la base de la race, du genre, de la religion ou d'autres caractéristiques protégées. Des systèmes qui corrèlent des variables proxy avec des caractéristiques protégées peuvent produire des résultats discriminatoires sans discrimination explicite.

Quiz Questions

  1. Quel est le "problème du cold-start" dans les systèmes de recommandation par filtrage collaboratif ?

A) Le système est trop lent au démarrage

B) L'impossibilité de générer des recommandations pertinentes pour les nouveaux utilisateurs sans historique comportemental

C) Le manque de données pour les nouveaux produits

D) Les recommandations sont trop similaires entre utilisateurs

Réponse: B

  1. Quelle architecture de recommendation est considérée comme l'état de l'art pour les systèmes à grande échelle comme YouTube ou Google ?

A) Filtrage collaboratif classique

B) Factorisation matricielle

C) Two-tower neural networks (un tower pour l'utilisateur, un pour l'item)

D) Filtrage basé sur le contenu

Réponse: C

  1. Pourquoi optimiser uniquement pour l'engagement (temps passé, clics) peut-il être problématique dans les systèmes de recommandation ?

A) Cela augmente trop les coûts de calcul

B) Cela peut favoriser du contenu addictif ou nuisible, créer des bulles de filtre, et nuire à la satisfaction à long terme des utilisateurs

C) Cela rend le système moins précis

D) Cela viole automatiquement les réglementations RGPD

Réponse: B

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.