Retail media et clean rooms : partager la data sans la céder
Un fabricant de snacks veut savoir si ses displaysdisplaysLe nombre total de fois qu'une publicité ou un contenu est affiché, indépendamment des clics. Chaque affichage compte pour une impression, même auprès de la même personne.Voir la définition complète → en magasin et ses publicités in-app ont réellement fait vendre plus de chips le trimestre dernier. Le distributeur détient la réponse dans ses données de carte de fidélité et de point de vente (POS). Aucune des deux parties ne veut transmettre ses fichiers bruts : la marque ne veut pas exposer ses investissements média ni sa logique d'audience, le distributeur ne diffusera pas les historiques d'achat au niveau shopper. Le deal se fait quand même, dans une « clean room ». Personne ne voit la data brute de l'autre. Les deux repartent avec un chiffre de lift.
Ce montage est désormais la structure par défaut des deals retail media, et il vaut la peine de comprendre exactement comment il fonctionne et où il peut encore échouer.
Ce qu'est réellement une clean room
Une data clean room est un environnement contrôlé où deux parties ou plus apportent leurs données, exécutent des requêtes convenues à l'avance et ne voient que le résultat agrégé, jamais les enregistrements sous-jacents de l'autre.
Techniquement, cela repose sur des outils comme le hashed matching (transformertransformerUn Transformer est une architecture de réseau de neurones qui utilise le self-attention pour traiter des séquences en parallèle. Elle est au cœur de la plupart des modèles de langage et d'IA générative actuels.Voir la définition complète → des identifiants tels que l'email ou l'ID de fidélité en codes irrirrLe taux de rendement interne est le taux d'actualisation qui annule la valeur actuelle nette d'un projet. Il exprime le rendement annualisé attendu d'un investissement.Voir la définition complète →éversibles pour que les deux parties puissent rapprocher les enregistrements sans les révéler), la differential privacy (ajout de bruit statistique pour qu'aucun individu ne puisse être ré-identifié à partir des résultats) et les seuils de k-anonymité (une règle selon laquelle aucun résultat n'est affiché s'il ne représente pas au moins *kkLe nombre moyen de nouveaux utilisateurs que chaque utilisateur existant génère par recommandation. Au-dessus de 1,0, la croissance s'auto-alimente et devient exponentielle.Voir la définition complète →* personnes, couramment 25 à 100 selon le distributeur).
Principales implémentations : Amazon Marketing Cloud, la clean room de Walmart Connect (construite en partie sur la technologie de Publicis Epsilon), Kroger Precision Marketing (via 84.51°) et Ads Data Hub de Google. Snowflake et Databricks proposent aussi une infrastructure de clean room neutre que marques et distributeurs peuvent licencier conjointement plutôt que de faire confiance à la plateforme de l'une des parties.
Pourquoi cela existe : l'étau réglementaire
Trois forces ont poussé le secteur dans cette direction simultanément.
La fin des cookies. Google supprime progressivement les cookies tiers de Chrome sur 2025 à 2026 (calendrier repoussé et révisé à plusieurs reprises ; il s'agit du plan annoncé par Google, pas d'une loi figée), ce qui tue l'ancienne façon dont les marques suivaient les shoppers sur le web.
Le droit de la vie privée. Dans l'UE, le RGPDRGPDRèglement de l'UE encadrant la collecte, le stockage et l'usage des données personnelles, avec des amendes indexées sur le chiffre d'affaires mondial.Voir la définition complète → (Règlement général sur la protection des données, appliqué par les autorités nationales de protection des données) exige une base légale pour traiter des données personnelles et donne aux shoppers des droits d'accès, de rectification et d'effacement. Aux États-Unis, il n'existe pas de loi fédérale unique, mais des lois d'État comme le CCPA/CPRA (California Consumer Privacy Act, mis à jour par le California Privacy Rights Act, appliqué par la California Privacy Protection Agency) confèrent des droits similaires et imposent des obligations lorsque des données sont « vendues » ou « partagées », une notion assez large pour couvrir de nombreux dispositifs de ciblage publicitaire.
Le pouvoir des distributeurs. Des acteurs comme Kroger, Walmart, Tesco (Clubcard) et Carrefour ont compris que leur data de fidélité first-party est plus précieuse et plus durable que n'importe quel cookie. Le retail media est aujourd'hui l'un des segmentssegmentsDécouper un marché en groupes distincts de clients partageant des besoins, des caractéristiques ou des comportements similaires, afin de traiter chaque groupe avec une approche dédiée.Voir la définition complète → publicitaires qui croissent le plus vite au monde ; les estimations d'eMarketer (rapports 2024 à 2025) placent les dépenses retail media américaines à plusieurs dizaines de milliards par an, Amazon détenant la plus grosse part individuelle.
Les clean rooms permettent aux distributeurs de monétiser cette data sans « vente » au sens juridique, puisque les données personnelles brutes ne quittent jamais leur environnement.
Comment se déroule concrètement une mesure de lift
Supposons que la marque de snacks ait mené une campagne retail media de quatre semaines. Le workflow :
- La marque charge son log d'exposition campagne (quels IDs de fidélité, hashés, ont vu la publicité) dans la clean room.
- Les données POS du distributeur (mêmes IDs de fidélité hashés, historique d'achat) se trouvent dans le même environnement.
- Une requête de type SQLSQLSales Qualified Lead : un prospect que l'équipe commerciale a validé comme prêt pour une prise de contact directe et une proposition, après avoir passé des critères de qualification explicites.Voir la définition complète → convenue à l'avance joint les deux sur l'ID hashé et répartit les shoppers en « exposés » et « contrôle ».
- Seul le résultat agrégé revient : lift des ventes incrémentales, efficacité des dépenses, effet de halo sur la catégorie.
Une version simplifiée de la logique de requête :
SELECT
campaign_group,
COUNT(DISTINCT hashed_loyalty_id) AS shoppers,
SUM(basket_value) AS total_sales
FROM matched_exposure_and_pos
WHERE k_anon_check >= 25
GROUP BY campaign_group;Cette ligne k_anon_check >= 25 est le contrôle de gouvernance : si un segment (disons un SKU de parfum de niche sur un petit cluster de magasins) compte moins de 25 shoppers appariés, la requête ne renvoie rien plutôt qu'un chiffre qui pourrait être rétro-ingénieré pour identifier des individus.
Exemple chiffré : le groupe exposé de 50 000 shoppers dépense en moyenne 4,20 $ sur la catégorie après la campagne ; le groupe de contrôle apparié de 50 000 dépense 3,80 $. Lift = (4,20 $ - 3,80 $) / 3,80 $ = 10,5 %. C'est le seul chiffre que voit l'équipe média de la marque. Elle ne voit jamais de quelles 50 000 personnes il s'agit, ce qu'il y avait d'autre dans leur panier, ni leurs noms.
Là où la gouvernance a encore un vrai travail à faire
Les clean rooms réduisent le risque, elles n'éliminent pas le besoin de supervision. Trois contrôles comptent le plus :
Audit des requêtes. Quelqu'un doit journaliser chaque requête exécutée dans la clean room et surveiller la dérive : une marque qui pose des questions exagérément étroites pour isoler de petits segments identifiables (un vecteur classique d'attaque par ré-identification).
Traçabilité du consentement. La data de fidélité qui alimente la clean room doit remonter à un consentement valide ou à une base d'intérêt légitime au titre du RGPD, ou à un mécanisme d'opt-out conforme au CCPA. Si le consentement sous-jacent était défectueux, l'agréger dans une clean room n'y change rien. Les équipes de gouvernance doivent pouvoir répondre à la question « à quoi le shopper a-t-il consenti » pour toute donnée entrant dans la room. Les orientations de l'ICO britannique sur l'anonymisation et la pseudonymisation constituent une référence gratuite solide sur le point où commence juridiquement le « suffisamment anonymisé ».
Contrôles fournisseurs et transferts hors UE. Beaucoup de fournisseurs de clean rooms sont des hyperscalers américains (Amazon, Google, Microsoft, Snowflake, Databricks). Un distributeur européen qui fait passer des données de shoppers de l'UE par une clean room dont le siège est aux États-Unis a besoin d'un mécanisme de transfert valide, typiquement des clauses contractuelles types (SCC), depuis l'arrarrL'Annual Recurring Revenue (ARR) est le revenu normalisé et prévisible qu'une entreprise par abonnement attend de ses contrats actifs sur une année.Voir la définition complète →êt *Schrems II* de 2020 qui a invalidé le précédent cadre Privacy Shield UE-États-Unis. C'est une question juridique vivante, pas réglée, en particulier après le Data Privacy Framework UE-États-Unis de 2023, lui-même visé par des recours en cours.
Vérification des acquis
1. Quelle est la caractéristique structurelle centrale qui rend une data clean room acceptable à la fois pour une marque et pour un distributeur qui ne se font pas confiance avec la data brute ?
2. Pourquoi un distributeur utiliserait-il un seuil de k-anonymité (par ex. aucun résultat affiché s'il ne représente pas au moins 25-100 personnes) dans une requête de clean room ?
3. Une marque veut savoir exactement quels porteurs de carte de fidélité ont vu sa publicité in-app puis acheté des chips, afin de constituer une liste de retargeting personnalisée. Pourquoi une clean room ne serait-elle PAS le bon outil pour cet objectif ?
4. Sélectionnez TOUTES les réponses correctes expliquant pourquoi les deals en clean room dans le retail media sont devenus la norme du secteur.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les réponses correctes concernant les mécanismes techniques qui rendent les clean rooms privacy-safe.
Sélectionnez toutes les réponses correctes.
Les limites du modèle
Les clean rooms résolvent le problème du « ne pas céder la data brute ». Elles ne résolvent pas tout :
- Fuite par les résultats dans le temps. Exécuter de nombreuses requêtes légèrement différentes sur la même population peut permettre à un acteur sophistiqué de reconstituer statistiquement de l'insight au niveau individuel, une faiblesse connue parfois appelée « attaque par différenciation ». Les distributeurs plafonnent la fréquence des requêtes et journalisent l'historique précisément pour la détecter.
- Asymétrie de pouvoir. Amazon et Walmart fixent les règles de leurs propres clean rooms. Une marque de snacks de taille moyenne a beaucoup moins de levier de négociation sur les requêtes autorisées que les régies publicitaires d'Amazon ou de Walmart.
- Aucun standard global unique. L'IAB Tech Lab et d'autres ont publié des frameworks, mais les implémentations diffèrent selon les distributeurs : une marque travaillant avec cinq distributeurs gère cinq configurations de clean room différentes, cinq dictionnaires de données différents, cinq postures de gouvernance différentes.
🎬 [VIDEO: « What Are Data Clean Rooms? (And Why Retailers Love Them) » - youtube.com - cherchez des explainers récents de l'IAB Tech Lab ou des interventions dans les grandes conférences ad-tech (LiveRamp, Snowflake, InfoSum) pour une visualisation du flux de matching et de requêtes décrit ci-dessus]
Points clés
- Une data clean room permet à deux parties (marque et distributeur) de joindre et d'interroger des données sans que l'une voie les enregistrements bruts et identifiables de l'autre ; les résultats sont agrégés et soumis à seuil (couramment k ≥ 25 à 100).
- Ce modèle s'est imposé à cause de la fin des cookies, de la pression de conformité RGPD et CCPA/CPRA, et de la prise de conscience par les distributeurs que la data de fidélité first-party est un actif monétisable durable.
- Les infrastructures réelles incluent Amazon Marketing Cloud, Kroger Precision Marketing/84.51°, Walmart Connect, Google Ads Data Hub, et des fournisseurs neutres comme Snowflake et Databricks.
- La responsabilité de gouvernance ne disparaît pas dans la clean room : audit des requêtes, traçabilité du consentement jusqu'à la base RGPD/CCPA, et mécanismes de transfert hors UE (SCC post-Schrems II) exigent toujours des contrôles actifs.
- Le modèle réduit le risque de ré-identification mais ne l'élimine pas totalement ; des requêtes étroites répétées peuvent encore laisser fuiter de l'insight au niveau individuel dans le temps, raison pour laquelle la journalisation des requêtes et les limites de fréquence comptent autant que l'architecture de données initiale.