+100 XP

Cookieless & data clean rooms : fondations et concepts clés

Les cookies tiers ne sont pas morts à la date prévue, et c'est le fait le plus mal lu du marketing technology aujourd'hui. Google a fait marche arrière sur son plan de suppression dans Chrome en juillet 2024, et a confirmé en avril 2025 qu'il ne lancerait pas de prompt dédié demandant aux utilisateurs de Chrome de se désinscrire. Les cookies fonctionnent toujours dans Chrome, qui représente environ deux tiers de l'usage mondial des navigateurs.

Tout ce qui les entoure a bougé malgré tout. Safari bloque les cookies tiers par défaut depuis 2020, Firefox depuis 2019, et l'App Tracking Transparency d'Apple, en production avec iOS 14.5 en avril 2021, a placé le tracking cross-app derrière un prompt de permission que la plupart des utilisateurs refusent. Meta a indiqué à ses investisseurs en février 2022 que l'ATT lui coûterait environ 10 milliards de dollars de revenus cette année-là. Les règles de consentement en Europe continuent de restreindre ce que vous pouvez collecter avant qu'une personne clique sur accepter.

L'infrastructure que le secteur a construite en réponse, c'est la data clean room, et c'est l'objet de ce module. Cette leçon la définit : ce qu'elle est, à quoi elle répond, à quoi elle ne répondra jamais, et comment deux entreprises matchent leurs clients quand aucune ne veut céder sa base clients.

De quoi parle-t-on exactement ?

Un cookie tiers est un petit fichier déposé sur un navigateur par un domaine autre que le site visité. Les annonceurs les ont utilisés pendant deux décennies pour suivre les gens d'un site à l'autre, construire des profils comportementaux et faire du retargeting. Vous regardez une paire de chaussures de running sur le site d'un distributeur, vous revoyez ces chaussures sur un site d'actualité une heure plus tard : c'était un cookie tiers.

La dépréciation des cookies, c'est le refus des navigateurs de stocker ou d'envoyer ces fichiers. Deux des trois grands navigateurs le font déjà. L'image honnête est donc une image scindée : les cookies fonctionnent dans Chrome, ils ne fonctionnent pas dans Safari ou Firefox, le tracking sur applications mobiles est cassé indépendamment des navigateurs, et la plomberie de remplacement a déjà été construite et payée. Le revirement de Google a changé l'échéance, pas la direction.

Une data clean room est un environnement contrôlé où deux parties ou plus combinent leurs données first-party selon des règles convenues à l'avance, et où la seule chose autorisée à sortir est un résultat agrégé. Chaque partie apporte des enregistrements qu'elle détient déjà légalement. Le matching et les calculs se passent à l'intérieur. Aucune des deux parties ne peut lire, exporter ou ré-identifier les lignes de l'autre.

Trois propriétés la distinguent d'une base de données partagée. Les enregistrements bruts ne franchissent jamais la frontière : ce qu'une partie apporte reste invisible pour l'autre. Les requêtes sont limitées à une liste approuvée d'opérations et de sorties, convenue avant que quiconque n'exécute quoi que ce soit. Et les résultats en dessous d'une taille de groupe minimale sont supprimés, en général un plancher de quelques dizaines d'utilisateurs, pour que vous ne puissiez pas resserrer une requête jusqu'à ce qu'elle décrive un seul foyer.

Cela fait de la clean room un environnement de mesure et d'audience, pas un transfert de données. Si ce que vous voulez, c'est posséder les données de l'autre partie, ce n'est pas le bon achat.

Quatre sous-concepts que tout CMO doit intégrer

1. la donnée first-party est désormais une infrastructure concurrentielle

La donnée first-party est ce que vous collectez directement auprès des clients avec leur consentement : historique d'achat, comportement de fidélité, navigation en mode connecté, engagement email. Vous la détenez, et elle ne s'évapore pas quand un éditeur de navigateur change un réglage par défaut.

Apple est la démonstration la plus claire de l'enjeu. L'entreprise a restreint le tracking tiers sur tout iOS tout en faisant tourner sa propre activité publicitaire sur des signaux qu'elle possède en propre : requêtes de recherche App Store, historique de téléchargements, données de compte. L'entreprise qui a durci les règles était aussi la moins exposée à celles-ci, parce que ses données venaient de sa propre relation avec l'utilisateur. Cette asymétrie, c'est tout l'argument en faveur de la construction d'une base clients authentifiée.

2. l'identity resolution : la couche de liant

Sans cookie pour recoudre les sessions entre elles, il vous faut un autre moyen de reconnaître deux fois la même personne. L'identity resolution rapproche des signaux comme les adresses email hachées, les numéros de téléphone ou les identifiants d'appareil dans un profil persistant unique. L'email haché est devenu la clé de fait, et les deux standards largement déployés qui s'appuient dessus sont Unified ID 2.0 de The Trade Desk et RampID de LiveRamp.

La friction mérite d'être comprise avant de supposer que l'email résout tout. Le Hide My Email d'Apple attribue une adresse relais unique à chaque service auquel un client se connecte, si bien que l'adresse présente dans votre CRM ne correspond à rien dans le fichier de personne d'autre. Chaque adresse relais, chaque faute de frappe, chaque séparation pro/perso est un client qui existe dans les deux jeux de données et ne matche dans aucun.

3. les data clean rooms : la mécanique

Il y a trois formes sur le marché. Une clean room détenue par une plateforme se situe dans un walled garden et fonctionne selon les conditions et les données de cette plateforme. Une clean room cloud neutre tourne sur une infrastructure qu'aucune des deux parties ne possède : Snowflake, un acteur de ce marché, a ajouté une capacité clean room via son acquisition de Samooha en janvier 2024, de sorte que les clients qui y stockent déjà leurs données peuvent ouvrir une room avec un partenaire sans rien déplacer. Une clean room décentralisée, le modèle que vend InfoSum, ne met jamais les données en commun : chaque partie garde ses enregistrements dans son propre environnement et seules des clés chiffrées et non identifiantes franchissent la frontière pour produire le match.

Le matching lui-même est moins mystérieux que ne le suggère le marketing. Les emails et numéros de téléphone sont normalisés et hachés, en général en SHA-256 avec un salt partagé, pour que la même adresse produise la même chaîne illisible des deux côtés. Le matching déterministe apparie des hash identiques. Le matching probabiliste déduit un lien de signaux plus faibles comme l'adresse IP et le profil d'appareil, et il s'agit d'une estimation statistique et non d'un fait. Des méthodes cryptographiques, dont la private set intersection, permettent à deux parties de calculer la taille et la composition de leur overlap sans qu'aucune n'apprenne qui se trouve en dehors. Les planchers d'agrégation et, dans certains systèmes, un bruit statistique délibéré empêchent quiconque de reconstituer un individu à partir d'une série de requêtes étroites.

Une réserve qui intéresse plus les juristes que les ingénieurs : le hachage est une pseudonymisation, pas une anonymisation. Le même email donne toujours le même hash, ce qui est précisément la raison pour laquelle le matching fonctionne, et pourquoi les régulateurs de l'UE et du Royaume-Uni considèrent généralement les identifiants hachés comme des données personnelles. Le contrat qui encadre une clean room fait autant de travail que la cryptographie.

4. le ciblage contextuel comme stratégie parallèle

Le ciblage contextuel place les publicités en fonction du contenu de la page plutôt que de l'historique du lecteur. Quelqu'un qui lit un test de trail running voit des chaussures de trail. Aucune donnée utilisateur requise, aucune identité à résoudre, aucune dépendance au consentement.

C'est la plus ancienne méthode de ciblage qui existe, et elle revient sur le devant de la scène parce que la plus récente est devenue plus difficile. Les versions modernes lisent le sens de la page via des modèles de langage plutôt que des listes de mots-clés, ce qui gère mieux la brand safety que les blocklists grossières d'il y a dix ans. Ce que le contextuel ne peut pas faire, c'est vous dire si le lecteur a acheté quelque chose. Cette question appartient à la clean room, raison pour laquelle les deux coexistent plutôt qu'ils ne se concurrencent.

How Data Clean Rooms Work

Watch on YouTube

Ce qu'une clean room peut et ne peut pas répondre

ce qui en sort

Les questions d'overlap, d'abord : combien de vos clients achètent aussi chez ce partenaire, combien ils y dépensent, en quoi le groupe en overlap diffère du reste de votre base. Le reach et la fréquence dédupliqués entre deux jeux de données qui ne voient chacun que leur moitié. Le reporting exposition-vers-résultat au sein de l'ensemble matché, ce qui est le plus près que la plupart des marques arrivent de boucler la boucle entre une impression média et un achat qu'elles n'ont pas observé. Et, lorsque l'accord permet l'activation et pas seulement la mesure, des sorties d'audience : listes de suppression, segments seed, groupes renvoyés dans une plateforme d'achat sans qu'aucune base clients ne change jamais de mains.

ce qui n'en sort jamais

Les enregistrements au niveau de la ligne. Tout ce qui concerne les personnes en dehors de l'overlap, qui sont généralement la majorité. La causalité, sauf si quelqu'un a conçu un holdout avant le lancement de la campagne, car une clean room corrèle l'exposition avec l'achat et ne fabrique pas de contrefactuel. Les petites tranches, que le plancher d'agrégation supprime délibérément. Et absolument rien sur un concurrent, puisque les seules données présentes dans la room sont celles que les deux parties ont accepté d'apporter.

là où le match rate décide de tout

Chaque chiffre produit par une clean room décrit la population matchée, pas votre base clients. Les match rates sont rarement proches de l'exhaustivité ; un fichier de marque confronté à un fichier de distributeur se recoupe souvent sur une fraction, et cette fraction penche vers les inscrits au programme de fidélité et les gros acheteurs, ceux qui sont les plus disposés à s'identifier. Lisez un résultat de clean room sans demander le match rate et le dénominateur, et vous lisez une affirmation sur vos meilleurs clients en la prenant pour une affirmation sur votre marché.

Vérification des acquis

1. Qu'est-ce qui décrit le mieux la fonction centrale d'une data clean room ?

2. Pourquoi la donnée first-party est-elle décrite comme une « infrastructure concurrentielle » plutôt que comme une source de données parmi d'autres ?

3. Un cookie tiers se distingue de la donnée first-party principalement parce que :

CHOIX MULTIPLES

4. Sélectionnez TOUTES les affirmations exactes sur la dépréciation des cookies et son impact.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les caractéristiques qui rendent une data clean room « privacy-safe ».

Sélectionnez toutes les réponses correctes.

The Future of Digital Advertising Without Cookies

Watch on YouTube

Plan d'action pour le CMO

  • Auditez votre donnée first-party avant toute conversation sur une clean room. Si vous ne pouvez pas dire combien d'enregistrements clients authentifiés et à consentement vérifié vous détenez, et quels identifiants porte chaque enregistrement, vous ne pouvez pas évaluer la proposition d'un partenaire, parce que vous ne pouvez pas prédire votre propre match rate.
  • Ne lisez pas le revirement de Google comme une autorisation de ralentir. Les angles morts Safari et Firefox persistent, l'ATT a déjà cassé le tracking mobile, et les règles de consentement se durcissent. Les équipes qui ont mis en pause leurs travaux post-cookie en 2024 ont perdu deux ans de construction d'audience authentifiée qu'elles ne pourront pas racheter.
  • Faites du match rate et du seuil d'agrégation des questions systématiques pour chaque partenaire et chaque vendor. Les deux chiffres déterminent ce que toute analyse future pourra dire, et les deux sont connaissables avant de signer.
  • Apprenez l'objet en l'utilisant une fois. Un seul petit test connectant votre CRM aux données d'un partenaire apprendra plus à votre équipe sur les identifiants, la revue juridique et la maturité des données que n'importe quel deck de vendor.

Erreurs courantes qui tuent les résultats

  • Traiter la clean room comme un achat technologique plutôt que comme un partenariat de données. Le logiciel est largement banalisé. La valeur réside dans les données contre lesquelles vous matchez. Acheter un déploiement Snowflake ou InfoSum avant de savoir quel overlap partenaire vous voulez réellement, c'est payer pour un coffre vide.
  • Confondre haché et anonyme. Le hachage cache l'adresse à un lecteur humain ; il ne sort pas l'enregistrement du champ du droit de la vie privée. La revue juridique d'un premier accord de clean room prend couramment plus de temps que l'intégration technique, donc lancez l'accord de traitement des données et l'audit de consentement en même temps que le connecteur, pas après.
  • N'utiliser une clean room que pour expliquer le passé. La plupart des marques s'arrêtent au reporting sur des campagnes terminées. La sortie est plus utile comme entrée : suppression des personnes déjà converties, seeds pour la prospection, arbitrages budgétaires fondés sur l'overlap observé.

Points clés à retenir

  • Les cookies ont survécu dans Chrome après les revirements de Google en 2024 et 2025, mais Safari, Firefox et l'ATT d'Apple ont supprimé définitivement une large part du signal, si bien que l'éloignement des identifiants tiers se poursuit par sa propre dynamique.
  • Une data clean room est un environnement contrôlé où deux parties combinent leurs données first-party selon des règles convenues à l'avance et où seule une sortie agrégée circule : pas d'enregistrements bruts en sortie, requêtes restreintes, tailles de groupe minimales.
  • Le matching sans identifiant partagé repose sur des emails et numéros de téléphone normalisés et hachés, déterministe quand les hash concordent et probabiliste quand ils ne concordent pas, avec la private set intersection et les planchers d'agrégation pour protéger les enregistrements hors overlap.
  • Les clean rooms répondent aux questions d'overlap, de reach dédupliqué et d'exposition-vers-résultat à l'intérieur de l'ensemble matché. Elles ne livrent pas de données au niveau de la ligne, pas de causalité sans holdout conçu en amont, et rien sur les personnes en dehors du match.
  • Le match rate est le chiffre qui gouverne tous les autres chiffres. Demandez-le, et demandez le dénominateur, avant d'agir sur un résultat de clean room.

Ressources

  • 🔗
    IAB Tech Lab : Seller Defined Audiences & Privacy Sandbox Overview

    La documentation officielle de l'IAB Tech Lab sur les propositions Privacy Sandbox, les specs techniques d'UID2 et les standards de seller-defined audiences : lecture indispensable avant toute négociation avec une agence ou un vendor.

  • 🔗
    Think with Google : Ads Data Hub Case Studies

    La bibliothèque de cas clients annonceurs sélectionnés par Google autour d'Ads Data Hub, avec décomposition méthodologique et métriques de lift rapportées par des marques comme Unilever et L'Oréal.

À faire, tiré de cette leçon

Ces actions sont compilées dans le plan d'action du rôle.

  • Lancer un pilote de clean room avec un partenaire retail sous 90 jours
  • Lancer la revue juridique et consentement en parallèle de la mise en place technique de la clean room
Voir le plan d'action complet →

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.