+150 XP

À qui appartient la donnée : la gouvernance entre studios, plateformes et distributeurs

À 21h14, quelqu'un lance la lecture d'un film sous licence via l'application intégrée d'une smart TV. Ce simple clic génère au moins trois pistes de données : le fabricant de la smart TV enregistre l'identifiant de l'appareil et la durée de visionnage, la plateforme de streaming enregistre le compte, les points de pause et le parcours de navigation qui a mené au clic, et le studio qui a concédé la licence du film obtient... peut-être rien. Ou peut-être un rapport agrégé mensuel. Ou, dans un deal bien négocié, un flux de données qu'il peut réellement interroger. Ce qui se produit n'est pas décidé par la technologie mais par une clause contractuelle, en général la partie la moins glamour de la négociation de licence.

Cette leçon suit cet événement de visionnage pour montrer comment les chartes de gouvernance et les accords de partage de données déterminent qui possède quoi, et où ces deals bloquent en pratique.

Trois parties, trois intérêts

Le studio (par ex. Warner Bros. Discovery, Sony Pictures) veut des données d'audience et de visionnage pour orienter ses futurs greenlights, ses dépenses marketing et le pricing de la fenêtre suivante (SVOD, puis AVOD, puis licence à d'autres plateformes). La donnée est un actif stratégique, pas un sous-produit.

La plateforme de streaming (par ex. Netflix, Max, Amazon Prime Video) détient la relation client directe. Elle contrôle les données au niveau du compte : ce que ce spectateur regarde par ailleurs, le risque de churn, les signaux de composition du foyer. Les plateformes protègent farouchement ces données car elles sont la base de leurs moteurs de recommandation et de leurs modèles de rétention.

Le fabricant de smart TV (par ex. Samsung, LG, Roku, Vizio) se situe sous les deux autres. Son système d'exploitation voit chaque application lancée, chaque commande de la télécommande, parfois même le contenu affiché via l'automatic content recognition (ACR), une technologie qui échantillonne les pixels ou l'audio pour identifier ce qui est à l'écran, quelle qu'en soit la source. Les données ACR ont de la valeur pour les annonceurs et constituent une ligne de revenu croissante pour les fabricants de TV eux-mêmes.

Trois parties, trois jeux de données distincts, décrivant le même événement de 21h14. Aucune n'a automatiquement le droit de voir la part des autres.

Propriété des données contre accès aux données : la clause qui décide de tout

La « propriété » est le mauvais modèle mental pour la plupart des litiges de données dans les médias. Les logs bruts de visionnage appartiennent typiquement à celui qui les collecte (la plateforme ou le fabricant d'appareils), et sont régis par sa propre politique de confidentialité et ses conditions d'utilisation.

Ce que les studios négocient réellement, ce sont des droits d'accès, définis dans l'annexe de partage de données de l'accord de licence. Les paliers habituels, du plus faible au plus fort :

  • Reporting agrégé : totaux mensuels (par ex. « 2,1 millions d'heures streamées »), aucune granularité, aucune possibilité d'interroger les données.
  • Données au niveau cohorte : ventilations par région, type d'appareil ou palier d'abonnement, toujours anonymisées.
  • Données pseudonymisées au niveau événement : sessions de visionnage individuelles liées à un ID haché, pas à un nom réel, mais ré-identifiables en théorie.
  • Accès en requête via API : le studio peut exécuter ses propres requêtes définies sur le data warehouse de la plateforme, sous audit.

La plupart des accords de licence se contentent d'un reporting agrégé. L'accès complet en requête via API est rare, et lorsqu'il existe, il s'accompagne généralement de restrictions sur la jointure (le studio ne peut pas combiner les données de visionnage du streamer avec sa propre base clients pour ré-identifier des individus).

Le socle réglementaire : ce que la loi exige réellement

Trois régimes comptent le plus en 2026 :

Le RGPD (Règlement général sur la protection des données, UE, en vigueur depuis 2018) impose une base légale pour le traitement des données personnelles et donne aux spectateurs de l'UE des droits d'accès, de rectification ou de suppression. Si l'historique de visionnage constitue une donnée personnelle (c'est généralement le cas, puisqu'il est lié à un compte), tout transfert entre studio, plateforme et fabricant d'appareils nécessite une base légale documentée, typiquement un accord de traitement des données précisant la finalité et les limites de conservation. Le Comité européen de la protection des données publie des lignes directrices sur les transferts transfrontaliers, pertinentes pour les licences multi-territoires.

Le CCPA/CPRA (California Consumer Privacy Act, amendé par le California Privacy Rights Act) donne aux résidents californiens le droit de savoir ce qui est collecté et de s'opposer à la « vente » ou au « partage » de données personnelles à des fins publicitaires cross-context. Cela touche directement la monétisation des données ACR par les fabricants de smart TV : si Samsung partage des signaux de visionnage issus de l'ACR avec des régies publicitaires, cela peut être qualifié de « vente » exigeant un mécanisme d'opt-out.

Le VPPA (Video Privacy Protection Act, loi fédérale américaine de 1988, votée à l'origine après qu'un journal a publié l'historique de locations vidéo d'un candidat à la Cour suprême) restreint la divulgation des historiques de visionnage vidéo permettant d'identifier une personne. Il est antérieur au streaming mais les tribunaux l'ont appliqué aux plateformes et aux applications, ce qui en fait un risque contentieux actif dès que des données de visionnage passent à un tiers sans consentement.

Aucune de ces lois ne dit « les studios possèdent les données d'audience ». Elles encadrent *comment* chaque partie peut faire circuler des données personnelles dans la chaîne, et c'est précisément pour cela que le contrat doit faire le gros du travail.

La charte de gouvernance : les règles sur qui peut interroger quoi

Dans les grands groupes médias, une charte de gouvernance des données est le document interne qui traduit la loi externe et les contrats externes en règles opérationnelles : qui peut accéder à quelles données, sous quelle validation, avec quelle journalisation.

Une charte opérationnelle pour ce deal tripartite préciserait :

  1. Classification des données : les données d'événement de visionnage sont-elles classées comme personnelles, pseudonymisées ou agrégées, et cette classification change-t-elle à chaque transfert ?
  2. Contrôle d'accès : quels rôles nommés (pas quels individus) au sein du studio peuvent interroger le jeu de données partagé de la plateforme, et via quelle interface.
  3. Limitation de finalité : des données partagées pour « l'analyse de performance des contenus » ne peuvent pas être silencieusement réutilisées pour du « ciblage publicitaire » sans un nouvel accord.
  4. Conservation et suppression : combien de temps le studio peut conserver les résultats de requêtes après la fin de la licence. C'est là que beaucoup de deals bloquent : les plateformes veulent souvent une suppression à la fin du contrat, les studios veulent conserver les données pour l'analyse de tendances historiques.
  5. Droits d'audit : le studio peut-il inspecter le pipeline de données de la plateforme pour vérifier la conformité, ou reçoit-il seulement des attestations ?

Là où les deals bloquent le plus souvent : le refus de la plateforme d'exposer des données brutes au niveau appareil (crainte d'une fuite concurrentielle vers un studio qui accorde aussi des licences à des rivaux), et le refus du studio d'accepter un reporting uniquement agrégé pour une décision de renouvellement de licence à plusieurs millions de dollars.

Vérification des acquis

1. Dans l'événement de visionnage unique décrit, qu'est-ce qui détermine en dernier ressort quelle partie reçoit quelle portion des données ?

2. Pourquoi la plateforme de streaming résiste-t-elle en général au partage de données de visionnage granulaires au niveau du compte avec le studio qui a concédé la licence du contenu ?

3. Un studio qui négocie un nouvel accord de licence veut pouvoir réellement interroger les données d'audience plutôt que recevoir un rapport statique. Quel résultat reflète la position la plus forte sur le spectre décrit dans la leçon ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les bonnes réponses expliquant pourquoi le même événement de visionnage de 21h14 génère trois pistes de données distinctes et non superposées.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les bonnes réponses concernant l'automatic content recognition (ACR) telle que décrite dans la leçon.

Sélectionnez toutes les réponses correctes.

Vérifications et audits utiles en pratique

Les managers non techniques impliqués dans ces deals devraient tout de même pouvoir demander et lire les éléments suivants :

  • Cartographie du data lineage : un schéma retraçant l'événement de visionnage depuis l'appareil jusqu'à la plateforme puis vers tout tiers, montrant chaque saut. Si un fournisseur ne peut pas en produire une, c'est déjà un signal d'alerte.
  • Échantillon de log de requêtes : la preuve de qui a réellement interrogé les données partagées le trimestre dernier, confrontée à la liste des rôles autorisés dans la charte de gouvernance.
  • Test de risque de ré-identification : une vérification pour savoir si des données « anonymisées » peuvent être reliées à des individus par jointure avec d'autres jeux de données. L'Information Commissioner's Office britannique publie un guide d'anonymisation avec des tests concrets que des non-ingénieurs peuvent demander aux équipes techniques.
  • Audit du consentement : confirmer que le parcours de consentement affiché aux utilisateurs de la plateforme correspond effectivement à ce que l'annexe de partage de données autorise.

Une vérification technique simple qu'une équipe data peut lancer pour signaler un risque de jointure, en pseudo-code compréhensible par tous :

# Vérifier si un jeu de données « pseudonymisé » est réellement anonyme
overlap = shared_columns(dataset_A, dataset_B)
if len(overlap) >= 2 and includes_rare_values(overlap):
    flag("Re-identification risk: high")
else:
    flag("Re-identification risk: low")

Si la base clients d'un studio et l'export « anonymisé » d'une plateforme partagent deux champs ou plus (disons le code postal et le modèle d'appareil), le risque de ré-identification augmente fortement ; c'est le type de vérification que les régulateurs attendent des entreprises avant qu'elles ne qualifient des données d'« anonymisées ».

How Streaming Services Track You

Watch on YouTube

Points clés

  • Un seul événement de visionnage crée des pistes de données distinctes pour le studio, la plateforme de streaming et le fabricant de smart TV ; aucun n'a automatiquement de droits sur les données des autres.
  • Les litiges de données dans les médias portent en général sur des paliers d'accès (agrégé, cohorte, pseudonymisé, accès en requête), pas sur une « propriété » abstraite.
  • Le RGPD, le CCPA/CPRA et le VPPA fixent le socle légal du traitement des données personnelles, mais c'est le contrat de licence et la charte de gouvernance interne qui décident du détail opérationnel : qui peut interroger quoi, pendant combien de temps, pour quelle finalité.
  • Les deals bloquent fréquemment sur la conservation des données après la fin du contrat et sur le niveau de granularité des données partagées, la granularité étant à la fois un actif analytique et un risque concurrentiel.
  • Les audits pratiques (cartographies de data lineage, logs de requêtes, tests de ré-identification, audits de consentement) sont des vérifications que tout manager peut demander, même sans expertise en ingénierie.