Data lineage, propriété intellectuelle et pièges de confidentialité
Une équipe de discovery dans une biotech de taille moyenne soumet à un modèle de chimie générative un prompt demandant de nouveaux scaffolds d'inhibiteurs de kinases. Le modèle, entraîné en partie sur des serveurs de preprints scrapés et des textes de brevets qu'il n'a jamais eu la licence d'utiliser, produit une molécule. Six mois et 2 millions de dollars d'optimisation de lead plus tard, une recherche de liberté d'exploitation révèle que le scaffold central se trouve dans un brevet de composition de matière déposé trois ans plus tôt par un concurrent. Le modèle ne « savait » pas que c'était protégé. Il avait simplement appris des motifs à partir de données qui incluaient le brevet lui-même. Personne n'avait retracé l'origine de ces données d'entraînement, donc personne ne l'a détecté avant que le juridique ne fasse une recherche manuelle, trop tard pour éviter le coût irrirrLe taux de rendement interne est le taux d'actualisation qui annule la valeur actuelle nette d'un projet. Il exprime le rendement annualisé attendu d'un investissement.Voir la définition complète →écupérable.
Voilà le piège : les défaillances de data lineagedata lineageLe data lineage cartographie les déplacements et transformations de la donnée à travers les systèmes, de l'origine à la consommation : d'où elle vient, ce qui l'a modifiée, et où elle va.Voir la définition complète → ressemblent à des accidents juridiques, mais ce sont des défaillances de gouvernance. Elles se produisent en amont, bien avant qu'un juriste ne voie l'output.
Ce que signifie le « data lineage » et pourquoi la pharma est exposée
Le data lineage est la traçabilité documentée de l'origine d'un jeu de données, de ses transformations et des droits d'usage détenus à chaque étape. Pour un modèle d'IA, le lineage couvre les données d'entraînement, les données de fine-tuningfine-tuningLe fine-tuning adapte un modèle pré-entraîné à une tâche ou un domaine précis en poursuivant son entraînement sur un jeu de données plus petit et ciblé, ce qui améliore la précision et le style pour ce cas d'usage.Voir la définition complète → et toutes les sources de retrieval interrogées par le modèle au moment de l'inférenceinférenceLe moment où un modèle d'IA entraîné se met au travail : il reçoit une donnée nouvelle et produit une réponse, une prédiction ou un contenu.Voir la définition complète →.
La pharma est exposée de façon inhabituelle pour trois raisons :
- Des données denses en brevets : la littérature en chimie et en biologiques est saturée de propriété intellectuelle. Contrairement, disons, à des transcriptions de service client, les articles scientifiques *sont* couramment l'actif protégé (revendications, séquences, formulations).
- Mélange de données publiques et privées : les modèles entraînés sur des abstracts PubMed scrapés, des serveurs de preprints (bioRxiv, medRxiv) et des bases de brevets (comme la base de texte intégral des brevets publics de l'USPTO) mélangent contenus sous licence ouverte, fair-use et restreints, sans séparation nette.
- Des délais de commercialisation longs : un écart de gouvernance découvert en Phase 1 coûte quelques centaines de milliers de dollars à corriger. Le même écart découvert en Phase 3 ou après le lancement coûte des centaines de millions, et peut déclencher une action en contrefaçon de brevet sous des cadres comme le Hatch-Waxman Act américain ou, en Europe, un contentieux unifié devant la Juridiction unifiée du brevet.
Trois modes de défaillance concrets
1. Contrefaçon par l'output. Un modèle génératif entraîné sur des textes de brevets (y compris des brevets expirés ou de concurrents) peut régénérer des structures brevetées ou des formulations de revendications quasi mot pour mot. Ce n'est pas hypothétique : on a montré que les grands modèles de langage reproduisent des textes d'entraînement mémorisés avec les bons prompts, un phénomène que les chercheurs appellent « training data extraction ».
2. Fuite de confidentialité. Un chercheur colle une structure de composé interne non publiée dans un outil de chat IA public pour « avoir un deuxième avis » sur une voie de synthèse. Si cet outil conserve les inputs pour un entraînement ultérieur (beaucoup d'outils grand public le font, sauf mention contraire dans les conditions entreprise), l'entreprise vient peut-être d'offrir un secret d'affaires à un tiers. Cela suffit à annuler le statut de secret d'affaires, puisque le droit américain en la matière (le Defend Trade Secrets Act) exige des « mesures raisonnables » pour préserver la confidentialité du secret.
3. Cécité sur la provenance vis-à-vis des régulateurs. Sous l'EU AI Act (entré en vigueur en 2024, obligations échelonnées jusqu'en 2026-2027), les fournisseurs de systèmes d'IA à haut risque doivent documenter les sources et la qualité des données d'entraînement. Une entreprise pharmaceutique qui utilise un outil d'IA à une fin réglementée (par exemple la conception d'essais ou la détection de signaux de pharmacovigilance) et qui ne peut pas démontrer la provenance des données s'expose à une non-conformité, indépendamment de toute question de PI.
Pourquoi la revue juridique seule ne détecte pas cela
La revue juridique intervient au stade de l'*output* : cette molécule ou cette revendication précise contrefait-elle ? C'est nécessaire mais trop tardif. Quand le juridique voit le composé, l'équipe R&D a déjà investi du temps, des ressources de laboratoire et éventuellement déposé des déclarations d'invention internes.
La gouvernance doit se situer *en amont*, au moment où le modèle ou le jeu de données est sélectionné, avant qu'une seule requête ne soit lancée pour un programme réel. Cela implique :
- Une due diligence fournisseur sur les sources de données d'entraînement avant de prendre une licence sur un outil d'IA en chimie ou en biologie.
- Des garanties contractuelles des fournisseurs d'IA sur l'indemnisation PI et le sourcing des données.
- Une politique interne sur les données que les collaborateurs peuvent saisir dans des outils d'IA tiers.
Un contrôle de lineage simple, exécuté avant le déploiement, ressemble en pratique à ceci :
Dataset lineage checklist (run before any model touch molecule design):
1. Source list: which corpora trained/fine-tuned this model?
(e.g., PubChem, ChEMBL, scraped patents, proprietary internal data)
2. License terms: is each source open, fair-use, or restricted?
3. Patent overlap flag: does any source include active, unexpired patents
from competitors? Cross-check against USPTO/EPO databases.
4. Output monitoring: does vendor log/retain prompts and outputs?
Where, and for how long?
5. Contractual indemnity: does vendor contract cover IP infringement
arising from model output?Ce n'est pas un audit ponctuel. Les fournisseurs actualisent les données d'entraînement à chaque nouvelle version de modèle, donc les contrôles de lineage doivent être répétés à chaque mise à jour majeure du modèle, et pas seulement lors de l'achat initial.
Le contexte réglementaire qu'il faut nommer
- EU AI Act : classe de nombreux usages d'IA en R&D pharmaceutique et en pharmacovigilance comme « à haut risque », exigeant une documentation technique incluant les mesures de gouvernance des données (l'article 10 couvre les exigences relatives aux données et à leur gouvernance). Les obligations complètes pour le haut risque s'échelonnent jusqu'en 2026-2027.
- FDA : a publié un projet de guidance (2025) sur l'usage de l'IA dans le développement de médicaments et de produits biologiques, mettant l'accent sur une « credibility assessment » des modèles d'IA fondée sur le risque, ce qui suppose implicitement de savoir quelles données ont entraîné le modèle.
- EMA (Agence européenne des médicaments) : a publié un reflection paper sur l'IA dans le cycle de vie du médicament, désignant la provenance des données et la transparence comme critères d'évaluation centraux.
Aucun de ces régimes ne vous fournit une checklist de conformité spécifique à la contamination PI. Ils convergent vers une attente commune : vous devez pouvoir expliquer quelles données ont alimenté un modèle qui intervient dans une décision réglementée. Si vous ne pouvez pas répondre à cette question, vous ne pouvez pas non plus répondre à la question PI.
Pour une introduction au fonctionnement technique des attaques de « training data extraction », voici une explication solide et accessible aux non-spécialistes : la présentation de Google DeepMind sur la mémorisation dans les modèles de langage (cherchez sur leur blog les synthèses de recherche sur la mémorisation).
🎬 [VIDEO: "How AI Models Memorize Training Data" - youtube.com/results?search_query=ai+model+memorization+training+data+extraction - une explication technique mais accessible des raisons pour lesquelles les modèles génératifs reproduisent parfois du contenu d'entraînement mot pour mot, directement liée au risque de fuite de PI]
Vérification des acquis
1. Dans le scénario biotech, pourquoi le scaffold contrefaisant un brevet n'a-t-il été détecté qu'au moment où le juridique a fait une recherche manuelle ?
2. Pourquoi le risque de data lineage est-il présenté comme une défaillance de gouvernance plutôt que comme un accident juridique ?
3. Pourquoi le coût de la découverte d'un écart de gouvernance sur le data lineage augmente-t-il aussi fortement à des stades tardifs comme la Phase 3 par rapport à la Phase 1 ?
4. Sélectionnez TOUTES les réponses correctes sur les raisons pour lesquelles la pharma est exposée de façon inhabituelle aux risques de data lineage.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les réponses correctes sur ce que couvre le « data lineage » pour un modèle d'IA utilisé en drug discovery.
Sélectionnez toutes les réponses correctes.
Construire le garde-fou, pas seulement l'audit
La solution n'est pas « interdire l'IA générative en discovery ». C'est traiter le data lineage comme un contrôle de gouvernance permanent, porté conjointement par l'IT, le juridique et la direction R&D, et non greffé après coup sur un modèle déjà en service.
Garde-fousGarde-fousRègles et contrôles qui maintiennent un système d'IA dans des limites sûres, légales et conformes à la marque, en bloquant les sorties et actions hors cadre.Voir la définition complète → pratiques que les équipes de gouvernance pharma les plus avancées adoptent en 2026 :
- Accès aux outils par paliers : les outils de chat IA grand public sont bloqués ou placés en sandbox pour tout input contenant des données de composés non publiées, des séquences ou des résultats d'essais. Les outils en version entreprise avec clauses contractuelles de non-rétention sont le seul canal approuvé pour les inputs sensibles.
- Model cards à usage interne : chaque outil d'IA utilisé en R&D reçoit une « model card » interne, un résumé d'une page des sources de données d'entraînement, des limites connues et de la date de la dernière revue de lineage. Cela reflète les attentes de transparence que les régulateurs exigent de plus en plus à l'externe.
- Screening de brevets avec human-in-the-loop : toute structure générée par IA destinée à une nomination de lead déclenche automatiquement une recherche de liberté d'exploitation avant, et non après, l'engagement de ressources.
- Déclencheurs d'escalade : si un fournisseur ne peut pas révéler la composition de ses données d'entraînement (beaucoup s'y refusent, invoquant leurs propres secrets d'affaires), cela constitue en soi un signal de risque nécessitant une validation au niveau exécutif, pas une acceptation silencieuse.
L'ironie est symétrique : les fournisseurs d'IA protègent souvent leurs propres données d'entraînement comme un secret d'affaires, alors que leurs clients pharma ont besoin de transparence sur ces mêmes données pour protéger leur propre PI. Ce sont les contrats, et non la technologie, qui règlent généralement la question, via des droits d'audit, des clauses d'indemnisation et des garanties de sourcing des données négociées avant le déploiement.
Points clés
- Le data lineage, savoir exactement ce qui a entraîné un modèle d'IA, est un contrôle de gouvernance, pas une considération juridique de dernière minute. Quand le juridique examine un output, le coût d'une défaillance de lineage est souvent déjà irrécupérable.
- La littérature pharma, dense en PI (brevets, séquences, revendications), rend le secteur structurellement plus exposé aux risques de contrefaçon par l'output et de mémorisation que la plupart des autres secteurs utilisant l'IA générative.
- Une fuite de confidentialité via des outils d'IA grand public peut à elle seule détruire la protection du secret d'affaires, indépendamment de toute question de brevet.
- Les régulateurs (EU AI Act, FDA, EMA) exigent de plus en plus une gouvernance des données documentée pour les usages d'IA à haut risque, ce qui fait de la documentation de lineage un outil de conformité et de protection de la PI à la fois.
- Le garde-fou qui fonctionne est en amont : due diligence fournisseur, accès aux outils par paliers, model cards et contrôles obligatoires de liberté d'exploitation avant l'engagement de ressources, pas seulement une revue juridique en bout de chaîne.