+150 XP

Confidentialité et données sensibles : ce qu'il ne faut pas coller

Début 2023, des ingénieurs de Samsung ont collé du code source interne dans ChatGPT pour aider à le déboguer. En quelques semaines, l'entreprise a découvert trois fuites distinctes de données confidentielles, dont du code propriétaire et des comptes rendus de réunion. La réponse de Samsung a été brutale : interdiction de ChatGPT dans toute l'entreprise. La leçon ne leur a coûté aucune amende, mais elle leur a coûté le contrôle de leurs propres secrets.

C'est là le problème de fond des outils d'IA. Ils sont si simples et si utiles qu'on oublie qu'on envoie des informations sur l'ordinateur de quelqu'un d'autre.

Pourquoi coller donne un sentiment de sécurité (à tort)

Quand vous tapez dans ChatGPT, Claude ou Gemini, vos mots partent vers des serveurs détenus par OpenAI, Anthropic ou Google. La fenêtre de chat donne une impression d'intimité, comme une appli de notes. Ce n'en est pas une.

Selon vos réglages et votre formule, ce que vous collez peut être :

  • Stocké sur les serveurs du fournisseur.
  • Relu par des humains pour contrôler la qualité ou la sécurité.
  • Utilisé pour l'entraînement, c'est-à-dire que votre texte contribue à former les futures versions du modèle.

« Utilisé pour l'entraînement » est le point qui fait peur. En théorie, des fragments de texte sensible pourraient influencer ce que le modèle dira à quelqu'un d'autre plus tard. Le risque le plus important et le plus réaliste est plus simple : vos données confidentielles vivent désormais sur un serveur hors du contrôle de votre entreprise, et vous ne pouvez pas les récupérer.

La règle unique : l'enverriez-vous par email à un inconnu ?

Voici une règle que vous pouvez réellement retenir.

Avant de coller, demandez-vous : est-ce que j'enverrais ça par email à un prestataire croisé au hasard ?

Si la réponse est non, ne le collez pas sans le protéger au préalable.

À quoi ressemble le « ne jamais coller » en pratique

Voici les catégories qui mettent les gens en difficulté :

  • Données personnelles des clients : noms, emails, numéros de téléphone, adresses, numéros de compte.
  • Dossiers médicaux, financiers ou juridiques : tout ce qui relève de lois sur la vie privée comme le RGPD ou HIPAA.
  • Secrets et identifiants : mots de passe, clés d'API, jetons d'accès.
  • Code propriétaire ou plans d'affaires : le scénario Samsung.
  • Tout ce qui est sous NDA : contrats, détails de produits non lancés, données financières internes.

Un exemple concret. Ne collez pas ceci :

« Résume ce ticket de support : la cliente Jane Doe, jane.doe@gmail.com, carte se terminant par 4412, se plaint que... »

Collez plutôt ceci :

« Résume ce ticket de support : la cliente [NOM], [EMAIL], carte se terminant par [MASQUÉ], se plaint que... »

L'IA fait toujours le travail. Les parties sensibles ne quittent jamais vos murs.

Grand public vs entreprise : ce n'est pas la même chose

C'est le point que la plupart des gens comprennent mal. La version gratuite et la version entreprise du même outil traitent vos données très différemment.

Formules grand public (gratuites et payantes personnelles)

Sur les paliers gratuits et la plupart des abonnements personnels, les fournisseurs utilisent souvent les conversations pour améliorer leurs modèles, avec des réglages que vous devez trouver et basculer vous-même.

En 2026 :

  • ChatGPT Free et Plus : l'entraînement est activé par défaut. Vous pouvez le désactiver dans *Réglages → Contrôles des données → « Améliorer le modèle pour tout le monde »*. Le désactiver limite aussi l'historique des conversations.
  • Claude Free, Pro et Max : depuis le changement de politique d'Anthropic fin 2025, les conversations et les sessions de code servent à l'entraînement par défaut, sauf opt-out. Les nouveaux utilisateurs choisissent à l'inscription ; les utilisateurs existants ont été invités à trancher. Si vous autorisez l'entraînement, vos données peuvent être conservées jusqu'à cinq ans. Vérifiez *Réglages → Confidentialité* et confirmez le réglage plutôt que de supposer.
  • Gemini (compte Google personnel) : l'activité peut être enregistrée et relue. Gérez cela sur *myactivity.google.com*, rubrique Activité dans les applis Gemini.

À retenir : sur les formules grand public, c'est à vous de vérifier les interrupteurs, et les valeurs par défaut changent avec le temps. Claude en est un bon exemple : il est passé d'un réglage par défaut plus protecteur à l'entraînement activé par défaut en moins d'un an.

Formules entreprise et business

C'est là que se trouve la vraie sécurité. Les paliers business (ChatGPT Enterprise et Team, Claude for Work/Enterprise, Gemini pour Google Workspace) promettent en général :

  • Aucun entraînement sur vos données par défaut.
  • L'isolation des données, de sorte que vos saisies restent cantonnées à votre organisation.
  • Un contrat signé qui garantit juridiquement ces engagements.

C'est pourquoi la bonne réponse d'une entreprise au problème Samsung n'est généralement pas « interdire l'IA ». C'est « donner aux gens un outil entreprise approuvé pour qu'ils arrêtent d'utiliser des comptes personnels en cachette ». Une interdiction pousse simplement les salariés à coller des secrets de l'entreprise dans ChatGPT sur leur téléphone, là où vous n'avez aucune visibilité.

Vérifiez toujours les détails dans les conditions en vigueur de votre fournisseur. Un bon point de départ : **la page confidentialité entreprise d'OpenAI**, qui détaille leurs engagements business.

🎬 [VIDEO: "Is ChatGPT Safe? Privacy and Data Risks Explained" - youtube.com - une explication claire de la façon dont les données de chat IA sont stockées, de ce qui sert à l'entraînement et de la manière de modifier vos réglages]

Des habitudes pratiques pour rester en sécurité

Pas besoin d'être technique pour travailler en sécurité. Il faut quelques habitudes.

1. Masquez avant de coller

Remplacez les vraies valeurs par des placeholders. L'IA n'a pas besoin du vrai nom pour rédiger une réponse polie.

2. Utilisez l'outil entreprise approuvé par votre société

Si vous avez ChatGPT Enterprise ou Gemini dans Workspace, utilisez-le plutôt que votre login personnel. L'écart de protection des données est énorme.

3. Désactivez l'entraînement sur les comptes personnels

Deux minutes dans les réglages. Faites-le une fois pour chaque outil d'IA que vous utilisez, et revérifiez après les mises à jour majeures de politique, car les valeurs par défaut bougent (Claude est passé à l'entraînement activé par défaut en 2025).

4. Anonymisez automatiquement pour les traitements en masse

Si vous traitez de nombreux enregistrements, ne masquez pas à la main. Un court script peut retirer les identifiants évidents avant que quoi que ce soit n'atteigne l'IA. Voici un exemple Python simple qui supprime les emails et les numéros de téléphone d'un texte :

python
import re

def redact(text):
    # Remplace les adresses email
    text = re.sub(r'\b[\w.-]+@[\w.-]+\.\w+\b', '[EMAIL]', text)
    # Remplace les numéros de téléphone (motif simple au format US)
    text = re.sub(r'\b\d{3}[-.]?\d{3}[-.]?\d{4}\b', '[PHONE]', text)
    return text

ticket = "Contact Jane at jane.doe@gmail.com or 555-123-4567 about the refund."
print(redact(ticket))
# Output: Contact Jane at [EMAIL] or [PHONE] about the refund.

Vous lancez ceci d'abord, puis vous envoyez le texte nettoyé à l'IA. Le modèle obtient assez de contexte pour aider, et les données personnelles ne quittent jamais votre machine.

Vérification des acquis

1. D'après la leçon, quel est le risque le plus réaliste quand on colle des données confidentielles dans un outil d'IA ?

2. Quel est l'intérêt pratique de la règle « est-ce que j'enverrais ça par email à un prestataire croisé au hasard ? » ?

3. Dans l'exemple de masquage, pourquoi coller la version avec « [NOM] », « [EMAIL] » et « [MASQUÉ] » est-elle l'approche recommandée ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les catégories que la leçon liste comme éléments à « ne jamais coller » sans les protéger au préalable.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUT ce qui, selon la leçon, peut arriver au texte que vous collez dans un outil d'IA en fonction de vos réglages et de votre formule.

Sélectionnez toutes les réponses correctes.

Malentendus fréquents

« Supprimer la conversation supprime les données »

Pas forcément. Supprimer une conversation de votre écran ne garantit pas qu'elle est effacée des sauvegardes, ni qu'elle n'a pas servi à l'entraînement avant votre suppression. Certains fournisseurs conservent aussi les données pendant des années quand l'entraînement est activé. Considérez que tout ce que vous avez collé est déjà parti.

« Ce n'est rien, je pose juste une question »

Le risque est dans ce que vous collez, pas dans ce que vous demandez. « Comment je corrige ça ? » est inoffensif. Les 200 lignes de code interne en dessous, c'est la fuite.

« Notre formule entreprise permet tout »

Les outils entreprise protègent les données du fournisseur, pas de vos propres mauvaises habitudes. Si vous collez le salaire d'un collègue dans un espace d'équipe partagé, le problème de confidentialité devient interne. Le besoin de savoir reste de rigueur.

« Les données anonymisées sont toujours sûres »

Attention. Il arrive que la combinaison de champs « anonymes » réidentifie quelqu'un. Un ticket masqué qui dit encore « le seul ingénieur gaucher du bureau de Tokyo » n'est pas anonyme. Retirez le contexte, pas seulement les noms.

Un arbre de décision rapide

Quand vous êtes sur le point de coller quelque chose de sensible, passez par là :

  1. Est-ce confidentiel ou personnel ? Si non, collez.
  2. Si oui, ai-je un outil entreprise approuvé ? Utilisez-le.
  3. Pas d'outil entreprise ? Masquez les parties sensibles, puis utilisez l'outil grand public avec l'entraînement désactivé.
  4. Impossible de masquer utilement ? Ne collez pas. Faites cette partie à la main.

Ce cheminement aurait sauvé Samsung. Les ingénieurs avaient un besoin réel (déboguer du code) et se sont tournés vers un outil réel (ChatGPT). Ce qui manquait, c'était l'étape 2 : un canal approuvé et sûr pour exactement cette tâche.

Pourquoi cela compte au-delà des amendes

Les erreurs de confidentialité se manifestent rarement par un procès spectaculaire. Elles se manifestent par :

  • Un concurrent qui découvre votre roadmap.
  • Un client qui perd confiance parce que ses données ont fuité.
  • Un régulateur qui demande pourquoi des données personnelles ont quitté le pays.

La bonne nouvelle : éviter tout cela relève surtout de quelques petites habitudes, répétées. Vous n'avez pas à renoncer à l'IA pour rester en sécurité. Il faut juste être délibéré sur ce qui franchit la frontière vers les serveurs de quelqu'un d'autre.

Points clés

  • Utilisez le test de l'email : si vous ne l'enverriez pas à un inconnu, ne le collez pas dans un outil d'IA sans le protéger d'abord.
  • Ne collez jamais de données clients, d'identifiants, de dossiers médicaux ou financiers, de code propriétaire ou de contenu sous NDA dans un compte d'IA grand public.
  • Connaissez votre formule : les paliers grand public s'entraînent souvent sur vos données par défaut (ChatGPT et, depuis fin 2025, Claude), donc vérifiez les réglages vous-même ; les paliers entreprise, en général, ne s'entraînent pas par défaut.
  • Revérifiez les valeurs par défaut : elles changent. Claude est passé de l'opt-in à l'entraînement activé par défaut en un an.
  • Masquez, n'évitez pas : remplacez noms, emails et numéros réels par des placeholders, à la main ou avec un court script, et l'IA fait toujours le travail.
  • Le remède aux fuites est l'accès, pas l'interdiction : un outil entreprise approuvé empêche les gens d'utiliser discrètement des comptes personnels où vous n'avez aucun contrôle.

À faire, tiré de cette leçon

Ces actions sont compilées dans le plan d'action du rôle.

  • Anonymisez les données sensibles avec des placeholders quand aucun outil enterprise n'existe
Voir le plan d'action complet →

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.