+65 XP

L'expérimentation à grande échelle : A/B testing, causalité et plateformes

L'expérimentation, c'est la méthode scientifique appliquée au business. C'est le seul moyen fiable d'établir la causalité, de savoir non pas que deux choses sont corrélées, mais que l'une cause l'autre.

Les organisations qui mènent des expériences rigoureuses prennent de meilleures décisions et capitalisent leurs apprentissages dans la durée. Celles qui n'expérimentent pas décident à l'intuition, à la corrélation et à l'espoir.

Pourquoi la causalité compte

En 2011, Ron Johnson, CEO de JCPenney, a supprimé les prix promotionnels, convaincu (par intuition et par quelques corrélations dans les données) que les clients préféraient des prix bas permanents « fair and square ». Le chiffre d'affaires s'est effondré de 25 % en un an. L'entreprise ne s'en est jamais remise.

Les données étaient disponibles. L'échec portait sur l'inférence causale : il a confondu le comportement des clients sous régime de prix promotionnels avec leur préférence. Si JCPenney avait mené une expérience contrôlée (tester les « prix bas permanents » dans 100 magasins, maintenir les prix promotionnels dans 100 magasins comparables), le résultat aurait été clair avant un déploiement national.

C'est le coût d'une expérimentation qu'on saute.

A/B Testing Best Practices

Watch on YouTube

Vérification des acquis

1. Pourquoi l'expérimentation est-elle considérée comme le seul moyen fiable d'établir la causalité plutôt qu'une simple corrélation ?

2. L'exemple JCPenney illustre avant tout quel échec conceptuel ?

3. Pourquoi la leçon insiste-t-elle sur la définition d'une hypothèse avant de regarder les résultats ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les pratiques essentielles à un design expérimental solide selon la leçon.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les affirmations qui décrivent correctement le multiple comparison problem et la façon de le traiter.

Sélectionnez toutes les réponses correctes.

Les fondamentaux du design expérimental

L'hypothèse d'abord : définissez ce que vous testez et ce que vous attendez avant de regarder les résultats. « Nous pensons que remplacer le CTA « Sign Up » par « Start Free Trial » augmentera la conversion de 15 % chez les nouveaux visiteurs. » Une hypothèse force la clarté sur le mécanisme, pas seulement sur le résultat.

Randomisation : les groupes test et contrôle doivent être assignés aléatoirement. L'auto-sélection (laisser les utilisateurs choisir l'expérience qu'ils voient) invalide l'expérience, les groupes seront systématiquement différents.

Puissance statistique : avant de lancer l'expérience, calculez la taille d'échantillon minimale nécessaire pour détecter l'effet qui vous intéresse. Tester sur 100 utilisateurs pour détecter 1 % d'amélioration de conversion est statistiquement impossible, vous n'aurez jamais assez de puissance pour être confiant.

Multiple comparison problem : lancez 20 tests, et l'un d'eux apparaîtra statistiquement significatif par hasard. Utilisez la correction de Bonferroni ou un contrôle du FDR (False Discovery Rate) quand vous lancez de nombreux tests simultanés.

Seuils de décision : décidez avant l'expérience quel niveau de confiance statistique (typiquement 95 %) et quelle significativité pratique (effet minimal détectable) sont requis avant de déployer. Ne les changez pas après avoir vu les résultats, c'est du p-hacking.

La plateforme d'expérimentation

Mener quelques A/B tests à la main, ça va. Passer à des centaines d'expériences simultanées demande une plateforme :

Feature flagging : infrastructure pour montrer des expériences différentes à des utilisateurs différents sans déploiement de code. Outils : LaunchDarkly, Unleash (open-source), Split.

Logging d'assignation : tracer quelle expérience chaque utilisateur a vue, avec horodatage. Indispensable pour l'analyse.

Pipeline d'analyse statistique : calcul automatisé des p-values, intervalles de confiance et tailles d'effet. Réduit l'erreur humaine dans l'analyse.

Workflow de décision : processus structuré pour revoir les résultats et trancher ship / don't-ship.

Airbnb, Netflix et Uber ont construit des plateformes d'expérimentation internes avant que ce soit une catégorie de produit. Aujourd'hui, la plupart des organisations achètent plutôt qu'elles ne construisent : des options commerciales comme Optimizely, VWO, Statsig et Eppo rendent l'expérimentation accessible sans ressources d'ingénierie plateforme. Quelques projets open-source existent (GrowthBook est activement maintenu), tandis que des initiatives plus anciennes comme Wasabi d'Intuit ont été abandonnées et ne devraient pas servir pour de nouveaux travaux.

Multi-armed bandit : au-delà de l'A/B testing

Les A/B tests classiques ont une durée fixe. Pendant le test, vous envoyez du trafic vers une variante potentiellement inférieure, ce qui constitue le coût de l'expérience.

Les algorithmes multi-armed bandit répondent à ce problème : ils ajustent en continu l'allocation du trafic pour envoyer davantage de trafic vers la variante la plus performante, tout en continuant d'explorer les alternatives. À mesure que les preuves s'accumulent, la variante gagnante reçoit progressivement plus de trafic.

Cas d'usage : recommandation de contenu, optimisation de créations publicitaires, expériences de pricing. Peu adapté à : les expériences où la cohérence de l'expérience utilisateur compte (basculer entre variantes en cours de session est déroutant).

À retenir

  • L'expérimentation est la façon d'établir la causalité au lieu de deviner à partir d'une corrélation. JCPenney a perdu 25 % de son chiffre d'affaires en agissant sur une corrélation jamais testée.
  • Concevez avant de lancer : hypothèse, randomisation, taille d'échantillon et seuils de décision fixés à l'avance. Changer les seuils après avoir vu les résultats, c'est du p-hacking.
  • Surveillez le multiple comparison problem : lancez assez de tests et quelque chose paraîtra significatif par pur hasard. Corrigez (Bonferroni, FDR).
  • Dépasser une poignée de tests exige une plateforme pour les feature flags, le logging d'assignation et l'analyse. Achetez-la (Optimizely, VWO, Statsig, Eppo, ou GrowthBook en open-source) plutôt que de la construire, sauf raison sérieuse.
  • Les multi-armed bandits réduisent le coût de l'expérimentation en déplaçant le trafic vers les gagnants, mais ils nuisent quand la cohérence de session compte.

Questions du quiz

  1. Pourquoi la randomisation est-elle essentielle dans un A/B test ?

A) Elle accélère l'exécution du test

B) Elle garantit que les groupes test et contrôle sont similaires, éliminant les biais de sélection qui invalideraient les résultats

C) Elle réduit le coût du test

D) Elle augmente automatiquement la taille de l'échantillon

Réponse: B

  1. Qu'est-ce que le "multiple comparison problem" dans l'expérimentation ?

A) Difficulté à comparer deux produits différents

B) Le fait que lancer 20 tests simultanément garantit statistiquement qu'environ 1 apparaîtra comme significatif par hasard, nécessitant une correction statistique

C) Problème technique lié à plusieurs bases de données

D) Impossibilité de tester plus de 2 variantes à la fois

Réponse: B

  1. Quelle est la principale différence entre un A/B test classique et un algorithme multi-armed bandit ?

A) Le bandit multi-bras est plus précis statistiquement

B) Le bandit multi-bras ajuste continuellement la répartition du trafic vers la meilleure variante pendant le test, réduisant le coût de l'expérimentation

C) Le A/B test classique est automatiquement plus rapide

D) Le bandit multi-bras nécessite plus de données

Réponse: B

À faire, tiré de cette leçon

Ces actions sont compilées dans le plan d'action du rôle.

  • Mettre en place une plateforme d'expérimentation avec randomisation et correction pour comparaisons multiples
Voir le plan d'action complet →