L'expérimentation à grande échelle : A/B testing, causalité et plateformes
L'expérimentation, c'est la méthode scientifique appliquée au business. C'est le seul moyen fiable d'établir la causalité, de savoir non pas que deux choses sont corrélées, mais que l'une cause l'autre.
Les organisations qui mènent des expériences rigoureuses prennent de meilleures décisions et capitalisent leurs apprentissages dans la durée. Celles qui n'expérimentent pas décident à l'intuition, à la corrélation et à l'espoir.
Pourquoi la causalité compte
En 2011, Ron Johnson, CEO de JCPenney, a supprimé les prix promotionnels, convaincu (par intuition et par quelques corrélations dans les données) que les clients préféraient des prix bas permanents « fair and square ». Le chiffre d'affaires s'est effondré de 25 % en un an. L'entreprise ne s'en est jamais remise.
Les données étaient disponibles. L'échec portait sur l'inférenceinférenceLe moment où un modèle d'IA entraîné se met au travail : il reçoit une donnée nouvelle et produit une réponse, une prédiction ou un contenu.Voir la définition complète → causale : il a confondu le comportement des clients sous régime de prix promotionnels avec leur préférence. Si JCPenney avait mené une expérience contrôlée (tester les « prix bas permanents » dans 100 magasins, maintenir les prix promotionnels dans 100 magasins comparables), le résultat aurait été clair avant un déploiement national.
C'est le coût d'une expérimentation qu'on saute.
A/B Testing Best Practices
Vérification des acquis
1. Pourquoi l'expérimentation est-elle considérée comme le seul moyen fiable d'établir la causalité plutôt qu'une simple corrélation ?
2. L'exemple JCPenney illustre avant tout quel échec conceptuel ?
3. Pourquoi la leçon insiste-t-elle sur la définition d'une hypothèse avant de regarder les résultats ?
4. Sélectionnez TOUTES les pratiques essentielles à un design expérimental solide selon la leçon.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les affirmations qui décrivent correctement le multiple comparison problem et la façon de le traiter.
Sélectionnez toutes les réponses correctes.
Les fondamentaux du design expérimental
L'hypothèse d'abord : définissez ce que vous testez et ce que vous attendez avant de regarder les résultats. « Nous pensons que remplacer le CTACTAUn bouton, un lien ou un message qui incite l'utilisateur à effectuer une action précise : s'inscrire, acheter, télécharger ou en savoir plus.Voir la définition complète → « Sign Up » par « Start Free Trial » augmentera la conversion de 15 % chez les nouveaux visiteurs. » Une hypothèse force la clarté sur le mécanisme, pas seulement sur le résultat.
Randomisation : les groupes test et contrôle doivent être assignés aléatoirement. L'auto-sélection (laisser les utilisateurs choisir l'expérience qu'ils voient) invalide l'expérience, les groupes seront systématiquement différents.
Puissance statistique : avant de lancer l'expérience, calculez la taille d'échantillon minimale nécessaire pour détecter l'effet qui vous intéresse. Tester sur 100 utilisateurs pour détecter 1 % d'amélioration de conversion est statistiquement impossible, vous n'aurez jamais assez de puissance pour être confiant.
Multiple comparison problem : lancez 20 tests, et l'un d'eux apparaîtra statistiquement significatif par hasard. Utilisez la correction de Bonferroni ou un contrôle du FDR (False Discovery Rate) quand vous lancez de nombreux tests simultanés.
Seuils de décision : décidez avant l'expérience quel niveau de confiance statistique (typiquement 95 %) et quelle significativité pratique (effet minimal détectable) sont requis avant de déployer. Ne les changez pas après avoir vu les résultats, c'est du p-hacking.
La plateforme d'expérimentation
Mener quelques A/B tests à la main, ça va. Passer à des centaines d'expériences simultanées demande une plateforme :
Feature flagging : infrastructure pour montrer des expériences différentes à des utilisateurs différents sans déploiement de code. Outils : LaunchDarkly, Unleash (open-source), Split.
Logging d'assignation : tracer quelle expérience chaque utilisateur a vue, avec horodatage. Indispensable pour l'analyse.
PipelinePipelineL'ensemble des opportunités commerciales actives réparties selon les étapes du processus de vente, avec leur valeur potentielle cumulée et leur probabilité de conclusion.Voir la définition complète → d'analyse statistique : calcul automatisé des p-values, intervalles de confiance et tailles d'effet. Réduit l'erreur humaine dans l'analyse.
Workflow de décision : processus structuré pour revoir les résultats et trancher ship / don't-ship.
Airbnb, Netflix et Uber ont construit des plateformes d'expérimentation internes avant que ce soit une catégorie de produit. Aujourd'hui, la plupart des organisations achètent plutôt qu'elles ne construisent : des options commerciales comme Optimizely, VWO, Statsig et Eppo rendent l'expérimentation accessible sans ressources d'ingénierie plateforme. Quelques projets open-source existent (GrowthBook est activement maintenu), tandis que des initiatives plus anciennes comme Wasabi d'Intuit ont été abandonnées et ne devraient pas servir pour de nouveaux travaux.
Multi-armed bandit : au-delà de l'A/B testingA/B testingL'A/B testing est une expérimentation contrôlée qui compare deux versions d'un même élément (A et B) en répartissant le trafic de façon aléatoire, pour savoir laquelle performe le mieux sur une métrique choisie.Voir la définition complète →
Les A/B tests classiques ont une durée fixe. Pendant le test, vous envoyez du trafic vers une variante potentiellement inférieure, ce qui constitue le coût de l'expérience.
Les algorithmes multi-armed bandit répondent à ce problème : ils ajustent en continu l'allocation du trafic pour envoyer davantage de trafic vers la variante la plus performante, tout en continuant d'explorer les alternatives. À mesure que les preuves s'accumulent, la variante gagnante reçoit progressivement plus de trafic.
Cas d'usage : recommandation de contenu, optimisation de crcrLe pourcentage de visiteurs ou de prospects qui réalisent une action attendue (achat, inscription, formulaire de contact), calculé en divisant les conversions par le nombre total d'opportunités.Voir la définition complète →éations publicitaires, expériences de pricing. Peu adapté à : les expériences où la cohérence de l'expérience utilisateur compte (basculer entre variantes en cours de session est déroutant).
À retenir
- L'expérimentation est la façon d'établir la causalité au lieu de deviner à partir d'une corrélation. JCPenney a perdu 25 % de son chiffre d'affaires en agissant sur une corrélation jamais testée.
- Concevez avant de lancer : hypothèse, randomisation, taille d'échantillon et seuils de décision fixés à l'avance. Changer les seuils après avoir vu les résultats, c'est du p-hacking.
- Surveillez le multiple comparison problem : lancez assez de tests et quelque chose paraîtra significatif par pur hasard. Corrigez (Bonferroni, FDR).
- Dépasser une poignée de tests exige une plateforme pour les feature flags, le logging d'assignation et l'analyse. Achetez-la (Optimizely, VWO, Statsig, Eppo, ou GrowthBook en open-source) plutôt que de la construire, sauf raison sérieuse.
- Les multi-armed bandits réduisent le coût de l'expérimentation en déplaçant le trafic vers les gagnants, mais ils nuisent quand la cohérence de session compte.
Questions du quiz
- Pourquoi la randomisation est-elle essentielle dans un A/B test ?
A) Elle accélère l'exécution du test
B) Elle garantit que les groupes test et contrôle sont similaires, éliminant les biais de sélection qui invalideraient les résultats
C) Elle réduit le coût du test
D) Elle augmente automatiquement la taille de l'échantillon
Réponse: B
- Qu'est-ce que le "multiple comparison problem" dans l'expérimentation ?
A) Difficulté à comparer deux produits différents
B) Le fait que lancer 20 tests simultanément garantit statistiquement qu'environ 1 apparaîtra comme significatif par hasard, nécessitant une correction statistique
C) Problème technique lié à plusieurs bases de données
D) Impossibilité de tester plus de 2 variantes à la fois
Réponse: B
- Quelle est la principale différence entre un A/B test classique et un algorithme multi-armed bandit ?
A) Le bandit multi-bras est plus précis statistiquement
B) Le bandit multi-bras ajuste continuellement la répartition du trafic vers la meilleure variante pendant le test, réduisant le coût de l'expérimentation
C) Le A/B test classique est automatiquement plus rapide
D) Le bandit multi-bras nécessite plus de données
Réponse: B
À faire, tiré de cette leçon
Ces actions sont compilées dans le plan d'action du rôle.
- Mettre en place une plateforme d'expérimentation avec randomisation et correction pour comparaisons multiples