+75 XP

A/B testing & statistiques : fondations et concepts clés

Coupez une mailing list en deux et envoyez aux deux moitiés un email identique. Les deux taux d'ouverture seront différents. Ils le sont toujours. Cet écart, c'est du bruit, et c'est la raison pour laquelle l'expérimentation a besoin d'un vocabulaire plutôt que d'un débat.

L'équipe d'expérimentation de Microsoft, qui mène des tests contrôlés sur Bing et Office depuis bien plus de dix ans, a rapporté que seul un tiers environ des idées qui arrivent en test améliorent la métrique qu'elles étaient censées améliorer. Certaines ne font rien. Certaines dégradent les choses. Prenez ce chiffre au sérieux et une conclusion inconfortable s'impose : si la plupart des idées échouent, alors la plupart des « victoires » célébrées sur des tests arrêtés trop tôt ou lancés sur un trafic trop faible sont du hasard avec une flèche verte à côté. Les mots de cette leçon (hypothèse, unité de randomisation, significativité, puissance, taille d'échantillon) existent pour distinguer les deux.

Ce qu'est réellement l'a/b testing

Un A/B test, aussi appelé split test ou online controlled experiment, répartit votre audience au hasard en deux groupes. Le groupe A voit la version actuelle (le contrôle). Le groupe B voit la version modifiée (la variante). Les deux tournent en même temps, sur le même mix de trafic, et vous comparez un résultat déclaré à l'avance.

C'est l'affectation aléatoire qui rend la comparaison légitime. Parce que la répartition est aléatoire, les groupes ne diffèrent que par le hasard et par le changement que vous avez introduit, donc un écart plus grand que le hasard peut être attribué à ce changement. Comparez cette semaine à la semaine dernière et vous obtenez un récit avant/après pollué par la météo, la paie, la promotion d'un concurrent et vos propres investissements média.

L'unité de randomisation, c'est ce que vous répartissez. Généralement le visiteur (un cookie ou un identifiant connecté), parfois la session, occasionnellement une ville ou un magasin. Répartissez par visiteur et quelqu'un qui revient quatre fois verra toujours la même version, ce qui est exactement ce que vous voulez quand le changement affecte la façon dont les gens jugent une marque. Répartissez par session et la même personne peut voir les deux versions, ce qui corrompt la comparaison et désoriente le client. L'unité doit aussi correspondre à la métrique : le revenu par visiteur exige une randomisation au niveau visiteur.

Quatre idées statistiques portent le reste.

L'hypothèse nulle est votre postulat de départ : il n'y a pas de différence entre contrôle et variante. Un test ne prouve jamais que la variante est meilleure. Il réunit assez de preuves pour rendre « pas de différence » invraisemblable.

La significativité statistique est l'endroit où vous placez la barre de l'invraisemblable. La convention est 95 %, et son sens est étroit : si l'hypothèse nulle était vraie, seuls 5 % des tests comme le vôtre montreraient une différence de cette ampleur.

La p-value est ce que vous comparez à cette barre. C'est la probabilité d'observer un résultat au moins aussi extrême s'il n'y avait vraiment aucune différence. En dessous de 0,05, le résultat est dit significatif. Ce n'est pas la probabilité que votre variante fonctionne, et c'est de cette confusion que naissent la plupart des mauvaises lectures.

La puissance est l'idée que les marketeurs sautent, et c'est pour cela que leurs résultats sont bruités. La puissance est la chance que votre test détecte un effet réel d'une taille donnée. 80 % est la cible habituelle. Un test à 30 % de puissance manquera la plupart des vraies améliorations, et les rares « victoires » qu'il rapporte reviennent gonflées ou dans le mauvais sens.

Sous-concepts clés que tout CMO doit maîtriser

Taille d'échantillon : le nombre le plus maltraité de l'expérimentation marketing. Ce n'est pas une durée que vous choisissez, c'est un résultat. Donnez à un calculateur (celui d'Evan Miller est gratuit sur evanmiller.org) votre taux de conversion de référence, l'effet que vous voulez détecter, votre niveau de significativité et votre puissance, et il vous renvoie le nombre de visiteurs nécessaires par variante. Si la réponse est 400 000 par côté et que vous en faites 20 000 par mois, vous avez appris quelque chose d'utile : ce test ne peut pas être mené ici, et vous devriez tester quelque chose dont l'effet attendu est plus grand.

Minimum detectable effect (MDE) : la plus petite amélioration sur laquelle vous agiriez. Détecter un passage de 3,2 % à 3,4 % exige un échantillon énorme. Décider que seuls les lifts relatifs de 10 % ou plus vous intéressent réduit fortement l'exigence. Fixez le MDE d'abord. Le choisir après avoir vu les données, c'est ainsi que les équipes se convainquent elles-mêmes d'un résultat.

Effets de nouveauté et de primauté : les utilisateurs réguliers réagissent à un changement parce qu'il est nouveau, pas parce qu'il est meilleur. Les premiers chiffres bougent, puis s'estompent. Séparez les résultats entre nouveaux visiteurs et visiteurs récurrents. Si le lift n'existe que chez les visiteurs récurrents en semaine un, vous mesurez de la surprise.

Segments : un changement peut gagner sur mobile et perdre sur desktop. Zalando, qui vend sur plus de 20 marchés européens, y fait face en permanence, puisqu'un changement de checkout peut se comporter différemment selon le pays, selon l'appareil et selon que le visiteur est arrivé pendant une période de soldes. Découpez vos résultats selon les deux ou trois segments qui comptent avant de déployer partout, mais traitez chaque découpe supplémentaire comme une comparaison de plus, pas comme une découverte de plus.

How Obama Raised $60 Million by Running a Simple Experiment

Watch on YouTube

Exemples d'entreprises réelles avec de vrais chiffres

Microsoft Bing, 2012. Un ingénieur a proposé un changement dans l'affichage des titres publicitaires. La proposition est restée dans le backlog pendant des mois parce que personne n'y croyait. Lors du test, le revenu par recherche a augmenté d'environ 12 % aux États-Unis, soit plus de 100 millions de dollars par an, et la première réaction de l'équipe a été de soupçonner un bug de tracking. Deux leçons : l'intuition ne sait pas classer les idées, et un résultat extrême mérite une vérification de l'instrumentation avant une célébration.

Netflix a publié des articles d'ingénierie sur le test d'artworks, montrant que l'image choisie pour représenter un titre change la fréquence à laquelle les membres le lancent. La même entreprise consacre aussi un travail sérieux aux statistiques derrière ces lectures, y compris des méthodes de tests séquentiels qui permettent de suivre les résultats en continu sans l'inflation de faux positifs que provoque le peeking désinvolte. C'est la marque d'un programme mature : la méthode reçoit autant d'attention que l'idée.

Zalando a construit sa propre plateforme d'expérimentation plutôt que d'en acheter une, et ses ingénieurs ont décrit publiquement la plomberie : affecter un visiteur à une variante de façon cohérente d'une visite à l'autre, et calculer les métriques sur la même unité que celle utilisée pour la répartition. Un travail sans gloire, et c'est ce qui empêche un distributeur de mode de lire un test de deux semaines chevauchant une période de soldes comme un effet permanent.

Vérification des acquis

1. Quel est l'objectif fondamental d'un A/B test en marketing ?

2. Dans un A/B test, que représente l'hypothèse nulle ?

3. Un marketeur fait tourner un test pendant trois jours, voit la variante gagner de 8 % et déclare la victoire. Pourquoi ce raisonnement est-il erroné ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les affirmations correctes sur la p-value et la significativité statistique.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUS les paramètres que vous fournissez habituellement à un calculateur de taille d'échantillon avant de lancer un A/B test.

Sélectionnez toutes les réponses correctes.

Actions pour le CMO

  • Exigez que chaque test arrive sous la forme d'une phrase écrite : parce que [preuve], nous attendons que [changement] fasse bouger [métrique principale] d'au moins [MDE], mesuré sur [unité de randomisation]. Une demande qui ne peut pas remplir ces crochets est une préférence, pas une hypothèse.
  • Pré-enregistrez les chiffres avant le lancement : taux de référence, MDE, niveau de significativité, puissance, taille d'échantillon par variante qui en résulte, date de fin, et exactement une métrique principale. Les métriques secondaires servent au diagnostic, jamais à déclarer le gagnant.
  • Demandez à votre outil ce qu'il calcule réellement. Google Optimize a fermé en septembre 2023, donc la plupart des équipes sont aujourd'hui sur Optimizely, VWO (deux éditeurs qui vendent des logiciels de testing, lisez leurs benchmarks en gardant cela en tête), les expérimentations GA4 ou quelque chose en interne. Vérifiez si le vôtre suppose une taille d'échantillon fixe ou s'il prend en charge l'analyse séquentielle, car cette seule réponse détermine si la consultation quotidienne est sans danger.
  • Convertissez votre MDE en argent avant de lancer quoi que ce soit. Un lift de 10 % sur une page vue par 300 personnes par mois ne vaut pas un sprint d'ingénierie.

Erreurs courantes qui tuent les résultats

Le peeking et l'arrêt prématuré. Consulter tous les jours et arrêter dès que le dashboard passe au vert n'accélère pas l'apprentissage, cela fabrique des faux positifs : les travaux de Ramesh Johari et de ses collègues à Stanford sur le suivi continu ont montré que le taux d'erreur réel monte largement au-dessus des 5 % nominaux quand les tests sont lus de façon répétée avec des maths à horizon fixe. Vous avez convenu d'une taille d'échantillon. Respectez-la, ou passez à une méthode conçue pour la lecture continue.

Tester plusieurs choses à la fois et appeler ça un A/B test. Changez le titre, l'image principale et le bouton ensemble et vous ne pouvez pas dire lequel a produit l'effet, ni si un gain a masqué une perte. Testez une variable, ou utilisez un design multivarié qui isole chaque contribution. Optimizely et VWO le permettent tous les deux. La même arithmétique s'applique aux métriques et aux segments : vérifiez 20 comparaisons à 95 % et environ une paraîtra significative par pur hasard.

Confondre significativité statistique et significativité business. Un lift de 0,3 % sur le taux de clic avec une p-value de 0,03 est réel et peut rester sans valeur si le déploiement coûte 50 000 $ de temps d'ingénierie. Traduisez chaque résultat en revenu ou en coût projeté avant la décision de déploiement.

À retenir

  • Un A/B test compare un contrôle et une variante sur du trafic affecté aléatoirement et simultané, jugé sur un seul résultat nommé à l'avance.
  • Choisissez l'unité de randomisation délibérément (généralement le visiteur) et alignez votre métrique dessus.
  • La significativité vous dit à quel point votre résultat serait surprenant s'il ne se passait rien ; la puissance vous dit si votre test pouvait ne serait-ce que trouver l'effet. Les tests sous-puissants sont la principale source de fausses victoires.
  • La taille d'échantillon et le MDE sont des paramètres que vous calculez avant le lancement, pas des durées que vous choisissez après.
  • Environ un tiers des idées testées chez Microsoft amélioraient leur métrique cible, donc attendez-vous à ce que la plupart de vos hypothèses échouent et concevez des tests qui survivent à cette vérité.

Ressources

À faire, tiré de cette leçon

Ces actions sont compilées dans le plan d'action du rôle.

  • Verrouillez la durée du test et la taille d'échantillon avant le lancement ; interdisez les coups d'œil précoces
  • Tenir une bibliothèque partagée des résultats de tests documentant chaque victoire et chaque échec
Voir le plan d'action complet →

Articles liés

Les articles récents du blog qui s'appuient sur cette leçon.