+75 XP

A/B-Testing & Statistik: Grundlagen & Kernkonzepte

Teilen Sie eine Mailingliste in zwei Hälften und senden Sie beiden Hälften dieselbe E-Mail. Die beiden Öffnungsraten werden sich unterscheiden. Sie unterscheiden sich immer. Diese Lücke ist Rauschen, und sie ist der Grund, warum Experimentieren ein Vokabular braucht statt einer Diskussion.

Das Experimentation-Team von Microsoft, das seit weit über einem Jahrzehnt kontrollierte Tests über Bing und Office hinweg durchführt, hat berichtet, dass nur etwa ein Drittel der Ideen, die es bis in einen Test schaffen, die Metrik verbessern, für die sie gebaut wurden. Manche bewirken nichts. Manche machen es schlechter. Nimmt man das ernst, folgt eine unangenehme Schlussfolgerung: wenn die meisten Ideen scheitern, dann sind die meisten gefeierten „Wins“ aus Tests, die früh gestoppt wurden oder auf dünnem Traffic laufen, Zufall mit einem grünen Pfeil daneben. Die Begriffe dieser Lektion (Hypothese, Randomisierungseinheit, Signifikanz, Power, Stichprobengröße) existieren, um beides voneinander zu unterscheiden.

--- WAS A/B-TESTING TATSÄCHLICH IST ---

Ein A/B-Test, auch Split-Test oder online controlled experiment genannt, teilt Ihr Publikum zufällig in zwei Gruppen. Gruppe A sieht die aktuelle Version (die Kontrollgruppe). Gruppe B sieht die geänderte Version (die Variante). Beide laufen zur gleichen Zeit, auf demselben Traffic-Mix, und Sie vergleichen ein vorab festgelegtes Ergebnis.

Die zufällige Zuweisung macht den Vergleich legitim. Weil die Aufteilung zufällig ist, unterscheiden sich die Gruppen nur durch Zufall und durch die Änderung, die Sie vorgenommen haben. Eine Lücke, die größer ist als der Zufall, kann also der Änderung zugeschrieben werden. Vergleichen Sie stattdessen diese Woche mit der letzten, erhalten Sie eine Vorher/Nachher-Geschichte, verunreinigt durch Wetter, Zahltag, die Promotion eines Wettbewerbers und Ihre eigenen Media-Ausgaben.

Die Randomisierungseinheit ist das, was Sie aufteilen. Meist der Besucher (ein Cookie oder eine eingeloggte ID), manchmal die Session, gelegentlich eine Stadt oder eine Filiale. Teilen Sie nach Besucher auf, sieht jemand, der viermal zurückkommt, immer dieselbe Version, und genau das wollen Sie, wenn die Änderung beeinflusst, wie Menschen eine Marke beurteilen. Teilen Sie nach Session auf, kann dieselbe Person beide Versionen sehen, was den Vergleich verdirbt und den Kunden verwirrt. Die Einheit muss außerdem zur Metrik passen: Umsatz pro Besucher braucht Randomisierung auf Besucherebene.

Vier statistische Ideen tragen den Rest.

Die Nullhypothese ist Ihre Ausgangsannahme: es gibt keinen Unterschied zwischen Kontrolle und Variante. Ein Test beweist nie, dass die Variante besser ist. Er sammelt genug Evidenz, um „kein Unterschied“ unplausibel zu machen.

Statistische Signifikanz ist der Punkt, an dem Sie die Schwelle für unplausibel setzen. Die Konvention sind 95%, und ihre Bedeutung ist eng: wäre die Nullhypothese wahr, würden nur 5% der Tests wie Ihrem einen Unterschied dieser Größe zeigen.

Der p-Wert ist das, was Sie mit dieser Schwelle vergleichen. Er ist die Wahrscheinlichkeit, ein mindestens so extremes Ergebnis zu sehen, wenn es tatsächlich keinen Unterschied gäbe. Unter 0,05 nennt man das Ergebnis signifikant. Er ist nicht die Wahrscheinlichkeit, dass Ihre Variante funktioniert, und aus dieser Verwechslung entstehen die meisten Fehlinterpretationen.

Power ist die Idee, die Marketer überspringen, und dieses Überspringen ist der Grund, warum ihre Ergebnisse verrauscht sind. Power ist die Chance, dass Ihr Test einen echten Effekt einer bestimmten Größe erkennt. 80% sind das übliche Ziel. Ein Test mit 30% Power verpasst die meisten echten Verbesserungen, und die wenigen „Wins“, die er meldet, kommen überhöht oder in der falschen Richtung zurück.

--- WICHTIGE UNTERKONZEPTE, DIE JEDER CMO BEHERRSCHEN MUSS ---

Stichprobengröße: die am meisten missbrauchte Zahl im Marketing-Experimentieren. Sie ist keine Dauer, die Sie wählen, sie ist ein Output. Geben Sie einem Rechner (der von Evan Miller ist kostenlos unter evanmiller.org) Ihre Baseline-Conversion-Rate, den Effekt, den Sie erkennen wollen, Ihr Signifikanzniveau und Ihre Power, und er liefert die benötigten Besucher pro Variante. Wenn die Antwort 400.000 pro Seite lautet und Sie 20.000 im Monat bekommen, haben Sie etwas Nützliches gelernt: dieser Test lässt sich hier nicht durchführen, und Sie sollten etwas mit einem größeren erwarteten Effekt testen.

Minimum Detectable Effect (MDE): die kleinste Verbesserung, auf die Sie reagieren würden. Eine Bewegung von 3,2% auf 3,4% zu erkennen, verlangt eine enorme Stichprobe. Die Entscheidung, dass Sie sich nur für relative Lifts von 10% oder mehr interessieren, verkleinert die Anforderung deutlich. Setzen Sie den MDE zuerst. Ihn nach dem Blick auf die Daten zu wählen, ist der Weg, auf dem Teams sich ein Ergebnis einreden.

Novelty- und Primacy-Effekte: Bestandsnutzer reagieren auf eine Änderung, weil sie neu ist, nicht weil sie besser ist. Frühe Zahlen bewegen sich, dann verblassen sie. Splitten Sie Ergebnisse zwischen neuen und wiederkehrenden Besuchern. Wenn der Lift in Woche eins nur bei wiederkehrenden Nutzern auftritt, messen Sie Überraschung.

Segmente: eine Änderung kann auf Mobile gewinnen und auf Desktop verlieren. Zalando, das in über 20 europäischen Märkten verkauft, steht ständig davor, denn eine Checkout-Änderung kann sich je nach Land, Gerät und danach, ob der Besucher während eines Sales kam, unterschiedlich verhalten. Schneiden Sie Ihre Ergebnisse nach den zwei oder drei relevanten Segmenten, bevor Sie überall ausrollen, aber behandeln Sie jeden zusätzlichen Schnitt als weiteren Vergleich und nicht als weitere Entdeckung.

How Obama Raised $60 Million by Running a Simple Experiment

Watch on YouTube

--- ECHTE UNTERNEHMENSBEISPIELE MIT ECHTEN ZAHLEN ---

Microsoft Bing, 2012. Ein Ingenieur schlug eine Änderung an der Darstellung von Anzeigen-Headlines vor. Sie lag Monate im Backlog, weil niemand glaubte, dass sie etwas bringt. Als sie lief, stieg der Umsatz pro Suche in den USA um rund 12%, über 100 Millionen Dollar pro Jahr wert, und die erste Reaktion des Teams war, einen Tracking-Bug zu vermuten. Zwei Lehren: Intuition kann Ideen nicht sortieren, und ein extremes Ergebnis verdient eine Prüfung der Instrumentierung, bevor gefeiert wird.

Netflix hat Engineering-Beiträge zum Testen von Artwork veröffentlicht, die zeigen, dass das Bild, das einen Titel repräsentiert, verändert, wie oft Mitglieder ihn abspielen. Dasselbe Unternehmen investiert auch ernsthaft in die Statistik hinter diesen Auswertungen, einschließlich sequenzieller Testverfahren, die es erlauben, Ergebnisse kontinuierlich zu beobachten, ohne die Inflation falsch positiver Ergebnisse, die beiläufiges Peeking verursacht. Das ist das Erkennungszeichen eines ausgereiften Programms: die Methode bekommt so viel Aufmerksamkeit wie die Idee.

Zalando hat seine eigene Experimentationsplattform gebaut statt eine zu kaufen, und die Ingenieure haben die Mechanik öffentlich beschrieben: einen Besucher über Besuche hinweg konsistent einer Variante zuzuweisen und Metriken auf derselben Einheit zu berechnen, die für den Split verwendet wurde. Unglamouröse Arbeit, und genau sie verhindert, dass ein Fashion-Retailer einen zweiwöchigen Test, der in eine Sale-Periode fällt, als permanenten Effekt liest.

Wissenscheck

1. Was ist der grundlegende Zweck eines A/B-Tests im Marketing?

2. Was repräsentiert die Nullhypothese in einem A/B-Test?

3. Ein Marketer lässt einen Test drei Tage laufen, sieht die Variante mit 8% vorn und erklärt den Sieg. Warum ist diese Argumentation fehlerhaft?

MEHRFACHAUSWAHL

4. Wählen Sie ALLE korrekten Aussagen zu p-Wert und statistischer Signifikanz.

Wählen Sie alle richtigen Antworten aus.

MEHRFACHAUSWAHL

5. Wählen Sie ALLE Inputs, die Sie typischerweise einem Stichprobengrößen-Rechner vor dem Start eines A/B-Tests geben.

Wählen Sie alle richtigen Antworten aus.

--- CMO ACTION ITEMS ---

  • Bestehen Sie darauf, dass jeder Test als ein geschriebener Satz eintrifft: weil [Evidenz], erwarten wir, dass [Änderung] [primäre Metrik] um mindestens [MDE] bewegt, gemessen auf [Randomisierungseinheit]. Eine Anfrage, die diese Klammern nicht füllen kann, ist eine Vorliebe, keine Hypothese.
  • Registrieren Sie die Zahlen vor dem Launch: Baseline-Rate, MDE, Signifikanzniveau, Power, die resultierende Stichprobengröße pro Variante, das Enddatum und genau eine primäre Metrik. Sekundäre Metriken dienen der Diagnose, nie der Bestimmung des Gewinners.
  • Fragen Sie Ihr Tool, was es tatsächlich berechnet. Google Optimize wurde im September 2023 abgeschaltet, deshalb sitzen die meisten Teams heute auf Optimizely, VWO (beide Anbieter verkaufen Testing-Software, lesen Sie ihre Benchmarks entsprechend), GA4-Experimenten oder etwas Selbstgebautem. Finden Sie heraus, ob Ihres eine feste Stichprobengröße annimmt oder sequenzielle Analyse unterstützt, denn diese eine Antwort entscheidet, ob tägliches Nachsehen sicher ist.
  • Rechnen Sie Ihren MDE in Geld um, bevor Sie irgendetwas starten. Ein Lift von 10% auf einer Seite, die 300 Personen pro Monat sehen, ist keinen Engineering-Sprint wert.

--- HÄUFIGE FEHLER, DIE ERGEBNISSE ZERSTÖREN ---

Peeking und zu frühes Stoppen. Täglich nachzusehen und in dem Moment zu stoppen, in dem das Dashboard grün wird, beschleunigt kein Lernen, es fabriziert falsch positive Ergebnisse: Forschung von Ramesh Johari und Kollegen in Stanford zum kontinuierlichen Monitoring zeigte, dass die tatsächliche Fehlerrate deutlich über die nominalen 5% steigt, wenn Tests mit Fixed-Horizon-Mathematik wiederholt gelesen werden. Sie haben eine Stichprobengröße vereinbart. Halten Sie sich daran, oder wechseln Sie zu einer Methode, die für kontinuierliches Lesen gebaut ist.

Viele Dinge gleichzeitig testen und es einen A/B-Test nennen. Ändern Sie Headline, Hero-Image und Button zusammen, können Sie nicht sagen, welches gewirkt hat, oder ob ein Gewinn einen Verlust verdeckt hat. Testen Sie eine Variable, oder nutzen Sie ein multivariates Design, das jeden Beitrag isoliert. Optimizely und VWO unterstützen beides. Dieselbe Arithmetik gilt für Metriken und Segmente: prüfen Sie 20 Vergleiche bei 95%, und etwa einer wird allein durch Zufall signifikant aussehen.

Statistische Signifikanz mit betriebswirtschaftlicher Relevanz verwechseln. Ein Lift von 0,3% in der Click-Through-Rate mit einem p-Wert von 0,03 ist real und kann trotzdem wertlos sein, wenn der Rollout 50.000 Dollar Engineering-Zeit kostet. Übersetzen Sie jedes Ergebnis in projizierten Umsatz oder Kosten, bevor Sie über den Rollout entscheiden.

--- KEY TAKEAWAYS ---

  • Ein A/B-Test vergleicht eine Kontrolle und eine Variante auf zufällig zugewiesenem, gleichzeitigem Traffic, beurteilt an einem vorab benannten Ergebnis.
  • Wählen Sie die Randomisierungseinheit bewusst (meist den Besucher) und passen Sie Ihre Metrik daran an.
  • Signifikanz sagt Ihnen, wie überraschend Ihr Ergebnis wäre, wenn nichts passieren würde; Power sagt Ihnen, ob Ihr Test den Effekt überhaupt finden konnte. Unterpowerte Tests sind die Hauptquelle gefälschter Wins.
  • Stichprobengröße und MDE sind Inputs, die Sie vor dem Launch berechnen, keine Dauern, die Sie hinterher wählen.
  • Rund ein Drittel der getesteten Ideen bei Microsoft verbesserte die Zielmetrik, rechnen Sie also damit, dass die meisten Ihrer Hypothesen scheitern, und gestalten Sie Tests, die diese Wahrheit überleben.

Ressourcen

Was Sie aus dieser Lektion umsetzen

Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.

  • Testdauer und Stichprobengröße vor dem Start festlegen; frühes Reinschauen verbieten
  • Eine gemeinsame Testergebnis-Bibliothek pflegen, die jeden Win und jeden Loss dokumentiert
Vollständiges Action Playbook ansehen

Verwandte Artikel

Aktuelle Blogartikel, die auf dieser Lektion aufbauen.