KI & ML im Marketing: Frameworks & Methodik
Ihr Team kommt mit neun KI-Vorschlägen ins Planungsmeeting und Budget für zwei. Einer ist ein Churn-Modell. Einer ein generativer Assistent für Kampagnenbriefings. Einer eine Next-Best-Offer-Engine für die Loyalty-App. Nichts in der Präsentation sagt Ihnen, was sich rechnet, denn jede Präsentation versprichtdenselben Lift. Was folgt, ist der Filter, den Sie anlegen, bevor irgendwer ein Modell trainiert: welche Entscheidungen ein Modell verdienen, wie die Daten vorher aussehen müssen und wie Sie das Ergebnis so messen, dass es ein Gespräch mit Ihrem CFO übersteht.
---
KERNKONZEPT: WELCHE ENTSCHEIDUNGEN EIN MODELL VERDIENEN
Prediction verdient ihr Budget nur, wenn sie eine Handlung verändert. Nehmen Sie die Mechanik als gegeben (die Grundlagenlektion behandelt, was ein Modell ist und wo Prediction eine Regel schlägt) und stellen Sie eine engere Frage als „kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen wir das vorhersagen“: Was würde das Business am Dienstag um 9 Uhr anders machen, wenn die Zahl existierte?
Vier Tests, und ein Kandidat muss alle vier bestehen:
- Häufigkeit. Die Entscheidung wiederholt sich tausendfach pro Quartal. Ein Modell, das eine jährliche Budgetaufteilung informiert, ist ein Spreadsheet mit Zusatzschritten und längerem Beschaffungszyklus.
- Differenzierte Handlung. Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Kunde A anders behandeln als Kunde B, zu Kosten, die Sie tragen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen. Wenn alle dieselbe E-Mail bekommen, unabhängig vom Score, ist der Score Dekoration.
- Beobachtbares Ergebnis, schnell genug. Das, was Sie vorhersagen, wird eindeutig erfasst, innerhalb eines Zeitfensters, das kurz genug ist, um dagegen nachzutrainieren. Neunzig Tage funktionieren. Ein dreijähriger Vertragszyklus nicht.
- Begrenzte Fehlerkosten. Eine falsche Produktempfehlung kostet ein paar Cent Marge. Ein falsch verweigertes Kreditangebot oder eine automatisierte Nachricht in einen Trauerfall hinein kostet deutlich mehr, und diese Use Cases brauchen ein menschliches Gate, bevor sie ein Modell brauchen.
Das Gegenbeispiel, das Sie im Kopf behalten sollten: Enterprise-Deal-Scoring in einem Unternehmen, das 200 Deals pro Jahr abschließt. Die Prediction ist technisch möglich, der Trainingsdatensatz ist winzig, der Feedback-Loop läuft achtzehn Monate, und die Vertriebsleute übersteuern den Score ohnehin, weil sie im Raum waren. Dieses Projekt scheitert an drei von vier Tests, bevor jemand eine Zeile Code schreibt.
---
ZENTRALER TEILASPEKT 1: DEN PREIS BEZIFFERN, BEVOR GEBAUT WIRD
Rechnen Sie auf der Rückseite des Vorschlags: Entscheidungen pro Jahr, multipliziert mit der Marge, die in jeder Entscheidung auf dem Spiel steht, multipliziert mit einem plausiblen relativen Lift, minus der jährlichen Betriebskosten.
Angenommen, die Loyalty-App verschickt 40 Millionen Angebote pro Jahr, 3 % werden eingelöst, und jede Einlösung trägt etwa vier Einheiten Marge. Das sind 1,2 Millionen Einlösungen. Eine relative Verbesserung von 8 % bringt rund 96.000 zusätzliche Einlösungen, wert etwa 384.000 an Marge. Stellen Sie daneben die vollen Kosten für zwei Data Scientists, die Zeit eines Engineers und die Infrastruktur. Manche Use Cases enden genau hier, und das ist der Punkt.
Seien Sie ehrlich beim angenommenen Lift. Die publizierten 20 bis 30 % stammen üblicherweise daraus, Batch-and-Blast durch irgendetwas Personalisiertes zu ersetzen. Gemessen an einer anständigen Recency-und-Frequency-Regel, die Ihr CRMCRMCustomer Relationship Management: software and strategy to manage and analyse customer interactions throughout their lifecycle.Vollständige Definition ansehen →-Team schon fährt, sind 3 bis 8 % relativ der besser vertretbare Planungswert. Wenn der Business Case erst bei 15 % aufgeht, beerdigen Sie ihn im Meeting statt in Monat neun.
---
ZENTRALER TEILASPEKT 2: DER TEST AUF FEATURE- UND DATENREIFE
Fünf Prüfungen, durchzuführen bevor das Modell genehmigt wird, als einseitiges Memo verfasst von der Person, die die Data PipelineData PipelineETL (Extract, Transform, Load) is a data integration process that pulls data from sources, reshapes it into a consistent format, and writes it into a target system.Vollständige Definition ansehen → verantwortet:
- Volumen in der seltenen Klasse. Nicht Gesamtzeilen. Die Anzahl des Ergebnisses, das Sie interessiert. Salesforce, das das Scoring-Produkt verkauft, nennt für Einstein Lead Scoring Untergrenzen im Bereich von tausend Leads und über hundert Conversions in den zurückliegenden sechs Monaten. Behandeln Sie das genannte Minimum eines Anbieters als den Punkt, unterhalb dessen das Produkt die Arbeit verweigert, nicht als den Punkt, ab dem es gut funktioniert.
- Leakage. Ein Feature, das nur existiert, weil das Ergebnis bereits eingetreten ist. Besuche der KKThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →ündigungsseite in einem Churn-Modell liefern Ihnen eine wunderschöne Offline-AUC und nichts in Produktion. Der Test: Hätte dieses Feld zum Zeitpunkt des Scorings gefüllt sein kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen, für einen Kunden, dessen Ergebnis Sie noch nicht kennen?
- Point-in-Time-Korrektheit. Wer auf den heutigen Profilattributen trainiert statt auf ihrem Wert zum Datum des Ereignisses, lehrt dem Modell die Zukunft. Gleicher Fehler, nur leiser.
- Coverage zum Serving-Zeitpunkt, nicht zum Warehouse-Zeitpunkt. Ein Feld, das in der Nightly-Tabelle zu 90 % gefüllt ist und im Echtzeit-Call zu 40 %, ist ein anderes Feature. Bewerten Sie das Modell auf dem, was die APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen → tatsächlich erhält.
- Identität. Scores hängen am persistenten Profil, das in der CDPCDPA Customer Data Platform unifies customer data from all sources into persistent, actionable profiles that other systems can use.Vollständige Definition ansehen →-Lektion beschrieben wird. Ist das Stitching falsch, ist das Modell präzise über die falsche Person, und der Fehler bleibt in jeder Offline-Metrik, die Sie anschauen werden, unsichtbar.
Ein Grenzfall, der Teams spät erwischt: Ein Feature kann prädiktiv und unbrauchbar sein. Aus Postleitzahlen abgeleitete Wohlstandsproxys, Gesundheitsinferenzen, alles, was ein geschütztes Merkmal rekonstruiert. Holen Sie die Rechtsabteilung beim Design in die Feature-Liste, nicht beim Launch-Review.
---
ZENTRALER TEILASPEKT 3: DIE AKTIVIERUNGSBRÜCKE
Ein Score, der in einem Dashboard landet, hat einen Report produziert. Die BrBrThe percentage of visitors who leave after viewing only one page, often a signal of poor relevance, mismatched intent, or weak user experience.Vollständige Definition ansehen →ücke ist der automatisierte Weg vom Modell-Output in das System, in dem die Entscheidung ausgeführt wird: den Offer-Layer, den Bidder, die CRMCRMCustomer Relationship Management: software and strategy to manage and analyse customer interactions throughout their lifecycle.Vollständige Definition ansehen →-Queue, die App.
Starbucks hat Deep Brew ab 2019 unter Kevin Johnson genau als Aktivierungsschicht gebaut, nicht als Analytics-Schicht. Die Angebotsauswahl für Loyalty-Mitglieder läuft darüber und in die App, und dieselbe Plattform greift in den Store-Betrieb hinein, etwa Personaleinsatzplanung und Inventar. Das Loyalty-Programm macht es möglich: Rewards-Mitglieder stehen für über die Hälfte des Umsatzes der eigenbetriebenen US-Filialen, also gibt es einen bekannten Kunden, einen bekannten Moment und einen Kanal, der eine Entscheidung pro Mitglied in Millisekunden ausführen kann.
Vier Engineering-Fragen, die der Pilot meist vergisst und die alle Ihre Fragen sind:
- Wie hoch ist das Latenzbudget, und was zeigt die App, wenn der Score zu spät kommt?
- Was ist der Fallback, wenn der Score fehlt oder veraltet ist? Ein benanntes Standardangebot schlägt ein leeres Modul.
- Wer darf übersteuern, und wird das Override als Trainingsdatum protokolliert?
- Sitzen Frequency Caps vor oder hinter dem Modell? Caps hinter dem Modell zerstören Ihre Messung unbemerkt, weil die Testgruppe die Behandlung nicht erhalten hat.
How Spotify's Algorithm Works
---
ZENTRALER TEILASPEKT 4: UPLIFT EHRLICH MESSEN
Randomisieren Sie ein Holdout auf Kundenebene, dimensionieren Sie es vor dem Launch und behalten Sie es über die Laufzeit des Programms.
Dimensionieren Sie mit der üblichen Näherung: Probanden pro Arm entsprechen etwa 16 × p × (1 − p) ÷ d², wobei p Ihre Baseline-Rate ist und d die absolute Differenz, die Sie bei 80 % Power erkennen wollen. Bei einer Conversion-Baseline von 5 % braucht der Nachweis eines relativen Lifts von 10 % (0,5 Prozentpunkte) etwa 30.000 pro Arm. Der Nachweis eines relativen Lifts von 2 % braucht etwa 760.000 pro Arm. Wenn Ihre monatlich adressierbare Audience 200.000 beträgt, kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Sie einen 2-%-Effekt nicht sehen, also sollte niemand einen prognostizieren.
Ranken Sie nach Uplift, nicht nach Propensity. Die Kunden mit den höchsten Scores sind häufig genau die, die ohne jeden Kontakt konvertiert hätten, also erzeugen Ausgaben für sie beeindruckende Response-Raten und keinen inkrementellen Umsatz. Es gibt vier Gruppen: die sicheren Fälle, die Überzeugbaren, die verlorenen Fälle und eine Do-not-disturb-Gruppe, bei der Kontakt die Conversion aktiv senkt, klassisch die Win-back-E-Mail, die einen inaktiven Abonnenten daran erinnert, dass ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → noch zahlt. Lesen Sie Treated-minus-Control innerhalb jeder Score-Dezile. Die Gesamt-Response-Rate der Testgruppe ist kein Ergebnis.
Zwei Timing-Regeln. Lesen Sie ab Woche acht, denn der Neuheitseffekt bläht den ersten Monat auf. Und fahren Sie Champion-Challenger mit vorab festgelegter Metrik und Entscheidungsdatum, sonst bleibt der Challenger live, bis jemand eine Woche findet, in der ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → gewonnen hat.
---
FÄLLE AUS DER PRAXIS
FALL 1: Starbucks und die Angebotsentscheidung
Die Entscheidung, die Deep Brew modelliert, ist eng: welches Angebot einem identifizierten Mitglied in einem bestimmten Moment gezeigt wird. Sie besteht den Filter glatt. Millionen Entscheidungen pro Tag, Handlung pro Mitglied über einen eigenen Kanal, Einlösung innerhalb von Tagen sichtbar, und die Kosten eines falschen Angebots sind ein verschwendeter Incentive. Die Folgewirkung verdient mehr Aufmerksamkeit als das Modell: Personalisiertes Discounting lehrt Mitglieder, auf das Angebot zu warten. Verfolgen Sie die Marge pro Mitglied pro Quartal neben der Einlösungsrate, sonst optimieren Sie sich in einen günstigeren Warenkorb.
FALL 2: Salesforce Einstein Scoring und der Grund, warum Vertriebsleute Scores ignorieren
Salesforce verkauft diese Kategorie, lesen Sie die Restriktionen also als Produktdesign und nicht als neutralen Ratschlag. Einstein Lead Scoring zeigt die wichtigsten Faktoren, die einen Score nach oben oder unten treiben, nicht nur die Zahl. Das existiert, weil das wiederkehrende Scheitern von Scoring-Deployments nicht die Genauigkeit ist, sondern die Nichtnutzung: Eine nackte Zahl in einem CRMCRMCustomer Relationship Management: software and strategy to manage and analyse customer interactions throughout their lifecycle.Vollständige Definition ansehen →-Feld wird von der Person ignoriert, deren Provision an ihrem eigenen Urteil hängt. Budgetieren Sie die Erklärungsschicht und das Vertriebstraining in derselben Position wie das Modell.
Machine Learning for Marketing Explained
FALL 3: das kontaminierte Holdout, ein Muster, dem Sie begegnen werden
Ein Team startet mit einem saubereren 10-%-Holdout. Quartal zwei: Das CRMCRMCustomer Relationship Management: software and strategy to manage and analyse customer interactions throughout their lifecycle.Vollständige Definition ansehen →-Team fährt eine unabhängige Kampagne über die gesamte Basis, inklusive Holdout. Quartal drei: Jemand schrumpft das Holdout auf 2 %, um mehr Umsatz abzuschöpfen. Quartal vier: Finance fragt, was das Programm geliefert hat, und die einzige verfügbare Antwort ist ein Jahresvergleich, kontaminiert durch Pricing, Saisonalität und eine Media-Verschiebung. Das Modell hat möglicherweise funktioniert. Es ist jetzt unbeweisbar, was in einer Budgetrunde dasselbe ist wie nicht funktioniert.
---
CMO ACTION ITEMS
- Legen Sie den Vier-Test-Filter an jeden Vorschlag in der Präsentation und verlangen Sie einen Satz, der die Handlung benennt, die sich ändert. Kann niemand diesen Satz schreiben, startet das Projekt nicht.
- Fordern Sie das Readiness-Memo, bevor Budget freigegeben wird: Zählungen der seltenen Klasse, Null-Raten zum Serving-Zeitpunkt, die Leakage-Prüfung und die Bestätigung, dass jedes Feature zum Zeitpunkt des Scorings existiert.
- Fixieren Sie das Messdesign vor dem Launch schriftlich: Holdout-Größe abgeleitet aus der obigen Rechnung, ein benannter Owner, ein Auswertungsdatum ab Woche acht und eine Regel, dass jede Reduzierung des Holdouts Ihnen zur Genehmigung vorgelegt wird.
- Setzen Sie eine einzelne Person, nicht ein Team, auf Modelldegradation, mit monatlichem Drift-Review und geplantem Retraining.
---
HÄUFIGE FEHLER, DIE ERGEBNISSE ZERSTÖREN
- Das Modell optimieren statt der Marge. Die AUC (ein technisches MaMaUsing software to automate repetitive marketing tasks and campaigns, enabling personalisation at scale across channels like email, web, and social.Vollständige Definition ansehen →ß für Ranking-Qualität) von 0,78 auf 0,82 zu heben, während die PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen → flach bleibt, heißt: Der Output erreicht keine Entscheidung, oder ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → erreicht Leute, die ohnehin gekauft hätten.
- Die Response-Rate der Testgruppe als Ergebnis berichten. Ohne Kontrollzelle sagt diese Zahl, wie gut das Targeting KKThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →äufer gefunden hat, nicht wie viele KKThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →äufer das Targeting erzeugt hat.
- Auf Daten pilotieren, die die skalierte Version nie haben wird. Handbereinigte Extrakte, eine manuell zusammengesetzte Kundenliste, ein Analyst, der freitags IDs abgleicht. Der Pilot funktioniert, die Produktion nicht, und die Diagnose kommt Monate später.
- Es als Projekt finanzieren. Modelle verfallen, wenn Verhalten und Produktmix sich verschieben. Ohne Wartungsbudget und Refresh-Plan kaufen Sie ein gutes Quartal und einen langsamen Abstieg, den alle dem Markt zuschreiben.
Ressourcen
- 🔗Google's Rules of Machine Learning: Best Practices for ML Engineering
Googles interner Engineering-Leitfaden zur ML-Methodik, geschrieben von Martin Zinkevich, gibt CMOs ein konkretes Verständnis davon, wie produktive ML-Systeme gescopt, gebaut und gewartet werden, damit Sie technische Teams verantwortlich halten können.
- 🔗Harvard Business Review: How Marketers Can Use AI Without Losing the Human Touch
Das AI Marketing Canvas von Raj Venkatesan und Jim Lecinski liefert ein strukturiertes Framework, um KI-Anwendungen bestimmten Stufen des Marketing-Funnels zuzuordnen, direkt anwendbar auf die in dieser Lektion behandelte Problem-First-Methodik.
Was Sie aus dieser Lektion umsetzen
Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.
- Model Monitoring einrichten mit Retraining, das ausgelöst wird, wenn die Predictions um mehr als 10 % driften
- Benennen Sie eine einzelne Person, die für Modell-Performance und Interpretierbarkeit verantwortlich ist
Verwandte Artikel
Aktuelle Blogartikel, die auf dieser Lektion aufbauen.