IA & ML en marketing : frameworks et méthodologie
Votre équipe arrive en réunion de planification avec neuf propositions IA et un budget pour deux. Il y a un modèle de churn. Un assistant génératif pour les briefs de campagne. Un moteur de next-best-offer pour l'application de fidélité. Rien dans le deck ne vous dit lequel sera rentable, parce que tous les decks promettent le même lift. Ce qui suit, c'est le filtre que vous passez avant que quiconque n'entraîne quoi que ce soit : quelles décisions méritent un modèle, à quoi les données doivent ressembler au préalable, et comment mesurer le résultat pour qu'il survive à une conversation avec votre CFO.
Concept central : quelles décisions méritent un modèle
La prédiction ne justifie son budget que lorsqu'elle change une action. Prenez la mécanique comme acquise (la leçon sur les fondamentaux couvre ce qu'est un modèle et où la prédiction bat une règle) et posez une question plus étroite que « peut-on prédire ceci » : que ferait l'entreprise différemment mardi à 9h si ce chiffre existait ?
Quatre tests, et un candidat doit passer les quatre :
- Fréquence. La décision se répète des milliers de fois par trimestre. Un modèle qui éclaire une répartition budgétaire annuelle est un tableur avec des étapes en plus et un cycle d'achat plus long.
- Action différenciée. Vous pouvez traiter le client A différemment du client B à un coût supportable. Si tout le monde reçoit le même e-mail quel que soit le score, le score est décoratif.
- Résultat observable, assez vite. Ce que vous prédisez est enregistré sans ambiguïté dans une fenêtre assez courte pour réentraîner dessus. Quatre-vingt-dix jours, ça marche. Un cycle de renouvellement de trois ans, non.
- Coût de l'erreur borné. Une mauvaise recommandation produit coûte quelques centimes de marge. Une offre de crcrLe pourcentage de visiteurs ou de prospects qui réalisent une action attendue (achat, inscription, formulaire de contact), calculé en divisant les conversions par le nombre total d'opportunités.Voir la définition complète →édit refusée à tort, ou un message automatisé envoyé en plein deuil, coûte considérablement plus, et ces cas d'usage ont besoin d'une validation humaine avant d'avoir besoin d'un modèle.
Le contre-exemple à garder en tête : le scoring de deals enterprise dans une entreprise qui signe 200 deals par an. La prédiction est techniquement possible, le jeu d'entraînement est minuscule, la boucle de feedback tourne sur dix-huit mois, et les commerciaux écrasent le score de toute façon parce qu'ils étaient dans la pièce. Ce projet échoue à trois tests sur quatre avant que quiconque n'écrive une ligne de code.
Sous-concept clé 1 : chiffrer le gain avant de construire
Faites le calcul au dos de la proposition : décisions par an, multipliées par la marge en jeu dans chaque décision, multipliées par un lift relatif plausible, moins le coût annuel de fonctionnement.
Supposons que l'application de fidélité envoie 40 millions d'offres par an, que 3 % soient utilisées, et que chaque utilisation porte environ quatre unités de marge. Cela fait 1,2 million d'utilisations. Une amélioration relative de 8 % ajoute environ 96 000 utilisations, soit à peu près 384 000 de marge. Mettez maintenant à côté le coût complet de deux data scientists, du temps d'un ingénieur et de l'infrastructure. Certains cas d'usage s'arrarrL'Annual Recurring Revenue (ARR) est le revenu normalisé et prévisible qu'une entreprise par abonnement attend de ses contrats actifs sur une année.Voir la définition complète →êtent là, et c'est justement le but.
Soyez honnête sur le lift que vous supposez. Les chiffres publiés de 20 % à 30 % viennent généralement du remplacement du batch-and-blast par quelque chose, n'importe quoi, de personnalisé. Mesuré contre une règle correcte de récence et de fréquence que votre équipe CRMCRMCustomer Relationship Management : logiciel et stratégie pour gérer et analyser les interactions clients tout au long de leur cycle de vie.Voir la définition complète → fait déjà tourner, 3 % à 8 % en relatif est une hypothèse de planification plus défendable. Si le business case ne tient qu'à 15 %, tuez-le en réunion plutôt qu'au neuvième mois.
SOUS-CONCEPT CLÉ 2 : LE TEST DE MATURITÉ DES FEATURES ET DES DONNÉES
Cinq vérifications, à mener avant validation du modèle, rédigées en une note d'une page par le responsable du pipeline de donnéespipeline de donnéesSéquence automatisée d'étapes qui déplace les données de la source vers la destination : ingestion, transformation, validation et chargement, pour qu'elles arrivent propres et prêtes à l'emploi.Voir la définition complète → :
- Volume dans la classe rare. Pas le total de lignes. Le nombre d'occurrences du résultat qui vous intéresse. Salesforce, qui vend le produit de scoring, publie des seuils pour Einstein Lead Scoring de l'ordre d'un millier de leads et plus de cent conversions sur les six derniers mois. Traitez le minimum annoncé par un éditeur comme le point en dessous duquel le produit refuse de tourner, pas comme le point où il fonctionne bien.
- Leakage. Une feature qui n'existe que parce que le résultat s'est déjà produit. Les visites sur la page d'annulation dans un modèle de churn vous donnent un superbe AUC hors ligne et rien en production. Le test : ce champ aurait-il pu être rempli au moment du scoring, pour un client dont vous ne connaissez pas encore le résultat ?
- Exactitude point-in-time. Entraîner sur les attributs de profil d'aujourd'hui plutôt que sur leur valeur à la date de l'événement apprend le futur au modèle. Même échec, plus silencieux.
- CouvertureCouvertureLe nombre de personnes uniques exposées à votre message sur une période donnée. Contrairement aux impressions, le reach compte chaque personne une seule fois, quel que soit le nombre d'expositions.Voir la définition complète → au moment du serving, pas au moment de l'entrepôt. Un champ rempli à 90 % dans la table nocturne et à 40 % dans l'appel temps réel est une feature différente. Évaluez le modèle sur ce que l'APIAPIApplication Programming Interface : une interface standardisée qui permet aux applications de communiquer et d'échanger des données sans connaître leur fonctionnement interne respectif.Voir la définition complète → recevra réellement.
- Identité. Les scores s'attachent au profil persistant décrit dans la leçon CDPCDPLogiciel qui unifie les données client de toutes les sources en un profil unique et durable, exploitable par le marketing, les ventes et le service.Voir la définition complète →. Si le stitching est faux, le modèle est précis sur la mauvaise personne, et l'erreur est invisible dans toutes les métriques hors ligne que vous regarderez.
Un cas limite qui rattrape les équipes tardivement : une feature peut être prédictive et inutilisable. Les proxys d'aisance financière dérivés du code postal, les inférences de santé, tout ce qui reconstruit une caractéristique protégée. Impliquez le juridique dans la liste des features dès la conception, pas à la revue de lancement.
Sous-concept clé 3 : le pont vers l'activation
Un score qui atterrit dans un dashboard a produit un rapport. Le pont, c'est le chemin automatisé entre la sortie du modèle et le système où la décision s'exécute : la couche d'offres, le bidder, la file CRM, l'application.
Starbucks a construit Deep Brew à partir de 2019 sous Kevin Johnson précisément comme une couche d'activation et non d'analytics. La sélection d'offres pour les membres du programme de fidélité passe par là et arrive dans l'application, et la même plateforme s'étend aux opérations en magasin comme la planification du personnel et les stocks. Le programme de fidélité est ce qui rend la chose possible : les membres Rewards représentent plus de la moitié du chiffre d'affaires des magasins opérés en propre aux États-Unis, donc il y a un client connu, un moment connu, et un canal capable d'exécuter une décision par membre en quelques millisecondes.
Quatre questions d'ingénierie que le pilote oublie généralement, et qu'il vous revient de poser :
- Quel est le budget de latence, et qu'affiche l'application si le score arrive en retard ?
- Quel est le repli quand le score est manquant ou périmé ? Une offre par défaut identifiée vaut mieux qu'un module vide.
- Qui peut passer outre, et l'override est-il journalisé comme donnée d'entraînement ?
- Les caps de fréquence sont-ils en amont ou en aval du modèle ? Les caps en aval cassent silencieusement votre mesure, parce que le groupe traité n'a pas reçu le traitement.
How Spotify's Algorithm Works
Sous-concept clé 4 : mesurer l'uplift honnêtement
Randomisez un holdout au niveau client, dimensionnez-le avant le lancement, et gardez-le pendant toute la durée de vie du programme.
Dimensionnez-le avec l'approximation standard : le nombre de sujets par bras vaut environ 16 × p × (1 - p) ÷ d², où p est votre taux de base et d l'écart absolu que vous voulez détecter avec une puissance de 80 %. Sur une base de conversion de 5 %, détecter un lift relatif de 10 % (0,5 point de pourcentage) demande environ 30 000 par bras. Détecter un lift relatif de 2 % demande environ 760 000 par bras. Si votre audience adressable mensuelle est de 200 000, vous ne pouvez pas voir un effet de 2 %, donc personne ne devrait en prévoir un.
Classez par uplift, pas par propension. Les clients les mieux scorés sont fréquemment ceux qui auraient converti sans aucun contact, donc dépenser sur eux produit des taux de réponse impressionnants et zéro revenu incrémental. Il existe quatre groupes : les acquis, les persuadables, les causes perdues, et un groupe à ne pas déranger où le contact réduit activement la conversion, le cas classique étant l'e-mail de win-back qui rappelle à un abonné dormant qu'il paie toujours. Lisez le traité-moins-contrôle à l'intérieur de chaque décile de score. Le taux de réponse global du groupe traité n'est pas un résultat.
Deux règles de timing. Lisez à la semaine huit ou plus tard, parce que la nouveauté gonfle le premier mois. Et faites tourner le champion-challenger avec une métrique pré-enregistrée et une date de décision, sinon le challenger reste en vie jusqu'à ce que quelqu'un trouve une semaine où il a gagné.
Cas réels
CAS 1 : Starbucks et la décision d'offre
La décision que modélise Deep Brew est étroite : quelle offre présenter à un membre identifié à un moment précis. Elle passe le filtre sans accroc. Des millions de décisions par jour, une action par membre via un canal détenu, une utilisation visible en quelques jours, et le coût d'une mauvaise offre est une incitation gaspillée. La conséquence de second ordre mérite plus votre attention que le modèle : la remise personnalisée apprend aux membres à attendre l'offre. Suivez la marge par membre par trimestre en parallèle du taux d'utilisation, sinon vous optimiserez jusqu'à obtenir un panier moins cher.
CAS 2 : le scoring Salesforce Einstein et la raison pour laquelle les commerciaux ignorent les scores
Salesforce vend cette catégorie, donc lisez ses contraintes comme du design produit plutôt que comme un conseil neutre. Einstein Lead Scoring fait remonter les principaux facteurs qui poussent un score vers le haut ou vers le bas, pas seulement le chiffre. Cela existe parce que l'échec récurrent des déploiements de scoring n'est pas l'exactitude, c'est l'abandon : un chiffre nu dans un champ CRM est ignoré par la personne dont la commission dépend de son propre jugement. Budgétez la couche d'explication et la formation des commerciaux sur la même ligne que le modèle.
Machine Learning for Marketing Explained
CAS 3 : le holdout contaminé, un schémamaUtiliser un logiciel pour automatiser les tâches et campagnes marketing répétitives, afin de personnaliser à grande échelle sur des canaux comme l'email, le web et le social.Voir la définition complète → que vous rencontrerez
Une équipe lance avec un holdout propre de 10 %. Deuxième trimestre, l'équipe CRM fait tourner une campagne sans rapport sur toute la base, holdout inclus. Troisième trimestre, quelqu'un réduit le holdout à 2 % pour capter plus de revenu. Quatrième trimestre, la finance demande ce que le programme a rapporté et la seule réponse disponible est une comparaison en glissement annuel contaminée par le pricing, la saisonnalité et un changement de mix média. Le modèle a peut-être très bien fonctionné. C'est désormais indémontrable, ce qui, en arbitrage budgétaire, revient au même que n'avoir pas fonctionné.
Actions pour le CMO
- Passez le filtre des quatre tests sur chaque proposition du deck, et exigez une phrase nommant l'action qui change. Si personne ne peut écrire cette phrase, le projet ne démarre pas.
- Exigez la note de maturité avant de libérer le budget : effectifs de la classe rare, taux de valeurs nulles au moment du serving, contrôle du leakage, et confirmation que chaque feature existe au moment du scoring.
- Figez le dispositif de mesure par écrit avant le lancement : taille du holdout dérivée du calcul ci-dessus, un responsable nommé, une date de lecture à la semaine huit ou plus tard, et une règle selon laquelle toute réduction du holdout remonte à vous pour approbation.
- Mettez une seule personne, pas une équipe, sur la dégradation des modèles, avec une revue mensuelle du drift et un réentraînement planifié.
Erreurs courantes qui tuent les résultats
- Optimiser le modèle plutôt que la marge. Faire passer l'AUC (mesure technique de la qualité du classement) de 0,78 à 0,82 alors que le pipeline reste plat signifie que la sortie n'atteint pas une décision, ou qu'elle atteint des gens qui allaient déjà acheter.
- Présenter le taux de réponse du groupe traité comme le résultat. Sans cellule de contrôle, ce chiffre vous dit à quel point le ciblage a bien trouvé des acheteurs, pas combien d'acheteurs le ciblage a créés.
- Piloter sur des données que la version à l'échelle n'aura jamais. Extractions nettoyées à la main, liste de clients réconciliée manuellement, un analyste qui rapproche les ID le vendredi. Le pilote marche, la production non, et le diagnostic tombe des mois plus tard.
- Le financer comme un projet. Les modèles se dégradent à mesure que les comportements et le mix produit évoluent. Sans budget de maintenance ni calendrier de rafraîchissement, vous achetez un bon trimestre et une lente dérive que tout le monde attribuera au marché.
Ressources
- 🔗Google's Rules of Machine Learning: Best Practices for ML Engineering
Le guide d'ingénierie interne de Google sur la méthodologie ML, écrit par Martin Zinkevich, donne aux CMO une compréhension concrète de la façon dont les systèmes ML en production sont cadrés, construits et maintenus, de quoi tenir les équipes techniques responsables.
- 🔗Harvard Business Review: How Marketers Can Use AI Without Losing the Human Touch
L'AI Marketing Canvas de Raj Venkatesan et Jim Lecinski fournit un framework structuré pour associer les applications d'IA à des étapes précises du funnel marketing, directement applicable à la méthodologie problem-first couverte dans cette leçon.
À faire, tiré de cette leçon
Ces actions sont compilées dans le plan d'action du rôle.
- Mettre en place un monitoring des modèles avec retraining déclenché quand les prédictions dérivent au-delà de 10 %
- Nommer une seule personne responsable de la performance du modèle et de son interprétabilité
Articles liés
Les articles récents du blog qui s'appuient sur cette leçon.