+150 XP

Évaluer les promesses des fournisseurs et concevoir un proof of concept

Le directeur de la prévention des pertes d'une chaîne d'épicerie de taille moyenne a un jour dit à l'équipe commerciale d'un fournisseur : « Votre démo a détecté 94 % des vols. Montrez-moi ça sur mes caméras, dans mes magasins, avec mes voleurs. » La précision du fournisseur est tombée à 61 %. Cet écart entre la démo et la réalité est la raison d'être de cette leçon.

La détection de la démarque par vision-AI (systèmes de computer vision qui signalent les vols suspectés ou le contournement du scan en caisse) est l'un des achats d'IA qui progressent le plus vite dans la prévention des pertes en retail. C'est aussi l'une des catégories où l'on se brûle le plus facilement les doigts, parce que les démos fournisseurs reposent sur des séquences sélectionnées, pas sur l'éclairage de votre magasin, vos angles de caméra ou votre mix de clientèle.

Pourquoi les démos fournisseurs induisent en erreur par construction

Les démos sont optimisées pour vendre, pas pour informer. Trois raisons structurelles :

  • Séquences triées sur le volet. Les bandes-démo montrent en général des détections propres, bien éclairées, à forte confiance. Le fournisseur sélectionne les clips où le modèle performe le mieux.
  • Base rates différents. Un modèle entraîné sur des schémas de vol en grande surface peut mal se comporter dans les rayons étroits d'une supérette ou sur les tailles de panier d'une pharmacie.
  • Aucune exposition à vos déclencheurs de faux positifs. Sacs réutilisables, réassort par les employés, parents qui attrapent un article pour leur enfant : autant de sources de fausses alertes qu'une démo générique ne fait jamais apparaître.

D'où la nécessité, dans un RFP (Request for Proposal, l'appel d'offres formel émis par le distributeur), d'une scorecard qui dépasse le « est-ce que ça marche » pour aller vers « est-ce que ça marche sur mes données, à mon échelle, avec mes contraintes ».

Anatomie d'une scorecard de RFP pour la détection de démarque

Une scorecard réaliste pour un fournisseur vision-AI de détection de démarque pondère en général cinq catégories. Voici une version simplifiée, calquée sur ce qu'utilisent réellement les grands distributeurs :

CatégoriePoidsCe que vous testez
Précision de détection sur vos propres séquences30 %Precision et recall sur un échantillon labellisé issu de vos magasins
Taux de faux positifs en conditions de production25 %Alertes par magasin et par jour que les équipes doivent traiter
Effort d'intégration15 %Compatibilité avec les caméras existantes, les systèmes POS (point of sale) et les workflows des équipes
Confidentialité des données et conformité15 %Traitement des données biométriques, politique de rétention, règles étatiques et européennes
Coût total de possession sur 3 ans15 %Licences, upgrades matériels, effectifs affectés à la revue des alertes

À noter : la « précision » ne pèse que 30 %. Les fournisseurs adorent mettre en avant un chiffre unique de précision. Un acheteur sérieux traite ce chiffre comme un input parmi cinq.

Precision et recall, définis pour des acheteurs non techniques

Deux termes à cadrer avant toute négociation :

  • Precision : sur l'ensemble des alertes levées par le système, quel pourcentage correspondait à de vrais vols ? Une precision faible signifie que les équipes perdent du temps sur de fausses alertes.
  • Recall : sur l'ensemble des vols réellement survenus, quel pourcentage le système a-t-il détecté ? Un recall faible signifie que la démarque continue de fuir sans être détectée.

Il y a presque toujours un arbitrage. Un fournisseur qui annonce à la fois 95 % de precision et 95 % de recall sur une seule démo doit éveiller votre scepticisme, pas votre confiance. Demandez la matrice de confusion (le tableau détaillant vrais positifs, faux positifs, vrais négatifs, faux négatifs), pas seulement un pourcentage d'accroche.

Concevoir le proof of concept (POC)

Un POC (proof of concept, test à échelle réduite avant achat complet) doit être structuré comme une expérience contrôlée, pas comme une démonstration commerciale prolongée.

Étape 1 : choisissez des magasins représentatifs, pas des magasins vitrines.

Retenez 3 à 5 sites qui reflètent votre parc réel : agencements différents, éclairages différents, caméras d'âges variés, mix urbain et périurbain. Les fournisseurs pousseront pour votre magasin le mieux équipé. Résistez.

Étape 2 : construisez votre propre ground truth labellisée.

Avant le démarrage du POC, votre équipe prévention des pertes (ou un processus de revue par échantillonnage) doit taguer un ensemble d'incidents connus issus des séquences historiques, à la fois des vols avérés et des non-événements qui paraissent suspects (le problème du sac réutilisable, le personnel de réassort, etc.). Cela devient le corrigé sur lequel le système du fournisseur est noté, indépendamment de son propre reporting.

Étape 3 : tenez une fenêtre de temps fixe, 60 à 90 jours minimum.

Les schémas de vol varient selon la saison, le jour de la semaine et le niveau de staffing. Un POC de deux semaines pendant une période creuse ne vous apprend presque rien. Les associations de prévention des pertes en retail, dont le Loss Prevention Research Council de la National Retail Federation, publient des enquêtes annuelles sur la démarque qui aident à benchmarker ce qu'est un taux d'incidents « normal » pour votre format.

Étape 4 : notez sur la scorecard du RFP, pas sur les dashboards du fournisseur.

Les fournisseurs proposeront leur propre dashboard de performance. Recoupez un échantillon manuellement. Si le fournisseur annonce 88 % de precision et que votre audit manuel de 100 alertes remontées en trouve 60 réelles, cet écart est la donnée la plus importante de toute l'évaluation.

Étape 5 : stress-testez le coût des faux positifs.

Calculez le coût en main-d'œuvre de la revue des alertes. Un exemple chiffré simple :

  • Le système génère 40 alertes par magasin et par jour
  • Temps moyen de revue : 3 minutes par alerte
  • Soit 120 minutes (2 heures) de temps équipe par magasin et par jour, tous les jours
  • Sur 50 magasins pilotes, cela fait 100 heures-personne par jour rien que pour traiter les alertes

Si le coût complet de ce temps de revue dépasse les montants de démarque récupérés, le système est négatif net même s'il « fonctionne ».

Contrôles de confidentialité et de conformité

Les systèmes vision-AI qui suivent des individus créent une exposition réglementaire réelle. Aux États-Unis, des États comme l'Illinois (Biometric Information Privacy Act, BIPA) et le Texas disposent de lois spécifiques sur les données biométriques, avec action privée ou application par le procureur général de l'État. Dans l'UE et au Royaume-Uni, le RGPD (Règlement général sur la protection des données) et le UK GDPR encadrent tout traitement d'identifiants biométriques, et la reconnaissance faciale en magasin a attiré l'attention d'autorités de protection des données, dont l'Information Commissioner's Office britannique. Vérifiez avec votre équipe juridique, avant même le lancement du POC, si le système du fournisseur fait de la reconnaissance faciale (identification de la personne) ou de la détection comportementale (signalement de mouvements suspects sans identifier qui). Les charges de conformité associées sont très différentes.

Un script simple d'évaluation fournisseur

Pour les équipes à l'aise techniquement, même un script basique comparant les alertes du fournisseur à votre ground truth labellisée clarifie vite la situation :

python
# Comparer les alertes du fournisseur à vos labels de ground truth
import pandas as pd

vendor_alerts = pd.read_csv("vendor_alerts.csv")   # colonnes : incident_id, flagged
ground_truth = pd.read_csv("ground_truth.csv")     # colonnes : incident_id, actual_theft

merged = ground_truth.merge(vendor_alerts, on="incident_id", how="left")
merged["flagged"] = merged["flagged"].fillna(False)

true_positives = ((merged.flagged) & (merged.actual_theft)).sum()
false_positives = ((merged.flagged) & (~merged.actual_theft)).sum()
false_negatives = ((~merged.flagged) & (merged.actual_theft)).sum()

precision = true_positives / (true_positives + false_positives)
recall = true_positives / (true_positives + false_negatives)

print(f"Precision: {precision:.2%}, Recall: {recall:.2%}")

Ce n'est pas du code de production, c'est un outil de vérification qu'un analyste peut faire tourner en un après-midi pour valider les chiffres auto-déclarés d'un fournisseur.

Vérification des acquis

1. Un directeur de la prévention des pertes a exigé de tester le système vision-AI d'un fournisseur sur les séquences des magasins du distributeur plutôt que d'accepter les résultats de la démo. Quel problème de fond cette pratique traite-t-elle ?

2. Une supérette évalue un fournisseur de détection de vol par vision-AI dont le modèle a été entraîné principalement sur des données de grande surface. Quel est le risque conceptuel le plus probable ?

3. Pourquoi une scorecard de RFP pour des fournisseurs de détection de démarque doit-elle tester plus que le simple « est-ce que ça marche » ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les bonnes réponses sur les raisons pour lesquelles les démos de détection de démarque par vision-AI peuvent induire les acheteurs retail en erreur.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les bonnes réponses sur les facteurs qui génèrent des faux positifs dans les déploiements réels de détection de démarque par vision-AI.

Sélectionnez toutes les réponses correctes.

Négocier à partir des résultats du POC

Une fois que vous disposez de chiffres réels, négociez les termes du contrat autour d'eux :

  • Tarification indexée sur la performance : liez une partie des honoraires à la precision et au recall mesurés sur vos données, pas au benchmark du fournisseur.
  • Droit de ré-audit : prévoyez un droit de re-test trimestriel, la performance du modèle pouvant dériver à mesure que les agencements et l'assortiment évoluent (phénomène appelé model drift).
  • Clauses de sortie : les fournisseurs vision-AI exigeant souvent une installation matérielle (caméras, unités d'edge computing), assurez-vous de ne pas être verrouillé sur du matériel propriétaire qui limiterait un changement ultérieur.

🎬 [VIDEO: "How Retailers Are Using AI to Fight Shoplifting" - youtube.com - cherchez des reportages récents de médias économiques sur les déploiements d'IA en prévention des pertes en retail et leurs limites réelles]

Points clés

  • N'évaluez jamais un fournisseur de détection de démarque sur sa seule démo. Exigez un POC utilisant vos propres séquences de magasin, vos conditions d'éclairage et vos incidents historiques comme ground truth.
  • Construisez une scorecard de RFP qui pondère la précision avec le coût des faux positifs, l'effort d'intégration et la conformité : la précision seule donne une image incomplète.
  • Comprenez la différence entre precision et recall avant toute conversation avec un fournisseur. Demandez la matrice de confusion complète, pas un pourcentage d'accroche.
  • Menez les POC sur au moins 60 à 90 jours dans des magasins représentatifs (pas vitrines), et auditez manuellement un échantillon des résultats déclarés par le fournisseur.
  • Vérifiez tôt si le système utilise la reconnaissance faciale ou uniquement la détection comportementale, car cela change votre exposition réglementaire au titre de textes comme le BIPA de l'Illinois ou le RGPD.