+150 XP

Noter la qualité des données avec les métriques que les vendors ne mettent pas en avant

Un rent roll arrive dans votre boîte mail. Quatre-vingt-douze lots, douze colonnes, mis en forme selon le style maison de quelqu'un. Ça a l'air propre. Ça ne l'est pas. Trois locataires affichent des dates de fin de bail dans le passé. Un lot apparaît deux fois avec deux loyers différents. La colonne « dernière vérification » est vide pour un quart des lignes. Personne ne l'a signalé avant que le fichier atteigne le modèle d'underwriting, parce que personne ne le notait. C'est l'écart que cette leçon vient combler.

Les vendors vous vendent de la couverture : combien de parcelles, combien de comps, combien de marchés. Ils vous vendent rarement les métriques de qualité qui déterminent si cette couverture est exploitable. Cette leçon construit une scorecard applicable à n'importe quel rent roll, comp set ou lease abstract avant qu'il ne devienne un input d'une décision de valorisation ou d'acquisition.

Pourquoi la qualité des données est un problème immobilier, pas seulement un problème IT

La donnée immobilière est fragmentée par construction. Les actes de propriété sont dans les registres des comtés. Les baux sont dans des PDF et des systèmes de property management comme Yardi ou RealPage. Les comps viennent des brokers, de CoStar ou des dépôts au tribunal. Rien n'oblige ces sources à concorder entre elles.

Résultat : les modèles de valorisation tournent couramment sur des données que personne n'a formellement notées. Une hypothèse de cap rate construite sur cinq transactions « comparables » ne vaut que dans la mesure où ces transactions étaient réellement comparables, à jour et correctement attribuées. Cap rate désigne ici le rapport entre le revenu net d'exploitation d'un actif et son prix d'acquisition, un input de valorisation, pas le sujet de cette leçon. Ce qui nous intéresse, c'est la donnée qui l'alimente, pas le ratio lui-même.

Les quatre métriques qui comptent

Complétude

La complétude mesure la part des champs requis effectivement renseignés, ni vides, ni nuls, ni remplis d'un texte de substitution du type « TBD ».

Pour un rent roll, les champs requis comprennent généralement : identifiant du lot, surface, début/fin de bail, loyer actuel, nom du locataire et indicateurs d'option de renouvellement. Un rent roll auquel manquent les dates de fin de bail sur 15 % des lots n'est pas fiable à 85 %, il est inutilisable pour une analyse de rollover des baux jusqu'à correction, parce que le risque de rollover est précisément ce que ces champs manquants révéleraient.

Formule simple :

Complétude % = (Champs renseignés / Champs requis) × 100

Exemple chiffré : un rent roll de 90 lots exige 8 champs par lot = 720 champs au total. Si 648 sont renseignés, la complétude = 648/720 = 90 %. La pratique du secteur considère généralement que tout ce qui est en dessous de 95 % de complétude sur les champs d'underwriting cœur exige une remédiation manuelle avant usage, même si les seuils varient selon les maisons.

Fraîcheur

La fraîcheur mesure l'ancienneté de la donnée par rapport au moment où la décision est prise. Un comp set extrait il y a six mois dans un marché où les loyers ont bougé de 8 % sur cette période est périmé, même s'il était parfaitement exact au moment de la capture.

La fraîcheur ne joue pas de la même façon selon le type de donnée :

  • Rent rolls : ne devraient généralement pas dépasser 30 à 60 jours pour un underwriting actif.
  • Comp sets : 90 jours est un seuil de travail courant sur des marchés stables, plus resserré sur des marchés rapides.
  • Registres publics (évaluations fiscales, propriété) : peuvent accuser un retard de 6 à 18 mois par nature ; c'est une limite inhérente, pas un défaut de qualité, mais elle doit être signalée.

Métrique : ancienneté en jours depuis la dernière vérification, par enregistrement, pas par fichier. Un fichier « arrêté à janvier » peut contenir des lignes individuelles dont la dernière mise à jour date d'un an.

Lineage

Le lineage, c'est la capacité à remonter une donnée jusqu'à son origine : qui l'a saisie, depuis quelle source, quand, et quelles transformations elle a subies en route. C'est la métrique que les vendors mettent le moins en avant, parce qu'elle expose la part de leur donnée « proprietary » qui est en réalité agrégée depuis des dépôts publics, des soumissions de brokers ou des annonces scrapées de fiabilité inconnue.

Posez la question pour chaque comp : s'agit-il d'une transaction conclue issue d'un acte public, d'une estimation de prix affiché par un broker, ou d'un chiffre auto-déclaré dans une enquête ? Ce ne sont pas des équivalents. Les Uniform Standards of Professional Appraisal Practice (USPAP) exigent des évaluateurs qu'ils documentent leurs sources de données précisément pour cette raison : un lineage invérifiable sape toute la valorisation.

Un score de lineage peut être aussi simple qu'un tag à trois niveaux par enregistrement :

  1. Source primaire vérifiée (acte enregistré, rent roll audité)
  2. Source secondaire vérifiée (confirmation broker, avis fiscal)
  3. Non vérifiée ou auto-déclarée (réponse d'enquête, annonce scrapée)

Match-rate

Le match-rate mesure la qualité du rapprochement entre des enregistrements de sources différentes portant sur le même actif sous-jacent. C'est le tueur silencieux de la donnée immobilière, parce que les adresses sont sales : « 123 Main St Unit 4B », « 123 Main Street, Apt 4B » et « 123 Main St #4B » peuvent désigner le même lot tout en échouant à une jointure sur chaîne exacte.

Le match-rate est critique quand on fusionne un rent roll avec un export de property management, ou quand on réconcilie un comp set avec les registres du cadastre du comté via les parcel IDs.

python
# Contrôle simplifié du match-rate
matched = df_source_a.merge(
    df_source_b, on="parcel_id", how="inner"
)
match_rate = len(matched) / len(df_source_a) * 100
print(f"Match rate: {match_rate:.1f}%")

Un match-rate inférieur à environ 90 % entre deux sources décrivant le même portefeuille doit déclencher une investigation, et non l'hypothèse que 10 % « n'existaient simplement pas » dans l'autre source. Souvent, cela signifie des parcel IDs incohérents, des lots fusionnés ou divisés, ou des échecs de normalisation d'adresses.

Construire la scorecard

Combinez les quatre en une note de travail unique par jeu de données, avant modélisation :

MétriquePoids (exemple)Seuil de « validation »
Complétude30 %≥ 95 % des champs cœur
Fraîcheur25 %≤ 60 jours (rent roll)
Lineage25 %≥ 80 % de sources Tier 1 ou 2
Match-rate20 %≥ 90 % inter-sources

Les poids sont illustratifs, pas universels ; ajustez-les selon ce à quoi le modèle en aval est le plus sensible. Un modèle de discounted cash flow est très sensible à la fraîcheur des données de loyer ; un screening de risque au niveau portefeuille pondérera peut-être davantage le lineage.

Notez chaque métrique de 0 à 100, multipliez par le poids, sommez. Tout ce qui obtient moins de 70 au global doit être corrigé, pas modélisé.

Vérification des acquis

1. Pourquoi la leçon décrit-elle la qualité des données comme un problème spécifiquement immobilier plutôt que comme une simple question d'IT ?

2. Un rent roll compte 92 lots et il manque les dates de fin de bail sur 15 % des lignes. Qu'implique la leçon quant au fait de rapporter cela simplement comme « 85 % complet » ?

3. Pourquoi la leçon distingue-t-elle le cap rate (le ratio de valorisation) des métriques de qualité de données qu'elle enseigne ?

CHOIX MULTIPLES

4. Sélectionnez TOUTES les bonnes réponses expliquant pourquoi un rent roll non contrôlé (comme celui de l'exemple d'ouverture) fait courir un risque à l'underwriting.

Sélectionnez toutes les réponses correctes.

CHOIX MULTIPLES

5. Sélectionnez TOUTES les bonnes réponses sur ce que la métrique de « complétude » capture réellement.

Sélectionnez toutes les réponses correctes.

Où cela déraille en pratique

Trois schémas d'échec courants qu'il vaut la peine de nommer :

Écrasement silencieux. Un property manager met à jour un rent roll chaque mois, mais le nom du fichier ne change jamais et aucun historique de versions n'existe. La fraîcheur semble correcte ; le lineage est en réalité cassé, parce que vous ne pouvez pas prouver quelle version a alimenté le modèle du trimestre dernier.

Contamination des comps. Un comp set mélange des ventes conclues et des annonces actives sans indicateur de statut. Les annonces sont des prix affichés, pas des prix de transaction, ce qui biaise sensiblement les moyennes si ce n'est pas signalé. C'est simultanément un défaut de lineage et de complétude.

Fausse confiance dans le matching. Deux jeux de données fusionnent proprement avec un match-rate de 98 %, mais la clé de jointure (disons l'adresse) a silencieusement rapproché le mauvais immeuble dans un marché où des noms de rue se répètent d'un submarket à l'autre. Un match-rate élevé peut masquer de mauvais rapprochements, pas seulement des rapprochements manquants. Contrôlez un échantillon à la main, toujours.

🎬 [VIDEO: "Data Quality Fundamentals" - youtube.com/results?search_query=data+quality+fundamentals+completeness+freshness - cherchez du contenu explicatif récent sur les notions de complétude, de timeliness et de lineage applicables à tous les secteurs, les vidéos spécifiquement immobilières sur ce framework précis étant rares]

Une remarque sur les benchmarks et l'honnêteté

Il n'existe pas de base de benchmarks sectorielle unique et universellement citée qui publierait des « scores moyens de complétude des rent rolls américains ». Les maisons construisent des seuils internes (comme ci-dessus) à partir de la sensibilité de leurs propres modèles et de leur tolérance au risque. Méfiez-vous de tout vendor ou de tout cours prétendant à un benchmark externe ferme ici ; la réponse honnête, c'est que ces seuils sont largement propres à chaque maison et qu'ils doivent être documentés, testés et réexaminés, pas traités comme des standards sectoriels figés.

Ce qui est bien établi : des cadres réglementaires comme les USPAP pour l'expertise et, en Europe, les standards de valorisation de la Royal Institution of Chartered Surveyors (RICS) exigent des étapes documentées de sourcing et de vérification des données. Ce sont des exigences de gouvernance, pas des scores de qualité à proprement parler, mais elles renforcent la même discipline : connaître sa source, connaître son ancienneté, connaître sa confiance de matching, avant de faire confiance au résultat.

Points clés à retenir

  • Notez la donnée sur quatre dimensions avant de modéliser : complétude (les champs sont-ils renseignés), fraîcheur (quelle ancienneté), lineage (peut-on remonter à la source), match-rate (le rapprochement inter-jeux est-il correct).
  • Une complétude inférieure à 95 % sur les champs d'underwriting cœur, ou une fraîcheur au-delà de 60 à 90 jours selon le type de donnée, doit déclencher une remédiation, pas une hypothèse.
  • Les niveaux de lineage (primaire vérifié, secondaire vérifié, non vérifié) exposent la part de la donnée « proprietary » des vendors qui est en réalité de l'information publique agrégée ou auto-déclarée.
  • Des pourcentages de match-rate élevés peuvent cacher de mauvais rapprochements, pas seulement des rapprochements manquants ; contrôlez toujours des échantillons à la main.
  • Il n'existe pas de benchmark externe universel pour ces seuils ; construisez et documentez des standards propres à votre maison plutôt que de faire confiance à une norme sectorielle revendiquée.