D'où viennent réellement les données immobilières, et où elles se cassent
Un seul immeuble de bureaux à Dallas peut exister sous la forme de cinq « faits » légèrement différents en même temps : une surface dans le fichier du county assessor, une autre dans l'annonce CoStar, une troisième dans le système de property management, une quatrième dans le lease abstract du locataire, et une cinquième dans le dossier de prêt déposé dans une banque. Aucune n'est nécessairement fausse. Elles ont simplement été mesurées différemment, mises à jour à des moments différents, et jamais réconciliées. C'est dans cet écart que l'analytique immobilière déraille discrètement.
Cette leçon suit le parcours de données d'un actif de bout en bout, puis vous donne le vocabulaire pour repérer où il se dégrade.
Le parcours : un actif, cinq enregistrements
Imaginez un immeuble de bureaux de banlieue de 150 000 pieds carrés. Voici comment ses données sont crcrLe pourcentage de visiteurs ou de prospects qui réalisent une action attendue (achat, inscription, formulaire de contact), calculé en divisant les conversions par le nombre total d'opportunités.Voir la définition complète →éées puis recréées.
1. Registres du county assessor et du recorder. Les administrations locales enregistrent les actes de propriété, les transferts et les évaluations fiscales. Aux États-Unis, cela se joue à l'échelle du county et les formats sont extrêmement hétérogènes ; certains counties utilisent encore des PDF scannés de formulaires papier. L'équivalent européen est le registre foncier (par exemple HM Land Registry en Angleterre et au pays de Galles, ou le Grundbuch en Allemagne), globalement plus standardisé mais toujours national, pas paneuropéen. La surface y reflète souvent la « gross building area » évaluée, une définition fiscale, pas une définition locative.
2. Flux MLS (Multiple Listing Service). Les systèmes MLS ont été construits pour que les brokers résidentiels partagent leurs annonces de façon coopérative. L'immobilier commercial n'a pas d'équivalent unique ; la couverturecouvertureLe nombre de personnes uniques exposées à votre message sur une période donnée. Contrairement aux impressions, le reach compte chaque personne une seule fois, quel que soit le nombre d'expositions.Voir la définition complète → est fragmentée entre boards MLS commerciaux régionaux, systèmes propriétaires de brokerage et marketplaces comme Crexi ou LoopNet. La fraîcheur des données dépend entièrement du fait qu'un broker pense à mettre à jour le statut après la conclusion d'une transaction.
3. CoStar et autres plateformes de données commerciales. CoStar agrège annonces, comps, données de propriété et disponibilités via un mélange de flux sous licence, de soumissions de brokers et d'une importante équipe de recherche terrain qui appelle les immeubles pour vérifier l'occupation. Cette couche de vérification humaine est le moatmoatUn avantage durable sur les concurrents : une ressource, une capacité ou une position qu'ils ne peuvent pas répliquer facilement, et qui permet à une entreprise de dégager des rendements supérieurs à la moyenne dans la durée.Voir la définition complète → concurrentiel de CoStar, mais cela signifie que la « vérité » que vous voyez est en réalité « ce qu'un chercheur a confirmé pour la dernière fois », horodaté, pas nécessairement actuel. Les plateformes concurrentes (outils internes de Cushman & Wakefield, ceux de JLL, ou des entrants plus récents comme Reonomy et Cherre) puisent dans des ensembles de sources qui se recoupent sans être identiques.
4. Lease abstraction. Quand un bail est signé, quelqu'un (de plus en plus un outil d'IA, historiquement un paralegal ou un service d'abstraction externalisé) en extrait les termes clés : surface louable, paliers de loyer, options de renouvellement, refacturation des charges. Cela devient l'enregistrement opérationnel sur lequel s'appuie l'équipe d'asset management du propriétaire. C'est fréquemment le chiffre de surface le *plus* exact, et c'est celui qui est le moins visible pour les plateformes de données externes.
5. Le dossier de prêt. Les prêteurs et les évaluateurs puisent dans tout ce qui précède, puis ajoutent leur propre mesure (souvent selon les standards ANSI/BOMA ; BOMA est la Building Owners and Managers Association, qui publie la méthode standard de mesure des surfaces) pour l'underwriting.
Cinq enregistrements, cinq chiffres de surface plausibles, aucune source unique de vérité.
Où la duplication apparaît
La duplication survient quand le même événement sous-jacent est enregistré indépendamment par des systèmes qui ne se parlent pas.
- Un renouvellement de bail est saisi dans le système de property management *et* séparément déclaré à CoStar par le broker, parfois avec une date d'effet différente.
- Une vente est enregistrée au county recorder, puis à nouveau quelques jours ou semaines plus tard quand l'équipe de recherche de CoStar la confirme par téléphone, puis encore quand un broker la consigne manuellement comme « comp » dans son propre tracker.
- Le rapprochement d'adresses crée des doublons fantômes : « 500 N Main St » et « 500 North Main Street » peuvent être enregistrés comme deux actifs distincts dans un jeu de données s'ils ne sont pas normalisés.
La solution, dans les équipes data professionnelles, c'est l'entity resolution : rapprocher les enregistrements qui désignent le même actif réel malgré des orthographes, des IDs ou des formats différents, généralement à l'aide d'un identifiant unique. Aux États-Unis, certaines firmes utilisent le numéro de parcelle (APN, Assessor's Parcel Number) comme ancrage ; il n'existe pas d'identifiant universel d'immeuble équivalent à un ticker boursier.
Où le lag apparaît
Le lag est l'écart entre le moment où quelque chose se produit et le moment où votre jeu de données le reflète.
- Aux États-Unis, les rôles d'évaluation des counties sont généralement mis à jour une fois par an, parfois avec un lag de 6 à 18 mois entre un changement physique (une rénovation par exemple) et son apparition dans les registres fiscaux.
- Les données d'occupation et de disponibilité de CoStar ne sont fraîches que jusqu'au dernier appel de recherche ; une estimation courante veut que des variations significatives de la vacance commerciale mettent un à deux trimestres à remonter pleinement sur l'ensemble du marché.
- Les données MLS résidentielles sont comparativement rapides (souvent dans les 24 à 48 heures suivant un changement de statut) parce qu'elles sont pilotées par la transaction et que les brokers ont des obligations contractuelles de mise à jour rapide, imposées par les règles MLS locales.
Le lag compte surtout dans le benchmark. Si vous calculez un taux de vacance de sous-marché, vous faites la moyenne d'enregistrements avec des dates « as of » différentes déguisée en un seul chiffre.
Où les erreurs silencieuses apparaissent
Les erreurs silencieuses sont les dangereuses : aucun message d'erreur, aucun signal d'alerte, juste un chiffre faux traité comme correct.
- Incohérences d'unités. La surface louable (rentable square footage, qui inclut une part des parties communes) et la surface utile (usable square footage, uniquement l'espace du locataire) sont interverties sans que personne ne le remarque. Un écart de 10 à 15 % entre les deux est courant dans les immeubles de bureaux.
- Flags de statut périmés. Une annonce marquée « disponible » pour un espace loué il y a trois semaines mais jamais mis à jour.
- Différences de devises et de standards dans les portefeuilles transfrontaliers. Un actif européen mesuré selon les IPMS (International Property Measurement Standards, promus par la RICS, Royal Institution of Chartered Surveyors) comparé à un actif américain mesuré selon les standards BOMA, sans conversion.
- Biais du survivant dans les comp sets. Les ventes en difficulté ou les transactions off-market n'entrent souvent pas du tout dans CoStar ou les bases de comps publiques, ce qui tire discrètement le prix moyen au pied carré vers le haut.
Un framework de gouvernance rapide
La gouvernance des données en analytique immobilière repose généralement sur quatre contrôles :
- Lineage : pouvez-vous remonter un chiffre jusqu'à sa source d'origine et son horodatage ?
- Fraîcheur : quel est l'âge de cet enregistrement par rapport au moment où l'événement sous-jacent s'est produit ?
- Complétude : quel pourcentage des champs attendus est renseigné (une métrique de qualité de données courante est le « field completeness rate ») ?
- Réconciliation : quand deux sources se contredisent, existe-t-il une règle documentée désignant celle qui l'emporte ?
Un contrôle de complétude simple en pratique :
# métrique brute de complétude des champs pour un jeu de données de lease abstracts
required_fields = ["rsf", "start_date", "end_date", "base_rent", "tenant_name"]
completeness = df[required_fields].notna().mean().mean() * 100
print(f"Average field completeness: {completeness:.1f}%")Les équipes portefeuille fixent souvent un seuil interne (souvent cité informellement autour de 90 à 95 % de complétude) en dessous duquel un jeu de données est signalé pour revue manuelle avant d'alimenter les modèles de valorisation.
Vérification des acquis
1. Pourquoi un même immeuble peut-il légitimement afficher plusieurs chiffres de surface différents au fil de son parcours de données ?
2. Quelle est la raison de fond pour laquelle l'immobilier commercial n'a pas d'équivalent MLS aussi unifié que le MLS résidentiel ?
3. Le chiffre de « gross building area » d'un assessor fiscal diffère d'une définition locative de la surface principalement parce que :
4. Sélectionnez TOUTES les bonnes réponses sur les facteurs qui font diverger les enregistrements immobiliers entre les sources.
Sélectionnez toutes les réponses correctes.
5. Sélectionnez TOUTES les bonnes réponses sur les systèmes de registres de propriété décrits dans la leçon (county assessors / registres fonciers).
Sélectionnez toutes les réponses correctes.
Benchmarks à connaître
Quelques chiffres largement cités, en ordre de grandeur (à traiter comme des estimations, susceptibles d'évoluer) :
- Les données de transactions de l'immobilier commercial américain sont estimées à plus de 90 % de couverture pour les actifs de qualité institutionnelle dans les grandes métropoles, via des plateformes comme CoStar et Real Capital Analytics, mais la couverture chute nettement pour les transactions plus petites, privées ou off-market.
- L'exactitude de la lease abstraction par revue humaine manuelle est souvent citée autour de 95 à 98 % au niveau du champ ; les outils d'abstraction assistés par IA annoncent une exactitude similaire ou meilleure sur les champs standards mais nécessitent encore une QA humaine sur les clauses complexes (options de renouvellement, clauses de co-tenancy).
- Les données ESGESGCadre qui évalue une entreprise sur des critères environnementaux, sociaux et de gouvernance, utilisé par les investisseurs, régulateurs et acheteurs.Voir la définition complète → (Environmental, Social, Governance) au niveau de l'actif, comme le benchmark énergétique imposé par les lois municipales américaines de publication (par exemple la Local Law 84 de New York) ou les certificats de performance énergétique de l'UE, souffrent d'une conformité inégale ; des taux de reporting bien inférieurs à 100 % sont couramment documentés dans les audits municipaux, l'application variant selon les juridictions.
Pour un point de référence public et gratuit sur la législation américaine de benchmark et les données de publication énergétique au niveau des villes, voir le programme Building Energy Asset Score du US Department of Energy et les portails open-data comparables des villes.
🎬 [VIDEO: "How CoStar Collects Its Data" - youtube.com - cherchez le contenu explicatif de CoStar sur son processus de recherche et de vérification terrain, utile pour voir la couche humaine derrière les plateformes immobilières « big data »]
Points clés
- Chaque actif immobilier a plusieurs parcours de données parallèles (assessor, MLS, plateformes commerciales, lease abstracts, dossiers de prêt) rarement réconciliés en un enregistrement de référence unique.
- La duplication vient de la ressaisie indépendante du même événement ; le lag vient de cycles de mise à jour peu fréquents (rôles fiscaux annuels, vérification trimestrielle par la recherche) ; les erreurs silencieuses viennent des incohérences d'unités (rentable vs usable square footage, BOMA vs IPMS) et des flags de statut périmés.
- La gouvernance des données dans ce secteur repose sur quatre propriétés vérifiables : lineage, fraîcheur, complétude et règles de réconciliation.
- Traitez tout benchmark de marché (taux de vacance, moyenne de comps, prix au pied carré) comme un mélange d'enregistrements avec des dates as-of et des couvertures différentes, pas comme une mesure unique et propre.
- Avant de faire confiance à un jeu de données pour une valorisation ou un underwriting, demandez d'où vient chaque champ et quel est son âge, pas seulement ce que dit le chiffre.