Datenqualität bewerten mit den Metriken, die Anbieter nicht bewerben
# Datenqualität bewerten mit den Metriken, die Anbieter nicht bewerben
Ein Rent Roll landet in Ihrem Postfach. 92 Einheiten, zwölf Spalten, formatiert im Hausstil von irgendjemandem. Es sieht sauber aus. Es ist nicht sauber. Bei drei Mietern liegt das Mietvertragsende in der Vergangenheit. Eine Einheit erscheint zweimal mit zwei verschiedenen Mieten. Die Spalte „last verified" ist bei einem Viertel der Zeilen leer. Niemand hat das markiert, bevor es ins Underwriting-Modell ging, weil niemand es bewertet hat. Genau diese Lücke schließt diese Lektion.
Anbieter verkaufen Ihnen Coverage: wie viele Grundstücke, wie viele Comps, wie viele Märkte. Sie verkaufen Ihnen selten die Qualitätsmetriken, die darüber entscheiden, ob diese Coverage nutzbar ist. Diese Lektion baut eine Scorecard, die Sie auf jedes Rent Roll, jedes Comp Set oder jedes Lease Abstract anwenden kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen, bevor es zum Input einer Bewertungs- oder Akquisitionsentscheidung wird.
Warum Datenqualität ein Immobilienproblem ist und nicht nur ein IT-Problem
Immobiliendaten sind von Natur aus fragmentiert. Grundstücksunterlagen liegen bei den County Recorder Offices. Mietverträge liegen in PDFs und Property-Management-Systemen wie Yardi oder RealPage. Comps kommen von Maklern, CoStar oder Gerichtsakten. Nichts zwingt diese Quellen dazu, miteinander übereinzustimmen.
Das Ergebnis: Bewertungsmodelle laufen regelmäßig auf Daten, die niemand formal bewertet hat. Eine Cap-Rate-Annahme, die auf fünf „vergleichbaren" Transaktionen aufbaut, ist nur so gut wie die Frage, ob diese Transaktionen tatsächlich vergleichbar, aktuell und korrekt zugeordnet waren. Cap Rate meint hier das Verhältnis des Net Operating Income einer Immobilie zum Kaufpreis, ein Bewertungsinput, nicht der Gegenstand dieser Lektion. Uns interessieren die Daten, die hineinfließen, nicht die Kennzahl selbst.
Die vier Metriken, die zählen
Completeness
Completeness misst den Anteil der erforderlichen Felder, die tatsächlich gefüllt sind, also nicht leer, null oder Platzhaltertext wie „TBD".
Bei einem Rent Roll gehören zu den erforderlichen Feldern typischerweise: Unit-ID, Quadratmeterzahl, Mietbeginn/-ende, aktuelle Miete, Mietername und Flags für Verlängerungsoptionen. Ein Rent Roll, bei dem 15 % der Einheiten kein Mietvertragsende ausweisen, ist nicht zu 85 % zuverlässig, es ist für die Analyse von Lease Rollover unbrauchbar, bis es korrigiert ist, denn Rollover-Risiko ist genau das, was diese fehlenden Felder offenlegen würden.
Einfache Formel:
Completeness % = (Gefüllte Felder / Erforderliche Felder) × 100Rechenbeispiel: Ein Rent Roll mit 90 Einheiten braucht 8 Felder pro Einheit = 720 Felder insgesamt. Sind 648 gefüllt, beträgt die Completeness 648/720 = 90 %. In der Praxis gilt bei Kernfeldern des Underwriting alles unter 95 % Completeness üblicherweise als manuell nachzubearbeiten, auch wenn die Schwellenwerte je Haus variieren.
Freshness
Freshness misst, wie alt die Daten zum Zeitpunkt der Entscheidung sind. Ein Comp Set, das vor sechs Monaten gezogen wurde, ist in einem Markt, in dem die Mieten in diesem Zeitraum um 8 % gestiegen sind, veraltet, selbst wenn es bei der Erfassung völlig korrekt war.
Freshness ist je Datentyp unterschiedlich relevant:
- Rent Rolls: sollten für aktives Underwriting in der Regel nicht älter als 30 bis 60 Tage sein.
- Comp Sets: 90 Tage sind in stabilen Märkten ein gängiger Arbeitswert, in dynamischen Märkten enger.
- Öffentliche Register (Steuerbewertungen, Eigentum): kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen ihrer Natur nach 6 bis 18 Monate hinterherlaufen; das ist eine inhärente Grenze, kein Qualitätsmangel, muss aber markiert werden.
Metrik: Alter in Tagen seit der letzten Verifizierung, pro Datensatz, nicht pro Datei. Eine Datei „per Januar" kann immer noch einzelne Positionen enthalten, die zuletzt vor einem Jahr angefasst wurden.
Lineage
Lineage heißt, einen Datenpunkt zu seinem Ursprung zurückverfolgen zu kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen: wer hat ihn erfasst, aus welcher Quelle, wann, und welche Transformationen sind unterwegs passiert. Das ist die Metrik, die Anbieter am wenigsten bewerben, weil sie offenlegt, wie viel ihrer „proprietären" Daten tatsächlich aus öffentlichen Registern, Maklermeldungen oder gescrapten Inseraten unbekannter Zuverlässigkeit aggregiert ist.
Fragen Sie bei jedem Comp: Ist das eine abgeschlossene Transaktion aus einem öffentlichen Grundbucheintrag, eine Angebotspreisschätzung eines Maklers oder eine selbst gemeldete Zahl aus einer Umfrage? Das ist nicht austauschbar. Die Uniform Standards of Professional Appraisal Practice (USPAP) verlangen von Gutachtern genau aus diesem Grund die Dokumentation der Datenquellen: nicht überprüfbare Lineage untergräbt die gesamte Bewertung.
Ein Lineage Score kann so einfach sein wie ein dreistufiges Tag pro Datensatz:
1. Verifizierte Primärquelle (eingetragene Urkunde, geprüftes Rent Roll)
2. Verifizierte Sekundärquelle (Maklerbestätigung, Steuerakte)
3. Nicht verifiziert oder selbst gemeldet (Umfrageantwort, gescraptes Inserat)
Match-Rate
Match-Rate misst, wie gut Datensätze aus verschiedenen Quellen mit demselben zugrunde liegenden Objekt verknüpft werden. Das ist der stille Killer bei Immobiliendaten, weil Adressen unsauber sind: „123 Main St Unit 4B", „123 Main Street, Apt 4B" und „123 Main St #4B" kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen alle dieselbe Einheit bezeichnen und trotzdem an einem exakten String-Join scheitern.
Match-Rate ist kritisch, wenn man ein Rent Roll gegen einen Export aus dem Property Management zusammenführt oder ein Comp Set über Parcel IDs gegen die Unterlagen des County Assessor abgleicht.
# Vereinfachte Prüfung der Match-Rate
matched = df_source_a.merge(
df_source_b, on="parcel_id", how="inner"
)
match_rate = len(matched) / len(df_source_a) * 100
print(f"Match rate: {match_rate:.1f}%")Eine Match-Rate unter rund 90 % zwischen zwei Quellen, die dasselbe Portfolio beschreiben, sollte eine Untersuchung auslösen und nicht die Annahme, dass 10 % in der anderen Quelle einfach „nicht existierten". Oft bedeutet es inkonsistente Parcel IDs, zusammengelegte oder geteilte Einheiten oder fehlgeschlagene Adressnormalisierung.
Die Scorecard bauen
Fassen Sie die vier vor dem Modellieren zu einer Arbeitsnote pro Datensatz zusammen:
| Metrik | Gewicht (Beispiel) | Schwelle für „pass" |
|---|---|---|
| Completeness | 30 % | ≥ 95 % Kernfelder |
| Freshness | 25 % | ≤ 60 Tage (Rent Roll) |
| Lineage | 25 % | ≥ 80 % Quellen Tier 1 oder 2 |
| Match-Rate | 20 % | ≥ 90 % quellenübergreifend |
Die Gewichte sind illustrativ, nicht allgemeingültig; passen Sie sie daran an, worauf das nachgelagerte Modell am empfindlichsten reagiert. Ein Discounted-Cash-Flow-Modell ist hochempfindlich gegenüber der Freshness von Mietdaten; ein Risikoscreening auf Portfolioebene kann Lineage stärker gewichten.
Bewerten Sie jede Metrik von 0 bis 100, multiplizieren Sie mit dem Gewicht, summieren Sie. Alles, was insgesamt unter 70 liegt, sollte korrigiert und nicht modelliert werden.
Wissenscheck
1. Warum beschreibt die Lektion Datenqualität als spezifisches Immobilienproblem und nicht als rein IT-Thema?
2. Ein Rent Roll hat 92 Einheiten, und bei 15 % der Zeilen fehlt das Mietvertragsende. Was legt die Lektion dazu nahe, das einfach als „85 % complete" zu melden?
3. Warum unterscheidet die Lektion die Cap Rate (die Bewertungskennzahl) von den Datenqualitätsmetriken, die sie vermittelt?
4. Wählen Sie ALLE richtigen Antworten dazu, warum ein nicht markiertes Rent Roll (wie im Eingangsbeispiel) ein Risiko für das Underwriting darstellt.
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE richtigen Antworten dazu, was „Completeness" als Datenqualitätsmetrik tatsächlich erfasst.
Wählen Sie alle richtigen Antworten aus.
Wo das in der Praxis kippt
Drei typische Fehlermuster, die man benennen sollte:
Silent Overwrite. Ein Property Manager aktualisiert ein Rent Roll monatlich, aber der Dateiname ändert sich nie und es gibt keine Versionshistorie. Freshness sieht gut aus; Lineage ist faktisch kaputt, weil Sie nicht belegen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen, welche Version in das Modell des letzten Quartals eingeflossen ist.
Comp Contamination. Ein Comp Set mischt abgeschlossene Verkäufe mit aktiven Inseraten, ohne Status-Flag. Inserate sind Angebotspreise, keine Transaktionspreise, das verzerrt Durchschnitte erheblich, wenn es nicht markiert ist. Das ist gleichzeitig ein Lineage- und ein Completeness-Fehler.
False Match Confidence. Zwei Datensätze fügen sich sauber mit einer Match-Rate von 98 % zusammen, aber der Join Key (etwa die Straßenadresse) hat in einem Markt mit doppelten Straßennamen über Submärkte hinweg stillschweigend das falsche Gebäude getroffen. Hohe Match-Rate-Werte kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen falsche Matches verdecken, nicht nur fehlende. Prüfen Sie immer eine Stichprobe manuell.
🎬 [VIDEO: „Data QualityData QualityThe degree to which data is fit for purpose: accurate, complete, consistent, timely, valid and unique. Poor quality data undermines analytics, reporting and AI.Vollständige Definition ansehen → Fundamentals" - youtube.com/results?search_query=data+quality+fundamentals+completeness+freshness - suchen Sie nach aktuellen Erklärinhalten zu Completeness, Timeliness und Lineage, die branchenübergreifend anwendbar sind, da immobilienspezifische Videos zu genau diesem Framework selten sind]
Eine Anmerkung zu Benchmarks und Ehrlichkeit
Es gibt keine einzelne, allgemein zitierte branchenweite Benchmark-Datenbank, die „durchschnittliche Completeness-Scores für US-Rent-Rolls" veröffentlicht. Häuser bauen interne Schwellenwerte (wie oben gezeigt) auf Basis der eigenen Modellsensitivität und Risikotoleranz. Seien Sie skeptisch bei jedem Anbieter oder Kurs, der hier einen harten externen Benchmark behauptet; die ehrliche Antwort ist, dass diese Schwellenwerte weitgehend hausspezifisch sind und dokumentiert, getestet und überprüft werden sollten, statt sie als feste Industriestandards zu behandeln.
Gut belegt ist dagegen: Regulatorische Rahmenwerke wie USPAP für die Bewertung und in Europa die Bewertungsstandards der Royal Institution of Chartered Surveyors (RICS) verlangen dokumentierte Datenherkunft und Verifizierungsschritte. Das sind Governance-Anforderungen, keine Qualitäts-Scores im engeren Sinn, aber sie verstärken dieselbe Disziplin: Kennen Sie Ihre Quelle, kennen Sie ihr Alter, kennen Sie Ihre Match Confidence, bevor Sie dem Output vertrauen.
Key Takeaways
- Bewerten Sie Daten vor dem Modellieren in vier Dimensionen: Completeness (sind die Felder gefüllt), Freshness (wie alt sind sie), Lineage (kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Sie die Quelle zurückverfolgen), Match-Rate (verknüpft sie korrekt über Datensätze hinweg).
- Completeness unter 95 % bei Kernfeldern des Underwriting oder Freshness jenseits von 60 bis 90 Tagen je nach Datentyp sollte eine Korrektur auslösen, keine Annahme.
- Lineage-Tiers (verifizierte Primärquelle, verifizierte Sekundärquelle, nicht verifiziert) legen offen, wie viel „proprietäre" Anbieterdaten tatsächlich aggregierte öffentliche oder selbst gemeldete Informationen sind.
- Hohe Match-Rate-Prozentwerte kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen falsche Matches verbergen, nicht nur fehlende; prüfen Sie immer Stichproben manuell.
- Es gibt keinen universellen externen Benchmark für diese Schwellenwerte; bauen und dokumentieren Sie hausspezifische Standards, statt einer behaupteten Branchennorm zu vertrauen.