Von alternative data zu Alpha-Signalen
# Von alternative data zu Alpha-Signalen
Ein aus dem Weltraum gezählter Parkplatz erzählte eine stille Geschichte, noch bevor die Quartalszahlen kamen. Mitte der 2010er Jahre begannen Hedgefonds, Satellitenbilder von Einzelhändler-Parkplätzen zu kaufen, Autos Woche für Woche zu zählen und daraus die Kundenfrequenz vor den Quartalsumsätzen abzuleiten. Die Desks, die das gut machten, hatten einen Read auf den Umsatz, bevor der Markt ihn hatte. Das ist das Versprechen von alternative data: Informationen, die nicht in den üblichen Finanzberichten stehen, umgewandelt in einen handelbaren Edge.
Diese Lektion zeigt, wie ein Long/Short-Equity-Desk (ein Fonds, der Aktien kauft, von denen ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → steigende Kurse erwartet, und Aktien short verkauft, von denen ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → fallende Kurse erwartet) unsaubere Rohdaten in ein Signal verwandelt: einen numerischen Score, der Aktien nach erwarteter Rendite rankt. Der schwierige Teil sind nicht die Daten. Es ist das Vermeiden der Fallen, die ein Signal im Backtest brillant und live wertlos aussehen lassen.
Was als alternative data gilt
Alternative data ist jeder Datensatz außerhalb der traditionellen Quellen (Finanzberichte, Analystenschätzungen, Kurs und Volumen). Gängige Kategorien:
- Geospatial: Satelliten- und Luftbilder, Zählung von Autos, Schiffen, Schatten von Öltanks oder Pflanzengesundheit.
- Transaction panels: aggregierte, anonymisierte Kredit- und Debitkartenausgaben als Proxy für die Umsätze eines Unternehmens.
- Web- und App-Daten: täglich gescrapte Preisseiten, App-Download-Rankings, Stellenausschreibungen.
- Text: Transkripte von Earnings Calls, regulatorische Filings, News, ausgewertet mit NLP (natural language processing, Software, die Bedeutung aus Sprache extrahiert).
Die Ökosysteme von FactSet und Eagle Alpha katalogisieren tausende solcher Anbieter. Eine solide Einführung in die Kategorie bietet die CFA Institute overview of alternative data.
Rohdaten in Features verwandeln
Ein Feature ist ein einzelner messbarer Input, zum Beispiel „Wachstum der Kartenausgaben für Unternehmen X in dieser Woche gegenüber dem Vorjahr“. Drei kurze Beispiele, wie aus jeder Rohquelle ein Feature wird.
Kreditkarten-Panels
Sie sehen nie einzelne Transaktionen. Der Anbieter liefert aggregierte Ausgaben je Händler. Sie mappen Händler auf börsennotierte Ticker (ein nicht trivialer Schritt: „SBUX“ umfasst tausende Store-Marken und Franchisenehmer) und berechnen dann das wöchentliche Wachstum gegenüber dem Vorjahr. Das Feature: kartenimpliziertes Umsatzwachstum gegenüber dem gleichen Quartal des Vorjahres.
Satellitenbilder
Ein Computer-Vision-Modell zählt Autos auf den Parkplätzen eines Einzelhändlers über hunderte Standorte. Sie normalisieren nach Standort und Saison (Dezember sieht völlig anders aus als Februar) und aggregieren dann zu einem Index auf Unternehmensebene. Das Feature: Veränderung des Traffic-Index gegenüber dem gleitenden Durchschnitt.
NLP auf Earnings Calls
Sie ziehen das Transkript, trennen die Ausführungen des Managements von der Analysten-Q&A und bewerten den Tonfall. Ein einfacher Ansatz nutzt ein finanzspezifisches Sentiment-Lexikon. Ein moderner Ansatz nutzt ein Language Model, um Unsicherheit, Ausweichen und Themenwechsel zu bewerten.
# Simplified: sentiment delta on an earnings-call transcript
from transformers import pipeline
clf = pipeline("sentiment-analysis", model="ProsusAI/finbert")
remarks = [
"Demand accelerated across all regions this quarter.",
"We are seeing some softness we cannot yet fully quantify.",
]
scores = clf(remarks)
# Feature = mean(positive) - mean(negative), dann Vergleich mit der
# Baseline des vorherigen Calls desselben Unternehmens, NICHT mit einem absoluten Schwellenwert.Der Vergleich mit der eigenen früheren Baseline des Unternehmens ist wichtig. Manche Management-Teams sind chronisch optimistisch. Ein Signal, das auf absolutem Tonfall aufbaut, rankt nur Persönlichkeiten.
Die drei Fallen, die die Live-Performance zerstören
Hier scheitern die meisten Alt-Data-Projekte still. Ein Backtest (Simulation einer Strategie auf historischen Daten) kann spektakulär aussehen und trotzdem eine Illusion sein.
Falle 1: Lookahead bias
Lookahead bias bedeutet, im Backtest Informationen zu nutzen, die Sie in diesem Moment im echten Leben nicht gehabt hätten. Es ist der häufigste und fatalste Fehler.
Konkret: Ein Datenanbieter „stempelt“ einen Kartenausgaben-Datensatz mit dem Transaktionsdatum. Aber dieser Datensatz wurde erst zwei Wochen später an die Abonnenten geliefert. Wenn Ihr Backtest auf das Transaktionsdatum hin handelt, traden Sie auf Daten aus der Zukunft.
Die Lösung: Point-in-time-Daten verwenden, die festhalten, was zu jedem Datum bekannt war, inklusive Lieferverzögerung. Fragen Sie einen Anbieter immer: „Wie hoch ist die Lieferlatenz, und kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Sie Point-in-time-Snapshots bereitstellen?“ Wenn ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → das nicht kann, gehen Sie vom Worst Case aus.
Dieselbe Falle bei Fundamentaldaten: Ein Unternehmen kann Ergebnisse Monate später korrigieren. Ein Backtest auf der korrigierten Zahl leakt die Zukunft.
Falle 2: Data-Snooping (multiple testing)
Data-Snooping passiert, wenn Sie so viele Varianten testen, dass eine rein durch Zufall großartig aussieht. Testen Sie 200 Signalformeln, und einige werden starke historische Renditen zeigen, selbst wenn alle nur Rauschen sind.
Die Lösung:
- Legen Sie Ihre Hypothese vor dem Testen fest. „Kartenausgaben laufen dem gemeldeten Umsatz voraus“ ist eine Hypothese. „Welche Kombination auch immer am besten scort“ ist Snooping.
- Reservieren Sie eine Out-of-sample-Periode (Daten, die das Modell während der Entwicklung nie berührt hat) für einen einzigen finalen Test.
- Korrigieren Sie um die Anzahl der Versuche. Praktiker nutzen die deflated Sharpe ratio, die die scheinbare Qualität einer Strategie danach bestraft, wie viele Strategien getestet wurden. Siehe die work of Marcos Lopez de Prado zu Backtest-Overfitting.
Falle 3: Survivorship und Coverage Bias
Wenn Ihr Kartenpanel nur Unternehmen abdeckt, die noch existieren, und die übergeht, die bankrott gegangen sind, erbt Ihr Backtest eine rosige Stichprobe. Dasselbe gilt, wenn der Satellitenanbieter einen heißen Einzelhändler erst aufgenommen hat, nachdem ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → populär wurde. Prüfen Sie immer, wann jeder Name in den Datensatz gekommen ist.
🎬 [VIDEO: "Backtesting and the Dangers of Overfitting" - youtube.com - eine klare Darstellung, wie multiple testing Backtest-Ergebnisse aufbläht und wie man sich dagegen schützt]
Das Signal bauen und validieren
Sind die Features sauber und point-in-time, ist der Workflow diszipliniert.
Schritt 1: Features zu einem Score kombinieren. Ranken Sie Aktien jede Woche nach, sagen wir, kartenimpliziertem Wachstum plus Veränderung des Satelliten-Traffics plus Delta des Call-Tonfalls. Rangbasierte Scores sind robuster als Rohwerte, weil sie Ausreißern widerstehen.
Schritt 2: Das Offensichtliche neutralisieren. Ein Rohsignal wettet oft nur auf Sektoren oder Größe. Wenn alle Ihre top-gerankten Namen Small-Cap-Einzelhändler sind, haben Sie eine Sektorwette, keinen Alt-Data-Edge. Desks neutralisieren Exposures, indem sie innerhalb des Sektors ranken und um die Marktkapitalisierung adjustieren, sodass das verbleibende Signal aktienspezifisch ist.
Schritt 3: Realistisch simulieren. Berücksichtigen Sie Transaktionskosten, Leihkosten für Shorts und Turnover. Ein Signal, das täglich handeln muss, kann von Kosten aufgefressen werden. Modellieren Sie den Market Impact Ihrer eigenen Trades.
Schritt 4: Decay messen. Alt-Data-Edges erodieren, je mehr Fonds die gleichen Daten kaufen. Testen Sie, ob das Signal in den letzten Jahren schwächer geworden ist. Der Parkplatz-Trade ist heute weit überlaufener als vor einem Jahrzehnt.
Schritt 5: Out-of-sample und Paper Trading. Lassen Sie das finalisierte Signal auf zurückgehaltenen Daten laufen und traden Sie es dann live auf Papier, bevor Sie Kapital einsetzen.
Wissenscheck
1. Was ist laut der Lektion die grundlegende Herausforderung dabei, alternative data in ein profitables Alpha-Signal zu verwandeln?
2. Was beschreibt die Definition eines „Signals“ im Sinne dieser Lektion am besten?
3. Ein Satellit, der Autos auf Einzelhändler-Parkplätzen zählt, um die Kundenfrequenz vor den Quartalszahlen abzuleiten, ist vor allem deshalb wertvoll, weil er Informationen liefert, die:
4. Wählen Sie ALLE richtigen Antworten. Welche der folgenden würden laut der Lektion als alternative data eingeordnet?
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE richtigen Antworten zum Verhältnis von Rohdaten, Features und Signalen im Framework dieser Lektion.
Wählen Sie alle richtigen Antworten aus.
Governance, Compliance und Kosten
Alt-Data ist nicht nur ein Quant-Problem. Es bringt rechtliche und Reputationsrisiken mit sich.
Material nonpublic information (MNPI). Aufsichtsbehörden verbieten den Handel auf Basis von MNPI (wichtige Informationen, die der Öffentlichkeit nicht zugänglich sind). Wenn das Panel eines Kartenanbieters so granular ist, dass es faktisch die internen Umsatzzahlen eines Unternehmens offenlegt, kann seine Nutzung eine Grenze überschreiten. Seriöse Anbieter aggregieren und anonymisieren, um davon wegzubleiben. Jeder Datensatz sollte eine Rechtsprüfung durchlaufen.
Personenbezogene Daten. Karten- und Location-Panels kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Datenschutzregeln berühren. Daten müssen so aggregiert sein, dass Einzelpersonen nicht identifizierbar sind. Die Provenienz zählt: Wie wurde die Einwilligung eingeholt, und erfolgte das Scraping im Rahmen der Nutzungsbedingungen einer Website.
Kosten versus Kapazität. Alt-Data ist teuer, und ein einzelner Datensatz kann jährlich einen sechsstelligen Betrag kosten. Ein Signal rechtfertigt diese Kosten nur, wenn es bei der Fondsgröße funktioniert. Ein brillantes Signal, das nur bei Positionen von wenigen Millionen Dollar funktioniert, ist für einen großen Fonds irrelevant.
Die Guidance und Enforcement-Historie der SEC zu alternative data und Expert Networks lohnt die Beobachtung; das SEC newsroom veröffentlicht MaMaUsing software to automate repetitive marketing tasks and campaigns, enabling personalisation at scale across channels like email, web, and social.Vollständige Definition ansehen →ßnahmen, die prägen, was Desks als akzeptabel ansehen.
Ein realistisches Bild des Edge
Die meisten einzelnen Alt-Data-Signale sind schwach. Ein einzelnes Signal hat vielleicht einen niedrigen Information Coefficient (eine Korrelation zwischen prognostizierten und tatsächlichen Renditen, oft im niedrigen einstelligen Prozentbereich). Der Wert entsteht daraus, viele schwache, unkorrelierte Signale in einem Portfolio zu kombinieren, und aus disziplinierter Ausführung. Es gibt keinen einzelnen Datensatz, der Geld druckt, und jedes Desk, das das verspricht, verkauft eine Geschichte.
Key Takeaways
- Alternative data wird erst dann zu Alpha, wenn sie bereinigt, auf Ticker gemappt und in point-in-time Features umgewandelt ist, die gegen die eigene Baseline jedes Unternehmens verglichen werden.
- Lookahead bias ist die tödlichste Falle: Modellieren Sie immer die reale Lieferverzögerung und nutzen Sie Point-in-time-Snapshots, nie revidierte oder zukunftsgestempelte Daten.
- Schützen Sie sich gegen Data-Snooping, indem Sie Hypothesen vorab festlegen, eine Out-of-sample-Periode zurückhalten und Ergebnisse um die Anzahl der getesteten Strategien bestrafen.
- Neutralisieren Sie Sektor- und Größen-Exposures und rechnen Sie realistische Kosten ein, sonst halten Sie eine Beta-Wette für einen echten Edge.
- Behandeln Sie Compliance (MNPI, Datenschutz, Provenienz) und Kosten versus Kapazität als Designrestriktionen erster Ordnung, nicht als Nachgedanken.