Scoping, Daten und Erfolgskriterien
# Scoping, Daten und Erfolgskriterien
Ein Team hat einmal sechs Wochen damit verbracht, ein KI-Tool zum Auslesen von Rechnungen zu bauen. In Demos funktionierte es hervorragend. Dann traf es auf echte Rechnungen: eingescannte Belege, Währungen in drei Formaten, ein Lieferant, der Datumsangaben als „3.4.26“ schrieb. Niemand hatte festgelegt, was „funktioniert“ bedeutet, also konnte niemand sagen, ob das Tool fertig war. Es kam zu spät und wurde dann zurückgezogen.
In dieser Lektion geht es darum, das zu vermeiden. Bevor Sie eine Zeile Code oder einen einzigen Prompt schreiben, entscheiden Sie zwei Dinge: wie „gut“ aussieht (Ihre Erfolgskriterien) und welche Daten Sie tatsächlich haben. Wir ziehen ein Beispiel durchgehend durch: ein Tool zur Rechnungsextraktion.
Der Fehler, den fast alle machen
Die meisten starten ein KI-Projekt mit der Lösung: „Nutzen wir GPT, um unsere Rechnungen zu lesen.“ Das ist der falsche erste Schritt.
Beginnen Sie stattdessen mit dem Outcome. Ein Outcome ist das Ergebnis, das Sie in der Realität wollen, schlicht formuliert:
> „Wir wollen aufhören, Rechnungssummen manuell in unser Buchhaltungssystem zu tippen. Eine Person verbringt damit 4 Stunden pro Tag.“
Beachten Sie: Von KI ist hier keine Rede. Das ist gut. Jetzt kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Sie fragen: Was müsste KI tun, um das zu lösen, und woran würden wir erkennen, dass es funktioniert?
Scoping: das Problem so weit verkleinern, bis es konkret ist
Scoping heißt, eine enge Grenze um genau das zu ziehen, was Ihr Tool tun und nicht tun wird. Ein breiter Scope killt Projekte. Ein enger Scope bringt sie live.
Unklarer Scope: „Alle unsere Rechnungen automatisch verarbeiten.“
Enger Scope: „Fünf Felder (Lieferantenname, Rechnungsnummer, Datum, Summe, Währung) aus PDF-Rechnungen unserer Top-20-Lieferanten, auf Englisch, in eine Tabelle übertragen.“
Die enge Variante ist diese Woche baubar. Sie benennt die Felder (die konkreten Datenpunkte, die Sie wollen), das Input-Format (PDF) und die Grenze (Top-20-Lieferanten, nur Englisch). Alles außerhalb dieser Grenze ist ein „später“-Problem, und das laut auszusprechen ist Teil der Aufgabe.
Schreiben Sie auf, was außerhalb des Scopes liegt
Seien Sie bei Ausschlüssen explizit. Für das Rechnungstool:
- Handschriftliche Rechnungen: raus.
- Andere Sprachen als Englisch: vorerst raus.
- Mehrseitige Rechnungen mit Positionstabellen: raus für v1.
Ausschlüsse aufzuschreiben verhindert das schleichende Ausufern, wenn jemand fragt „kann es nicht auch noch diesen einen seltsamen Fall abdecken?“ und das Projekt aufbläht.
Erfolgskriterien: „gut“ als Zahl definieren
Die Regel lautet: Was Sie nicht messen können, können Sie nicht abschließen.
„Rechnungen korrekt lesen“ ist kein Erfolgskriterium. Das ist ein Wunsch. Machen Sie daraus etwas Zählbares.
> Erfolgskriterium: Das Tool extrahiert mindestens 95 % der Felder korrekt über ein Test-Set von 100 echten Rechnungen.
Jetzt hat „fertig“ eine Definition. Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen das Tool laufen lassen, die richtigen Antworten zählen und eine Zahl bekommen. Unter 95 %: weiterarbeiten. Bei oder über 95 %: ausliefern.
Wie Sie die Zahl wählen
Erfinden Sie die 95 % nicht aus der Luft. Verankern Sie sie in der Realität:
- Wie ist die menschliche Baseline? Wenn ein müder Mitarbeiter um 17 Uhr 97 % der Felder richtig tippt, liegt Ihre Messlatte in dieser Gegend.
- Was kostet ein Fehler? Ein falscher Lieferantenname ist ärgerlich. Eine falsche Summe von 40.000 $ ist ein Desaster. Bei Feldern mit hohem Risiko wollen Sie vielleicht ein strengeres Ziel.
Das führt zu einem klügeren Kriterium, das gewichtet, was wichtig ist:
> 99 % korrekt bei Summe und Währung, 95 % beim Rest, und jede Extraktion mit niedriger Confidence wird zur menschlichen Prüfung markiert.
Der letzte Teil ist wichtig. Ein Tool, das sagt „bei dieser bin ich unsicher“, ist weit sicherer als eines, das selbstbewusst rät. Bauen Sie diese Markierung von Anfang an ein.
Legen Sie fest, wie Sie messen, bevor Sie bauen
Sie brauchen ein Test-Set: eine feste Sammlung echter Beispiele, bei denen ein Mensch die korrekten Antworten eingetragen hat. Das ist Ihr Lösungsschlüssel.
Für das Rechnungstool heißt das: 100 echte Rechnungen nehmen und die fünf korrekten Felder für jede manuell in einer Tabelle erfassen. Ja, von Hand. Das ist langweilig und es ist die wertvollste Stunde des ganzen Projekts. Ohne das raten Sie.
Der Google „People + AI Guidebook“ hat einen klaren, kostenlosen Abschnitt zum Definieren von Erfolg und Reward-Funktionen für KI-Produkte, falls Sie tiefer einsteigen wollen.
Prüfen Sie Ihre Daten, bevor Sie ihnen vertrauen
Jetzt die zweite Hälfte: Daten. Ihr KI-Tool ist nur so gut wie das, was Sie ihm geben. Prüfen Sie vor dem Bauen, was Sie tatsächlich haben.
Öffnen Sie 30 echte Rechnungen und schauen Sie hin. Theoretisieren Sie nicht. Schauen Sie hin. Sie finden jedes Mal Überraschungen:
- 12 sind saubere digitale PDFs.
- 9 sind Scans, leicht schief, einer steht auf dem Kopf.
- 5 sind Fotos, mit dem Handy aufgenommen.
- 3 nutzen ein Datumsformat, mit dem Sie nicht gerechnet haben.
- 1 ist die „Rechnung“ eines Lieferanten, tatsächlich aber eine weitergeleitete E-Mail.
Diese fünf Minuten haben Ihr Projekt gerade neu geformt. Handyfotos und Scans brauchen einen anderen Verarbeitungspfad als saubere PDFs. Die auf dem Kopf stehende Rechnung wird scheitern, wenn Sie es nicht einplanen.
Drei Fragen zu jedem Datensatz
1. Ist er repräsentativ? Entsprechen Ihre 30 Stichproben dem, was das Tool in Produktion sieht? Wenn Sie nur mit sauberen PDFs testen, aber 40 % der echten Rechnungen Scans sind, ist Ihr 95-%-Wert eine Lüge.
2. Ist er gelabelt? Haben Sie die korrekten Antworten (die „Labels“) zum Abgleichen? Wenn nicht, ist das Ihre erste Aufgabe.
3. Ist er erlaubt? Dürfen Sie diese Daten rechtlich und ethisch an einen KI-Dienst geben? Rechnungen enthalten Lieferantennamen, Bankdaten, manchmal personenbezogene Informationen. Prüfen Sie, ob Sie sie an eine externe APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen → senden dürfen oder ob sie im Haus bleiben müssen.
Dieser dritte Punkt ist 2026 real. Tools wie ChatGPT, Claude und Gemini bieten Business-Tarife, die nicht auf Ihren Daten trainieren, kostenlose Consumer-Tarife tun das möglicherweise. Wissen Sie, welchen Sie nutzen, bevor Sie die Finanzunterlagen eines Kunden hochladen.
Wissenscheck
1. Was ist laut Lektion der richtige erste Schritt beim Start eines KI-Projekts?
2. Warum argumentiert die Lektion, dass ein enger Scope Projekten hilft und ein breiter ihnen schadet?
3. Warum wird „Rechnungen korrekt lesen“ in der Lektion als Erfolgskriterium verworfen?
4. Wählen Sie ALLE Elemente aus, die eine gute, enge Scope-Formulierung laut Lektion enthalten sollte.
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE Gründe aus, die die Lektion dafür nennt, aufzuschreiben, was explizit außerhalb des Scopes liegt.
Wählen Sie alle richtigen Antworten aus.
Alles zusammensetzen: ein erster lauffähiger Test
Sobald Sie Scope, eine Erfolgszahl und ein geprüftes Test-Set haben, ist Ihr erster Build winzig: Ein paar Rechnungen durch ein Modell laufen lassen und schauen, wie nah Sie landen. Moderne Modelle wie Claude und Gemini nehmen ein Dokument und einen Prompt direkt an, der „Code“ ist also vor allem eine klare Anweisung.
Hier ein minimales Beispiel mit der Anthropic APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen →. Es fragt die Felder als strukturierte Daten (JSON) zurück, was das Scoring gegen Ihren Lösungsschlüssel einfach macht.
import anthropic, json
client = anthropic.Anthropic() # nutzt Ihren API-Key aus der Umgebung
prompt = """Extract these fields from the invoice text below.
Return ONLY valid JSON with keys: vendor, invoice_number, date, total, currency.
If a field is missing or unclear, use null. Do not guess.
INVOICE TEXT:
{invoice_text}
"""
invoice_text = "ACME Corp Invoice #4471 Date: 12 Jan 2026 Total: 1,250.00 USD"
msg = client.messages.create(
model="claude-sonnet-4-5",
max_tokens=300,
messages=[{"role": "user", "content": prompt.format(invoice_text=invoice_text)}],
)
result = json.loads(msg.content[0].text)
print(result)
# {'vendor': 'ACME Corp', 'invoice_number': '4471',
# 'date': '2026-01-12', 'total': 1250.00, 'currency': 'USD'}Zwei Design-Entscheidungen tragen hier die Lektion:
- „Do not guess.“ Das schiebt das Modell in Richtung
nullstatt selbstbewusster Falschantworten, was Ihre Markierung für die menschliche Prüfung speist. - Strukturierter JSON-Output. Weil die Antwort als benannte Felder zurückkommt, kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Sie sie automatisch mit Ihrem Lösungsschlüssel in der Tabelle vergleichen und diese 95-%-Zahl berechnen.
Scoring gegen Ihren Lösungsschlüssel
Die Scoring-Schleife zählt einfach Treffer:
def score(predicted, correct):
fields = ["vendor", "invoice_number", "date", "total", "currency"]
hits = sum(1 for f in fields if predicted.get(f) == correct[f])
return hits / len(fields)
# Über alle 100 Test-Rechnungen laufen lassen, die Scores mitteln.
# Dieser Mittelwert IST Ihre Erfolgsmetrik.Lassen Sie es über alle 100 laufen, mitteln Sie die Ergebnisse, und Sie haben eine ehrliche Zahl. Jetzt kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Sie entscheiden: den Prompt verbessern, Scans separat behandeln oder ausliefern.
🎬 [VIDEO: „How to Evaluate LLMLLMA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen → Outputs“ - youtube.com - ein praktischer Durchgang zum Aufbau eines kleinen Test-Sets und zum Messen der Modellgenauigkeit, bevor Sie skalieren]
Das Mindset
Der ganze Punkt ist, Meinungen durch Evidenz zu ersetzen. „Fühlt sich ziemlich gut an“ wird zu „es erreicht 91 %, und alle Fehler sind Handyfotos“. Der zweite Satz sagt Ihnen genau, was als Nächstes zu beheben ist.
Gut definieren, Daten prüfen, das kleinste Ding bauen, das eine Zahl produziert, dann verbessern. Jedes ernsthafte KI-Projekt, vom Ein-Personen-Rechnungstool bis zum unternehmensweiten System, läuft auf dieser Schleife.
Key Takeaways
- Beginnen Sie mit dem Outcome, nicht mit dem Tool. Benennen Sie zuerst das Ergebnis in der Realität („keine Rechnungen mehr von Hand tippen“), dann entscheiden Sie, was KI dafür leisten muss.
- Scope eng ziehen und Ausschlüsse aufschreiben. Fünf Felder aus englischen PDFs Ihrer Top-20-Lieferanten geht diese Woche live. „Alle Rechnungen“ geht nie live.
- Machen Sie „gut“ zu einer Zahl mit einem Test-Set. 100 echte Beispiele von Hand labeln, dann dagegen messen. „95 % der Felder korrekt, Summe und Währung bei 99 %“ ist eine Ziellinie, „korrekt“ ist keine.
- Prüfen Sie Daten, indem Sie sie ansehen. Öffnen Sie 30 echte Stichproben, bevor Sie bauen. Prüfen Sie, ob sie repräsentativ, gelabelt und im gewählten KI-Tool rechtlich zulässig sind.
- Fordern Sie strukturierten Output und „don't guess“. JSON-Felder machen das Scoring automatisch, und das Markieren von Fällen mit niedriger Confidence zur menschlichen Prüfung hält teure Fehler aus der Produktion.
Was Sie aus dieser Lektion umsetzen
Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.
- 100 echte Beispiele von Hand labeln und dagegen bewerten
- Scope eng halten und Ausschlüsse explizit festhalten
- Sehen Sie sich dreißig echte Datensätze an, bevor Sie irgendetwas bauen
Verwandte Artikel
Aktuelle Blogartikel, die auf dieser Lektion aufbauen.
- KIWer beim AI ROI wirklich liefert: ein Feldführer zu den VorreiternDie meisten Diskussionen über AI ROI erzeugen mehr Hitze als Licht: Vendor-Case-Studies werden mit echten Durchbrüchen vermischt und das Ergebnis nennt man dann Insight. Dieser Feldführer zeigt, welche Unternehmen, Forscher und Meilensteine sich tatsächlich lohnen, wenn Sie verstehen wollen, was echte Erträge von teuren Experimenten trennt.
- KIKI-Systeme vor dem Deployment auf Bias und Fairness testen: ein praxisnahes PlaybookEin KI-System ohne strukturiertes Bias-Testing auszurollen, ist wie Software ohne QA zu shippen: Die Bugs findet man in der Produktion, nur betreffen die Bugs hier Menschen. Dieses Playbook geht die konkreten Schritte durch, die Tools und die Fehler, die Teams in Schwierigkeiten bringen.
- KIWie Klarna die Triage im Kundenservice in einen dauerhaften KI-Workflow überführt hatKlarna hat einen seiner volumenstärksten und repetitivsten Bereiche rund um einen KI-Agenten neu aufgebaut, statt KI auf einen bestehenden Prozess aufzusetzen. Die getroffenen Entscheidungen, und die anfangs falschen, sind eine praxistaugliche Vorlage für jedes Team mit einem ähnlichen Problem.