Model Evaluation
Auch: Model Assessment, AI Model Evaluation, Model Validation, Évaluation de modèle, Modellbewertung, Modell-Evaluierung, Model Benchmarking
Der Prozess, der misst, ob ein KI-Modell gut und sicher genug für die vorgesehene Geschäftsentscheidung arbeitet.
Was es ist
Model Evaluation ist die disziplinierte Prüfung, wie gut ein KI- oder statistisches Modell seine Aufgabe erfüllt, vor und nach dem Produktivbetrieb. Es beantwortet eine Frage: können wir diesem Modell genug vertrauen, um auf seinen Ergebnissen zu handeln? Ein Modell, das abwanderungsgefährdete Kunden markiert, ein Preismodell, ein Sprachmodell, das Kunden-E-Mails entwirft: jedes wird an Belegen gemessen, nicht am Versprechen des Anbieters. Die Bewertung vergleicht die Vorhersagen des Modells mit bekannten korrekten Ergebnissen und beziffert die Lücke.
Warum es wichtig ist
Ein Modell, das in der Demo beeindruckt, kann bei Ihren echten Daten still versagen, und die Kosten trägt das Geschäft, nicht das Datenteam. Ein Kreditmodell, das insgesamt präzise, aber für ein Kundensegment falsch ist, erzeugt zugleich Umsatzverlust und regulatorisches Risiko. Für einen CFO trennt die Bewertung eine belastbare Prognose für das Board von einer Vermutung. Für einen CMO entscheidet sie, ob ein Lead-Scoring-Modell das Werbebudget wert ist, das es umlenkt. Die Bewertung deckt auch Verzerrungen, Drift (das Modell verschlechtert sich, weil sich die Welt ändert) und Halluzinationen generativer Werkzeuge auf. Wer sie überspringt, erfährt vom Scheitern durch Kunden oder eine Aufsichtsbehörde.
Wie es funktioniert
Das Team hält einen Teil der Daten zurück, den das Modell im Training nie gesehen hat, und testet das Modell darauf. Die Ergebnisse kommen als Kennzahlen: Genauigkeit, Präzision, Trefferquote, Fehlerraten, oder bei Sprachmodellen Bewertungen anhand kuratierter Fragensätze und menschlicher Prüfung. Die richtige Kennzahl hängt von den geschäftlichen Kosten eines Fehlers ab, daher muss die Führungskraft sagen, welcher Fehler am meisten schmerzt. Einen Betrugsfall zu übersehen und einen treuen Kunden zu markieren sind keine gleichwertigen Fehler. Die Bewertung läuft nach dem Start durch Monitoring weiter, da die Leistung mit der Zeit abnimmt. In der Praxis fragt ein CDO vor der Freigabe dreierlei: wogegen wurde es getestet, wie verhält es sich bei unserem schlechtesten Segment, und woran erkennen wir, dass es nicht mehr funktioniert.