LLMOps & Evaluation
Die Demo, die durchlief, und das Produkt, das scheiterte
Anfang 2024 verlor Air Canada ein Verfahren vor einem Bagatellgericht, das jeden CDO erschrecken sollte, der generative KI pilotiert. Ein trauernder Passagier fragte den Chatbot auf der Website der Airline nach Trauerfalltarifen. Der Bot erfand selbstbewusst eine Regelung, die nicht existierte, teilte dem Kunden mit, ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önne die Erstattung rückwirkend beantragen, und das Gericht machte die Airline für die Aussagen ihres Bots haftbar. Der Chatbot hatte seine interne Demo mit fast völliger Sicherheit bestanden. ErErThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → antwortete flüssig. ErErThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → klang hilfreich. ErErThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → lag falsch, und zwar auf eine Weise, die niemand getestet hatte.
Das ist die zentrale Täuschung von LLMLLMA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen →-Systemen: Sprachliche Flüssigkeit gibt sich als Korrektheit aus. Ein klassisches Modell, das eine Transaktion falsch klassifiziert, scheitert laut und messbar. Ein LLMLLMA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen → scheitert *überzeugend*. Es produziert eine selbstbewusste, grammatikalisch einwandfreie, plausible Antwort, die subtil oder katastrophal falsch ist, und es tut das nicht-deterministisch, sodass derselbe Prompt am Dienstag durchgeht und am Donnerstag scheitert.
Sie wissen bereits, wie man MLOpsMLOpsMachine Learning Operations: combining ML and DevOps practices to industrialise, deploy, monitor, and retrain models reliably in production.Vollständige Definition ansehen → für einen Classifier aufsetzt: Modell versionieren, Drift monitoren, nach Zeitplan neu trainieren. Dieses Playbook lässt sich nicht sauber übertragen. LLMOpsLLMOpsMachine Learning Operations: combining ML and DevOps practices to industrialise, deploy, monitor, and retrain models reliably in production.Vollständige Definition ansehen → ist eine andere Disziplin, weil die Failure Modes andere sind, die Inputs unbegrenzte natürliche Sprache sind und die „Ground Truth“ häufig eine Frage des Urteils ist. Der schwierige Teil Ihres GenAI-Programms ist nicht, den Piloten zu bauen. Es ist, nachzuweisen, dass dem Piloten vertraut werden kann, und die Maschinerie aufzubauen, die diesen Nachweis nach dem Launch fortlaufend erbringt. Diese Maschinerie macht diese Lektion konkret.
Warum die Evaluation der Engpass ist, nicht das Modell
Der Instinkt der meisten Teams ist, sich auf Modellauswahl und Prompt EngineeringPrompt EngineeringPrompt engineering is the practice of designing and refining text inputs to guide large language models toward accurate, relevant, and reliable outputs.Vollständige Definition ansehen → zu fixieren. Das ist die sichtbare, spaßige Arbeit. Aber der Grund, warum 80 % der GenAI-Piloten vor der Produktion steckenbleiben, ist, dass niemand einen glaubwürdigen Weg gebaut hat, die Frage zu beantworten, die Ihr Board stellen wird: *„Woher wissen wir, dass es funktioniert?“*
Überlegen Sie, was „funktioniert“ für einen Retrieval-augmented Support-Assistenten überhaupt bedeutet. Es gibt mindestens vier verschiedene Dimensionen, und sie stehen in Zielkonflikt zueinander:
- Korrektheit, Ist die Antwort faktisch richtig, gegeben Ihre Quelldokumente?
- Groundedness (Faithfulness), Bleibt die Antwort im abgerufenen Kontext verankert, oder halluziniert sie darüber hinaus?
- Relevanz, Beantwortet sie tatsächlich, was der Nutzer gefragt hat?
- Safety/Compliance, Vermeidet sie verbotene Inhalte, PII-Leakage oder unbefugte Beratung?
Eine einzelne Accuracy-Zahl kann das nicht erfassen. Und anders als bei einem Classifier kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Sie diese Dimensionen nicht per einfachem Label-Vergleich berechnen, denn es gibt keinen einzigen korrekten String. „Ihre Erstattung wird in 5-7 Werktagen bearbeitet“ und „Rechnen Sie mit der Erstattung innerhalb einer Woche“ sind beide korrekt.
Deshalb teilt die Disziplin die Evaluation in zwei Regime, und ein CDO muss beide finanzieren:
Offline-Evaluation läuft gegen ein kuratiertes, versioniertes Eval-Set, bevor irgendetwas ausgeliefert wird. Online-Evaluation misst das Verhalten gegen echten, unvorhersehbaren Produktions-Traffic. Teams, die nur Offline-Evaluation machen, werden von Queries überrascht, die sie sich nie vorgestellt haben. Teams, die nur online monitoren, fliegen ohne Pre-flight-Check. Sie brauchen beides, und sie nutzen unterschiedliches Tooling.
Bauen Sie das Golden Eval Set zuerst, vor dem Piloten
Das Artefakt mit der höchsten Hebelwirkung in Ihrem gesamten GenAI-Programm ist nicht das Modell. Es ist das Golden Evaluation Set: eine kuratierte Sammlung repräsentativer Inputs, gepaart mit erwarteten Verhaltensweisen, abgestuften Kriterien und bekannten Edge Cases. Das ist ein Datenasset, das Ihnen gehört, das Wettbewerber nicht kaufen kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen und das über Zeit an Wert gewinnt.
Ein ernstzunehmendes Eval-Set sind nicht 20 Fragen, die ein Engineer an einem Freitag getippt hat. Es sollte bewusst zusammengestellt werden:
1. Echte Intents erschließen. Ziehen Sie tatsächliche historische Queries, Support-Tickets, Suchlogs, Agent-Transkripte. Wenn Sie vor dem Launch stehen, lassen Sie sie von Fachexperten schreiben. Stratifizieren Sie nach Häufigkeit, damit häufige Fälle korrekt gewichtet sind.
2. Den Tail bewusst übergewichten. Die Fehler, die juristisches und Reputationsrisiko erzeugen, sitzen in den Edge Cases: adversariale Prompts, ambige Fragen, Anfragen außerhalb des Scopes („Kann ich medizinische Beratung bekommen?“) und Prompt-Injection-Versuche.
3. Abgestufte Erwartungen hinterlegen, nicht nur Antworten. Legen Sie für jedes Item fest, was eine gute Antwort enthalten muss, nicht enthalten darf und wie sie sich verhalten soll (z. B. „muss Policy-Quelle zitieren“, „muss ablehnen und eskalieren“).
4. Wie Code versionieren. Das Eval-Set liegt in Ihrem Repository, wird bei Änderungen reviewt, und jedes Modell- oder Prompt-Release wird gegen eine gepinnte Version gescored, damit Sie Äpfel mit Äpfeln vergleichen.
Ein praktikables Ziel: 200-500 kuratierte Items für einen ersten Produktionspiloten, kontinuierlich wachsend, während die Produktion neue Failure Modes zutage bringt. Jeder reale Fehler wird zu einem neuen permanenten Testfall. So verzinst sich das Asset.
Bewertung im MaMaUsing software to automate repetitive marketing tasks and campaigns, enabling personalisation at scale across channels like email, web, and social.Vollständige Definition ansehen →ßstab: LLMLLMA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen →-as-judge, ehrlich eingesetzt
Das offensichtliche Problem: Wer bewertet 500 offene Antworten jedes Mal, wenn Sie einen Prompt anpassen? Manuelles Review skaliert nicht auf die Iterationsgeschwindigkeit, die Sie brauchen. Die inzwischen etablierte Antwort ist LLM-as-judge: ein starkes Modell scored die Outputs gegen Ihre Kriterien.
Das funktioniert, aber nur, wenn Sie dem Judge mit derselben Skepsis begegnen wie jedem anderen Messinstrument. Der Judge selbst hat Biases: ErErThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → bevorzugt längere Antworten, ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → präferiert Antworten, die seinem eigenen Stil entsprechen, und ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → lässt sich austricksen. Die Disziplin besteht darin, den Judge gegen menschliche Labels zu kalibrieren. Lassen Sie Ihre SMEs eine Stichprobe von einigen hundert Outputs manuell bewerten und messen Sie dann, wie gut Ihr LLMLLMA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen →-Judge mit ihnen übereinstimmt. Ist die Übereinstimmung zwischen Judge und Mensch hoch, kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen Sie ihm zum Skalieren vertrauen. Ist sie niedrig, muss Ihr Judge-Prompt nachgearbeitet werden, bevor Sie sich darauf verlassen.
Ein Judge-Prompt sollte eine rubrikbasierte, strukturierte Entscheidung erzwingen statt eines vagen Qualitätsgefühls:
You are evaluating a support answer for GROUNDEDNESS.
Context provided to the assistant:
{retrieved_context}
User question: {question}
Assistant answer: {answer}
Score groundedness 1-5:
5 = every claim is directly supported by the context
1 = answer contains claims not present in the context
Return JSON: {"score": int, "unsupported_claims": [..], "reasoning": "..."}Beachten Sie: Das zwingt den Judge, nicht gestützte Behauptungen zu *enumerieren*. Diese Struktur verbessert die Genauigkeit und liefert Ihrem Team debugbaren Output, Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen sehen, *warum* etwas niedrig gescored wurde, nicht nur dass es so war.
Evaluating LLM-based Applications
Guardrails: die Runtime-Schicht zwischen Modell und Nutzer
Evaluation sagt Ihnen, wie sich das System in der Aggregation verhält. Guardrails sind die Echtzeit-Kontrollen, die jede einzelne Antwort einschränken, bevor sie einen Nutzer erreicht oder auf ein System wirkt. Denken Sie an Evaluation als Ihren Qualitätsprozess und an Guardrails als Ihre Sicherungen.
Guardrails greifen an zwei Punkten, und ausgereifte Systeme nutzen beide:
Input-Guardrails prüfen, was ins Modell geht: Erkennung von Prompt Injection („ignoriere deine Anweisungen und …“), Filterung von PII, bevor sie eine Drittanbieter-APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen → erreicht, und Klassifikation, ob eine Anfrage überhaupt im Scope liegt. Eine medizinische Frage außerhalb des Scopes an einen Banking-Bot sollte hier abgefangen und nicht beantwortet werden.
Output-Guardrails prüfen, was zurückkommt: Abgleich auf Halluzination gegen die abgerufenen Quellen, Blockieren toxischer oder nicht-konformer Inhalte, Verifikation des Antwortformats und, kritisch für regulierte Branchen, die Durchsetzung, dass bestimmte Antworten Disclaimer enthalten oder eine Eskalation an Menschen auslösen.
Die architektonische Entscheidung, die ein CDO treffen muss, ist, wo die Verantwortung liegt. Lassen Sie nicht zu, dass Applikations-Engineers einen Regex-Filter selbst zusammenbauen und das Governance nennen. Guardrails sollten eine gemeinsame, zentral verantwortete Service-Schicht sein, damit Ihre Policy zum Umgang mit PII oder zur Ablehnung medizinischer Beratung einmal definiert und über jede GenAI-Anwendung im Unternehmen hinweg konsistent durchgesetzt wird. Das ist der Punkt, an dem Ihr bestehendes Governance-Mandat zu ausführbarem Code wird. Die Policy, die Ihr Governance Council schreibt, muss auf ein Guardrail abbilden, das jemand durchsetzen und auditieren kann.
Hier ist die Abwägung, über die Teams stolpern: Guardrails erzeugen Latenz und Kosten, denn jeder Check ist oft ein weiterer Modellaufruf. Ein aggressives Output-Validierungs-Guardrail kann Ihre Antwortzeit verdoppeln. Sie werden explizite Trade-offs machen: leichtgewichtige Checks bei jedem Request und teure Verifikation nur bei Intents mit hohem Risiko. Dieses Risiko-Tiering ist eine CDO-Entscheidung, kein nachträglicher Gedanke des Engineering.
Wissenscheck
1. Was ist laut der Lektion die „zentrale Täuschung“ von LLM-Systemen, die sie in der Produktion gefährlich macht?
2. Warum argumentiert die Lektion, dass traditionelle MLOps-Praktiken sich nicht sauber auf LLMOps übertragen lassen?
3. Die Lektion behauptet, die meisten GenAI-Piloten bleiben vor der Produktion stecken. Was wird als der eigentliche Engpass benannt?
4. Wählen Sie ALLE unterschiedlichen Evaluationsdimensionen aus, die die Lektion für einen Retrieval-augmented Support-Assistenten nennt.
Wählen Sie alle richtigen Antworten aus.
5. Wählen Sie ALLE Aussagen aus, die laut der Lektion korrekt wiedergeben, wie sich LLM-Fehler von Fehlern klassischer Classifier unterscheiden.
Wählen Sie alle richtigen Antworten aus.
Monitoring: Vertrauen ist eine Runtime-Eigenschaft, kein Launch-Meilenstein
Die gefährlichste Annahme in GenAI ist, dass das Bestehen der Offline-Evaluation dauerhaftes Vertrauen verdient. Tut es nicht. LLMLLMA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen →-Systeme degradieren auf Weisen, wie Classifier es nicht tun. Ihr Anbieter aktualisiert stillschweigend das zugrunde liegende Modell. Nutzerverhalten verschiebt sich und liefert plötzlich Queries, die Ihr Eval-Set nie abgedeckt hat. Ihr eigener Retrieval-Korpus veraltet, weil Dokumente sich ändern. Ein System, das beim Launch 92 % erzielte, kann ohne eine einzige Codeänderung auf Ihrer Seite unmerklich auf 70 % driften.
Produktions-Monitoring ist also keine optionale Telemetrie, es ist der Mechanismus, über den Vertrauen *aufrechterhalten* wird. Ein CDO sollte darauf bestehen, dass der Monitoring-Stack vier Schichten erfasst:
- System-Metriken, Latenz (besonders Time-to-First-TokenTokenA token is the basic unit of text that language models process, often a word fragment, whole word, or punctuation mark rather than a single character.Vollständige Definition ansehen →, die die wahrgenommene Qualität treibt), Kosten pro Query, Throughput, Fehlerraten. GenAI-Kosten sind variabel und kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen ausschlagen; unbeobachtet kann eine einzige fehlerhafte Integration an einem Wochenende einen sechsstelligen Betrag verbrennen.
- Qualitätssignale, eine rollierende Stichprobe von Produktionsantworten, die Ihr LLMLLMA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen →-Judge gegen dieselben Rubriken scored, die offline verwendet werden. So erkennen Sie Drift.
- Guardrail-Auslöseraten, wie oft jedes Guardrail greift. Ein plötzlicher Anstieg blockierter Prompt Injections bedeutet, dass Sie angegriffen werden; ein Anstieg von „out-of-scope“-Ablehnungen bedeutet, dass Nutzer etwas wollen, was Sie nicht anbieten, und das ist Produktintelligenz.
- Nutzerfeedback, Thumbs up/down, Eskalationsrate an Menschen, Abbruch von Konversationen. Die Eskalationsrate ist oft Ihr ehrlichster Qualitäts-Proxy.
Die operative Disziplin, die das zusammenhält, ist ein Feedback Loop: jeder markierte Produktionsfehler wird triagiert, und die echten Fehler werden ins Golden Eval Set übernommen. Das ist das Schwungrad. Ihr Eval-Set wird genau dort reicher, wo die Realität gezeigt hat, dass Sie falsch lagen, und das nächste Release wird gegen genau den Fehler getestet, der Sie letztes Mal blamiert hat. Ein GenAI-Programm ohne diesen Loop ist kein Produkt; es ist eine Demo auf geliehene Zeit.
Der Arbeitsrhythmus, den ein CDO installieren muss
Konkret ist das die Kadenz, die Sie aufsetzen sollten, bevor ein Pilot in Produktion geht:
- Pre-Deployment-Gate: Kein Release geht raus, ohne gegen das gepinnte Golden Eval Set gescored zu werden und einen definierten Schwellenwert in jeder Dimension zu erreichen, Korrektheit, Groundedness, Safety. Dieses Gate ist nicht verhandelbar und hat eine namentlich benannte Verantwortung.
- Canary-Rollout: Neue Modelle oder Prompts gehen zuerst auf einen kleinen Traffic-Anteil, wobei Online-Qualitäts-Scores gegen den Bestand verglichen werden, bevor voll ausgerollt wird. Behandeln Sie einen Modellwechsel wie ein Code-Deploy, denn genau das ist ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen →.
- Wöchentliches Quality Review: Ein fester Termin, in dem Product, Data und Risk die Drift-Metriken, Guardrail-Auslöseraten und neu aufgenommenen Eval-Fälle durchgehen. Hier wird Degradation gefangen, bevor ein Kunde sie fängt.
- Incident Playbook: Ein definierter Weg, eine Prompt- oder Modellversion in Minuten zurückzurollen, denn Sie *werden* ihn brauchen.
Die Organisationen, die bei Enterprise-GenAI gewinnen, sind nicht die mit den besten Modellen, alle mieten dieselben Frontier-Modelle. Sie gewinnen, weil sie die Evaluations- und Monitoring-Maschinerie gebaut haben, die schnelles *und sicheres* Iterieren erlaubt, wöchentliche Verbesserungen mit Zuversicht statt eines einmaligen Piloten mit Stoßgebet.
Wichtigste Erkenntnisse
1. Finanzieren Sie das Golden Eval Set vor dem Piloten. Es ist Ihr dauerhaftestes, sich verzinsendes Datenasset, 200-500 kuratierte, versionierte Fälle, die den riskanten Tail übergewichten. Kein Eval-Set, keine Produktion. Behandeln Sie es als Artefakt auf Board-Ebene, nicht als Nebentätigkeit im Engineering.
2. Vertrauen Sie nie einem unvalidierten Judge. LLMLLMA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen →-as-judge skaliert die Bewertung, aber kalibrieren Sie ihn zuerst gegen menschliche Labels und erzwingen Sie rubrikbasiertes, strukturiertes Scoring. Ein unkalibrierter Judge ist ein selbstbewusster Lügner, der einen anderen selbstbewussten Lügner misst.
3. Machen Sie Guardrails zu einem gemeinsamen Service, nicht zu Installationen pro App. Zentralisieren Sie Input- und Output-Kontrollen, damit Ihre Governance-Policy einmal durchgesetzt und überall auditiert wird, und tiern Sie die teuren Checks explizit nach Risiko gegen Latenz und Kosten.
4. Instrumentieren Sie Vertrauen als Runtime-Eigenschaft. Monitoren Sie die Schichten System, Qualität, Guardrail und Nutzerfeedback kontinuierlich; ein Score am Launch-Tag bedeutet drei Wochen später nichts mehr, sobald der Anbieter das Modell aktualisiert oder der Traffic sich verschiebt.
5. Schließen Sie den Loop oder verlieren Sie den Krieg. Jeder echte Produktionsfehler muss zu einem permanenten Eval-Fall werden. Dieses Schwungrad, nicht die Modellwahl, unterscheidet ein verteidigungsfähiges GenAI-Produkt von einer Demo auf geliehene Zeit.
Was Sie aus dieser Lektion umsetzen
Diese Maßnahmen sind im Playbook der Rolle zusammengefasst.
- Ein versioniertes Golden Eval Set finanzieren, bevor ein Pilot live geht
- GenAI-Guardrails als gemeinsamen Input-/Output-Service zentralisieren
Verwandte Artikel
Aktuelle Blogartikel, die auf dieser Lektion aufbauen.