KI-Agenten im Unternehmen: was scheitert, bevor es funktioniert
KI-Agenten kommen branchenübergreifend aus der Demo in den Produktivbetrieb, und genau zwischen beidem straucheln die meisten Organisationen. Zu verstehen, was tatsächlich schiefgeht und warum, bringt mehr als das nächste Architekturdiagramm.
Neo NeumannAI Practice Lead16. Juli 2026Podcast anhören
3 min
Ein Logistikunternehmen in Rotterdam hat acht Monate damit verbracht, einen KI-Agenten für die Lieferantenkommunikation und die Bearbeitung von Ausnahmen bei Bestellungen zu bauen. Im Test lief der Agent hervorragend. In der Produktion brach ererThe ratio of interactions (likes, comments, shares) to reach for a given piece of content, used to gauge how well audiences respond relative to how many people saw it.Vollständige Definition ansehen → innerhalb von zwei Wochen zusammen, nicht weil das Modell falsch war, sondern weil das ERP-System des Unternehmens je nach abgefragter Regionaldatenbank unterschiedliche Statuscodes zurückgab. Der Agent hatte keine Möglichkeit, eine echte Ausnahme von einem Artefakt der Datenformatierung zu unterscheiden, und niemand hatte diesen Edge Case vor dem Go-live erfasst.
Diese Geschichte ist 2026 kein Einzelfall. Sie ist in vieler Hinsicht die prägende Geschichte des Einsatzes von KI-Agenten im Unternehmen.
Was mit KI-Agenten tatsächlich passiert
Der Begriff „KI-Agent" ist im Vendor-Marketing über jede Nützlichkeit hinaus gedehnt worden. Für diesen Artikel gilt: Ein Agent ist ein System, das ein Ausgangsziel übernimmt, eine Abfolge von Schritten dafür plant, externe Tools oder APIs aufruft, Zwischenergebnisse bewertet und den Kurs entsprechend anpasst, mit minimaler menschlicher Beteiligung in jedem Zyklus. Das entscheidende Wort ist „anpasst". Agenten sind keine aufgewerteten Chatbots mit APIAPIApplication Programming Interface: a standardised interface that lets applications communicate and exchange data without knowing each other's internal workings.Vollständige Definition ansehen →-Zugang. Es sind Systeme, die über mehrere Schritte hinweg bedingte Entscheidungen treffen, und genau das macht sie zugleich leistungsfähig und fragil.
Stand Mitte 2026 verteilen sich die folgenreichsten Deployments auf eine schmale Auswahl von Use Cases: Triage bei Eskalationen im Kundenservice, Finanzabstimmung, IT-Incident-Response und Qualifizierung der Sales-PipelinePipelineAll active sales opportunities across the stages of the sales process, together with their combined potential value and probability of closing.Vollständige Definition ansehen →. Salesforce berichtet von breiter Adoption seiner Agentforce-Plattform bei Enterprise-Kunden (Salesforce ist ein Anbieter mit kommerziellem Interesse an diesen Zahlen, also behandeln Sie Schlagzeilenwerte mit angemessener Skepsis), doch unabhängige Beobachtungen von Häusern wie Gartner legen nahe, dass weniger als 20 % der Agenten-Projekte im Unternehmen innerhalb des ursprünglichen Zeitplans einen stabilen Produktivstatus erreichen.
Die Kernarchitekturen haben sich auf einige Muster zusammengezogen. ReAct (Reasoning plus Acting), erstmals 2022 in einem Paper von Google Brain und Princeton beschrieben, bleibt ein dominantes Framework. Multi-Agent-Orchestrierung, bei der spezialisierte Sub-Agenten unter einem koordinierenden Agenten verschiedene Aufgaben übernehmen, gewinnt in komplexen Workflows an Boden. OpenAIs Assistants API, die Tool-Use-Fähigkeiten von Anthropics Claude und Googles Gemini-Function-Calling-Schnittstelle unterstützen diese Muster alle, mit unterschiedlichen Tradeoffs bei Länge des Context WindowContext WindowThe context window is the maximum amount of text (measured in tokens) a language model can process at once, including both the input prompt and the generated output.Vollständige Definition ansehen →, Latenz und Kosten.
Schnell verändert sich die Tooling-Schicht. LangChain und LlamaIndex, 2023 und 2024 beide dominant, haben gegenüber stärker vorgeprägten Enterprise-Frameworks verloren. Microsofts AutoGen, inzwischen in Version 0.4, und CrewAI haben deutliche Verbreitung im Unternehmensumfeld gefunden, auch weil sie genug Struktur vorgeben, um Debugging handhabbar zu machen. Das hat operative Folgen: Agenten, die in einem lose gekoppelten System still scheitern, kosten in der Diagnose weit mehr als solche, die in einem strukturierten System laut scheitern.
Was das für den KI-Anwender bedeutet
Zuerst gilt es zu verinnerlichen, dass Agenten-Fehler meist keine Modellfehler sind. Wenn ein Agent ein falsches Ergebnis liefert, ist der Reflex, das Reasoning des LLMLLMA Large Language Model is an AI system trained on vast text data to predict and generate language, enabling tasks like writing, summarizing, and answering questions.Vollständige Definition ansehen → verantwortlich zu machen. In der Praxis liegt der Fehler meist an einer von vier Stellen: Die Tool-Definitionen sind mehrdeutig, die Eingabedaten sind inkonsistent, die Zerlegung der Aufgabe war zu grob, oder es gibt für den Agenten keinen verlässlichen Weg zu erkennen, wann er überfordert ist.
Das verschiebt die Anforderung an die Kompetenz. Wirksame Agenten zu bauen liegt näher am Systemdesign als am Prompt EngineeringPrompt EngineeringPrompt engineering is the practice of designing and refining text inputs to guide large language models toward accurate, relevant, and reliable outputs.Vollständige Definition ansehen →. Sie müssen über Fehlermodi nachdenken, bevor Sie über Fähigkeiten nachdenken. Was passiert, wenn die CRMCRMCustomer Relationship Management: software and strategy to manage and analyse customer interactions throughout their lifecycle.Vollständige Definition ansehen →-API in Schritt drei eines fünfstufigen Workflows in ein Timeout läuft? Was passiert, wenn ein abgerufenes Dokument in einer Sprache zurückkommt, für die der Prompt nicht gebaut war? Das sind keine hypothetischen Fragen; sie entscheiden, ob Ihr Agent den Kontakt mit echten Daten übersteht.
Die zweite Konsequenz betrifft die Architektur der menschlichen Aufsicht. Die Unternehmen, die den konstantesten Nutzen aus Agenten ziehen, sind nicht die mit vollständig autonomen Pipelines. Es sind die, die genau festgelegt haben, wo ein Mensch im Loop bleiben muss, und das bewusst ins System eingebaut haben. Ein brauchbares Denkmodell: Behandeln Sie jede Agenten-Aktion, die in ein System of Record schreibt, eine externe Kommunikation versendet oder eine Finanztransaktion auslöst, als bestätigungspflichtig, mindestens bis Sie sechs Monate Produktionsdaten zur Fehlerrate des Agenten bei genau diesem Aktionstyp haben.
Drittens wird Kostenkontrolle zu einem echten Thema. Eine einzelne komplexe Agenten-Aufgabe kann dutzende LLM-Aufrufe verketten. Bei den aktuellen API-Preisen kann ein schlecht abgegrenzter Agenten-Workflow in einem Umfeld mit hohem Volumen Kosten erzeugen, die jedem peinlich wären, der sechs Monate zuvor den ROIROIReturn on Investment: the ratio of net profit to the cost of an investment. A 300% ROI means each dollar invested returns $3.Vollständige Definition ansehen →-Case präsentiert hat. Anthropics Claude 3.5 Sonnet und OpenAIs GPT-4o mini bieten für verschiedene Schritte einer Agenten-Kette deutlich unterschiedliche Kostenprofile. Ein Muster, das sich lohnt: ein kleineres, schnelleres Modell für die Tool-Auswahl und das Zwischen-Reasoning nutzen, das leistungsfähigere Modell für die finale Synthese oder Entscheidungen mit hohem Einsatz reservieren. Allein das kann die Inferenzkosten typischer Workflows um 40-60 % senken, ohne die Output-Qualität merklich zu verschlechtern.
In die Produktion, ohne den Umweg über acht Monate
- Fangen Sie mit einem Workflow an, für den eine klare Definition of Done schon existiert. „Manuellen Aufwand bei Rechnungsausnahmen reduzieren" ist zu vage. „Jede Rechnung markieren und eine Antwort entwerfen, bei der die Positionssumme um mehr als 2 % von der Bestellung abweicht und der Lieferant auf der Freigabeliste steht" ist umsetzbar. Agenten liefern im Verhältnis zur Präzision der Aufgabengrenze.
- Instrumentieren Sie von Tag eins alles. Protokollieren Sie jeden Tool-Aufruf, jeden Zwischenschritt des Reasoning, sofern das Modell das hergibt, und jeden Output. Sie kkThe average number of new users each existing user generates through referrals. Above 1.0, growth compounds on itself and becomes exponential.Vollständige Definition ansehen →önnen nicht debuggen, was Sie nicht sehen, und der erste Monat Produktionsdaten ist der wertvollste Datensatz, den Sie zur Verbesserung des Systems je haben werden.
- Führen Sie vor dem Launch ein „Chaos-Audit" durch. Geben Sie dem Agenten bewusst fehlerhafte Eingaben, fehlende Felder und API-Fehler. Dokumentieren Sie sein Verhalten. Wenn er still scheitert oder selbstbewusst falsche Antworten produziert, reparieren Sie die Fehlerbehandlung, bevor Sie sich um Genauigkeit bei sauberen Eingaben sorgen.
- Pilotieren Sie mit Aufgaben von geringem Einsatz und hohem Volumen, bei denen die Kosten eines Fehlers reparabel sind. Rechnungen markieren, Meeting-Zusammenfassungen weiterleiten und Support-Tickets kategorisieren sind gute Kandidaten. Zusagen gegenüber Kunden und alles, was den Financial Close berührt, sind es nicht.
- Fragen Sie bei der Bewertung von Anbieterplattformen ausdrücklich nach Observability-Tooling und Fehlerbehebung. Eine Plattform, die Ihnen keinen Schritt-für-Schritt-Trace zeigen kann, was der Agent getan hat und warum, ist eine Plattform, die Ihnen das Debugging-Leben zur Qual macht.
Das Rotterdamer Logistikteam hat seinen Agenten letztlich in die Produktion gebracht, indem es drei Wochen darauf verwendet hat, jede Variante der Statuscode-Ausgaben im ERP zu erfassen, bevor es die Agenten-Konfiguration wieder angefasst hat. Diese drei Wochen waren die wertvollste Arbeit des ganzen Projekts. Die meisten harten Probleme beim Einsatz von Agenten sind überhaupt keine KI-Probleme.
Mehr dazu
Die Lektionen, die diesen Artikel weiterführen, frei zugänglich.
- 1Agents evaluieren und debuggen: Traces, Evals und Failure ModesAI Agents: Design, Aufbau und Betrieb
- 2Kosten, Latenz und Zuverlässigkeit: Agents in Produktion bringenAI Agents: Design, Aufbau und Betrieb
- 3Agents vs. Workflows vs. Automations: das richtige Maß an AutonomieAI Agents: Design, Aufbau und Betrieb
- 4Guardrails, Permissions und Human-in-the-LoopAI Agents: Design, Aufbau und Betrieb
- 5Tools und Function Calling: Ihrem Agenten Hände gebenAI Agents: Design, Aufbau und Betrieb
Artikel gelesen?
Bestätigen Sie Ihre Lektüre, um XP zu sammeln und Ihr Radar zu füttern.