KIKI-Agenten & AutomatisierungSoftware & SaaS

Menschliche Kontrolle in KI-Agenten-Workflows: was es tatsächlich bedeutet, die Kontrolle zu behalten

Während KI-Agenten mehrstufige Aufgaben autonom übernehmen, ist die Frage, wann und wie Menschen eingreifen, zu einer der folgenreichsten Design-Entscheidungen in der Unternehmens-KI geworden. Dieser Artikel zerlegt die Mechanik der Kontrolle in agentischen Systemen und die realen Tradeoffs.

🎙️

Podcast anhören

4 min

Das Konzept klingt selbstverständlich, bis Sie es umsetzen wollen. „Menschliche Kontrolle“ in KI-Agenten-Workflows ist eine dieser Formulierungen, die in jedem AI-Governance-Framework, jedem Vendor-Pitchdeck und jedem KI-Policy-Dokument auf Vorstandsebene auftaucht, und deren praktische Bedeutung trotzdem enorm schwankt. In manchen Organisationen heißt das: ein Mensch genehmigt jede Agenten-Aktion, bevor sie ausgeführt wird. In anderen heißt es: am Ende der Woche eine Logdatei durchsehen. Keines von beiden ist grundsätzlich falsch, aber der Abstand dazwischen bedeutet massive Unterschiede in Risikoexposition, operativer Geschwindigkeit und Verantwortlichkeit.

Das richtig hinzubekommen ist heute wichtiger als vor zwei Jahren. Agentische KI-Systeme, in denen ein LLM Handlungsketten über Tools, APIs und Datenbanken hinweg plant und ausführt, sind keine Prototypen mehr. Unternehmen wie Salesforce (mit Agentforce), ServiceNow und Workday bringen Produkte auf Basis dieser Architektur auf den Markt. Teams setzen Agenten ein, die E-Mails senden, CRM-Datensätze aktualisieren, Beschaffungs-Workflows auslösen und mit externen Partnern interagieren. Was schlecht kalibrierte Kontrolle kostet, ist konkret: fehlerhafte Aktionen, die sich über eine Pipeline hinweg aufsummieren, Entscheidungen auf Basis veralteter oder falscher Daten, und Haftungsfragen, die Rechtsabteilungen noch zu klären versuchen.

Warum das speziell für Manager und Operatoren zählt

Am deutlichsten spüren das nicht die Engineers, die den Agenten gebaut haben. Es sind die Operations Manager, Finance Leads und Customer-Success-Verantwortlichen, die jetzt für Ergebnisse einstehen, die teilweise oder vollständig von einem automatisierten System erzeugt wurden.

Nehmen Sie einen Einkaufsleiter, dessen Team einen Agenten für routinemäßige Lieferantenkommunikation und die Aktualisierung von Bestellungen einsetzt. Wenn der Agent eine Rechnung falsch einordnet oder einen Liefertermin zusagt, den es nicht gibt, ist es weiterhin der Manager, der den Fehler dem CFO und dem Lieferanten erklärt. Der Agent sitzt in diesem Meeting nicht mit am Tisch. Diese Asymmetrie der Verantwortung ist der Kern dafür, warum das Design der Kontrolle ernsthafte Aufmerksamkeit verdient, nicht als Compliance-Häkchen, sondern als praktische operative Frage.

Es gibt außerdem ein weniger offensichtliches Risiko: Automation Bias. Forschung unter anderem des MIT Media Lab und verschiedener Luftfahrt-Sicherheitsbehörden dokumentiert seit Jahrzehnten, dass Menschen, die automatisierte Systeme überwachen, Outputs mit der Zeit weniger genau prüfen, besonders wenn das System über längere Strecken gut funktioniert. Im agentischen Kontext heißt das: ein „Human in the Loop“ kann faktisch zur Formalie werden, wenn das Workflow-Design der Tendenz, ohne Prüfung zu genehmigen, nicht aktiv entgegenwirkt.

Wie es tatsächlich funktioniert: die Mechanik

Kontrolle in einem Agenten-Workflow läuft über eine Reihe von Entscheidungs-Gates, also Punkte im Ausführungsplan, an denen das System entweder für menschlichen Input anhält oder autonom weiterläuft. Die zentrale Design-Variable ist, wo diese Gates sitzen und was sie auslöst.

Ein einfaches Beispiel: Ein Unternehmen setzt einen Agenten für eingehende Eskalations-Tickets von Kunden ein. Der Agent liest das Ticket, ruft die Bestellhistorie des Kunden ab, entwirft eine Lösungsantwort und leitet, wenn die Lösung eine Rückerstattung über einem bestimmten Schwellenwert beinhaltet, vor dem Versand an einen menschlichen Reviewer weiter. Unterhalb dieses Schwellenwerts versendet er autonom und protokolliert die Aktion.

Dieser Schwellenwert ist ein Kontroll-Gate. Alles darum herum ist eine Design-Entscheidung: Ab welchem Betrag wird geprüft? Erklärt der Agent dem Reviewer seine Begründung oder legt er nur den Antwortentwurf vor? Wie viel Zeit hat der Reviewer, bevor das System in einen Timeout läuft und weiter eskaliert? Kann der Reviewer die Antwort ändern oder sie nur genehmigen oder ablehnen?

Das sind keine abstrakten Fragen. Sie übersetzen sich direkt in konkrete Tooling-Entscheidungen. Plattformen wie LangGraph (von LangChain), Microsofts AutoGen-Framework und Anthropics Tooling für Claude-basierte Agenten stellen alle Mechanismen bereit, um solche Unterbrechungspunkte zu bauen. Manche nennen sie „Human-in-the-Loop“-Nodes, andere „Approval Steps“ oder „Breakpoints“. Die Terminologie unterscheidet sich, das zugrunde liegende Muster ist dasselbe: eine bedingte Pause im Ausführungsgraph.

Die anspruchsvollere Variante besteht darin, dass der Agent eine Audit-Trace liefert, nicht nur „hier ist meine vorgeschlagene Aktion“, sondern „hier ist, warum ich sie vorschlage, welche Daten ich genutzt habe und welche Alternativen ich geprüft habe“. Das ist in den meisten Standard-Implementierungen Mitte 2026 kein Normalverhalten, es ist aber machbar und wird in regulierten Branchen zunehmend erwartet. Finanzdienstleister, die Agenten für Know-your-customer-Prozesse einsetzen, verlangen zum Beispiel beginnend diese Art von Explainability, bevor ein Approval-Gate überhaupt als sinnvoll gelten kann.

Wann Sie es einsetzen und wann nicht: die ehrlichen Tradeoffs

Konfigurationen mit hoher Kontrolldichte bremsen Agenten, was den operativen Zweck ihres Einsatzes weitgehend zunichte macht. Wenn jede Agenten-Aktion eine menschliche Prüfung braucht, haben Sie ein teures Ticket-Routing-System gebaut, keinen autonomen Workflow. Der Value Case bricht zusammen.

Aber Konfigurationen mit wenig Kontrolle sind in folgenreichen Bereichen wirklich riskant. Der richtige Ansatz hängt von vier Faktoren ab:

  • Umkehrbarkeit. Lässt sich die Aktion des Agenten leicht rückgängig machen? Eine gesendete E-Mail lässt sich nicht zurückholen. Ein aktualisierter Datenbankeintrag lässt sich meist zurückrollen. Umkehrbarkeit sollte direkt beeinflussen, wie viel Kontrolle einer Aktion vorgeschaltet ist.
  • Häufigkeit und Volumen. Eine seltene Aktion mit hohem Einsatz rechtfertigt ein Gate. Eine routinemäßige Aktion mit hohem Volumen und geringem Einsatz wahrscheinlich nicht, sofern im Hintergrund ausreichend Logging und Anomalie-Erkennung läuft.
  • Datenqualität. Agenten, die auf strukturierten, validierten Daten arbeiten, machen andere Fehler als Agenten mit unstrukturierten Inputs oder Echtzeit-Feeds. Je unzuverlässiger die Eingangsdaten, desto mehr wollen Sie, dass ein Mensch die Outputs prüft, bevor sie weiterlaufen.
  • Regulatorischer Kontext. Im Gesundheitswesen, bei Finanzdienstleistungen und im Rechtsbereich ist Kontrolle teilweise eine Compliance-Anforderung und nicht nur eine operative Wahl. Die Bestimmungen des EU AI Act zu Hochrisiko-KI-Systemen, die ab 2024 schrittweise in Kraft getreten sind, schaffen für bestimmte Anwendungskategorien konkrete Pflichten zu menschlicher Prüfung und Protokollierung.

Der ehrliche Tradeoff lautet: Kontrolle kostet Zeit und Aufmerksamkeit, und Aufmerksamkeit ist endlich. Jedes Gate, das Sie einem Workflow hinzufügen, ist eine kognitive Anforderung an einen Menschen, der noch andere Arbeit hat. Das Ziel ist nicht maximale Kontrolle, sondern kalibrierte Kontrolle: Friktion dort einbauen, wo die Kosten eines ungeprüften Fehlers die Kosten der Prüfung übersteigen.

Ein praktischer Ausgangspunkt, den mehrere Enterprise-Teams nutzen: jeden neuen Agenten-Workflow in den ersten vier bis sechs Wochen vollständig beaufsichtigt starten, jede Entscheidung und Aktion protokollieren, Fehler systematisch auswerten und dann selektiv die Kontroll-Gates bei den Aktionen entfernen, die sich durchgängig als verlässlich erwiesen haben. Damit wird die Kontrollschicht zu etwas, aus dem Sie sich durch nachgewiesene Performance herausarbeiten, und nicht zu etwas, das Sie überspringen, weil die Vendor-Demo beeindruckend aussah.

Das Design der Kontroll-Gates ist genauso wichtig wie das Design des Agenten selbst. Teams, die Kontrolle als Nachgedanken behandeln, als etwas, das man ergänzt, wenn der Agent schon gebaut ist, bauen ihre Workflows nach dem ersten ernsten Vorfall regelmäßig neu. Mit explizitem Gate-Design zu beginnen, lange bevor der Agent in die Nähe der Produktion kommt, ist die eine strukturelle Entscheidung, die Organisationen, die agentische KI skalieren, von denen trennt, die stecken bleiben.

Mehr dazu

Die Lektionen, die diesen Artikel weiterführen, frei zugänglich.

  1. 1Guardrails, Permissions und Human-in-the-LoopAI Agents: Design, Aufbau und Betrieb
  2. 2Agents vs. Workflows vs. Automations: das richtige Maß an AutonomieAI Agents: Design, Aufbau und Betrieb
  3. 3Agents evaluieren und debuggen: Traces, Evals und Failure ModesAI Agents: Design, Aufbau und Betrieb
  4. 4Governance und der EU AI Act: das WesentlicheVerantwortungsvolle und vertrauenswürdige KI
  5. 5Was ein KI-Agent wirklich ist: der Loop aus perceive, plan, act, observeAI Agents: Design, Aufbau und Betrieb

Artikel gelesen?

Bestätigen Sie Ihre Lektüre, um XP zu sammeln und Ihr Radar zu füttern.