Was, wenn der Agent erst Monate später falsch liegt?

Von Kai Spriestersbach

Ich sehe eine große Gefahr in der Art, wie wir über KI-Agenten sprechen. Wir fragen, welche Aufgaben sie selbstständig erledigen können. Viel seltener fragen wir, wann und woran wir erkennen würden, dass sie auf dem falschen Weg sind.

KI ist für mich ein Werkzeug. Ein sehr leistungsfähiges Werkzeug, das mit dem richtigen Kontext, einer passenden Aufgabe und überprüfbaren Grenzen erstaunlich viel leisten kann.

Wenn wir daraus einen Agenten machen, geben wir ihm zusätzlichen Spielraum: Er wählt nächste Schritte, nutzt Werkzeuge, bewertet Zwischenergebnisse und arbeitet auf ein Ziel hin.

Das kann sinnvoll sein. Es verschiebt aber einen Teil der Steuerung vom Menschen in das System. Die Verantwortung für den Prozess und seine Folgen bleibt trotzdem bei den Menschen und Organisationen, die ihn einsetzen. Warum Agenten keine Prozessverantwortung tragen können, habe ich bereits an anderer Stelle beschrieben.

Hier interessiert mich die nächste Frage: Wann können wir überhaupt beurteilen, ob sie den richtigen Weg eingeschlagen haben?

Autonomie braucht eine brauchbare Rückmeldung

Bei manchen Aufgaben funktioniert selbstständige Lösungsfindung hervorragend. Das Ziel ist klar. Erfolg und Fehler lassen sich messen. Ein misslungener Versuch ist günstig, schnell erkennbar und rückgängig zu machen.

In vielen Geschäftsprozessen liegen die Dinge anders. Ob eine Kampagne der Marke genutzt hat, ob eine Kundenbeziehung gestärkt wurde oder ob eine strategische Entscheidung richtig war, wissen wir häufig erst viel später. Ein kurzfristig guter Messwert kann ein schlechtes langfristiges Ergebnis verdecken. Und wenn sich das Ergebnis schließlich zeigt, haben Wettbewerber, Marktbedingungen und zahlreiche andere Entscheidungen ebenfalls darauf eingewirkt.

Was soll ein Agent in dieser Situation optimieren? Er kann auf die Ziele reagieren, die wir ihm geben. Aber eine leicht messbare Kennzahl ist nicht automatisch das, was uns eigentlich wichtig ist.

Gerade hier wird die scheinbar einfache Anweisung „Erledige das eigenständig“ anspruchsvoll. Sie verlangt vom System Entscheidungen darüber, welche Abkürzungen vertretbar sind, wann ein Ergebnis genügt und welche Unsicherheit einen Stopp rechtfertigt. Das sind Fragen der Prozessgestaltung. Sie verschwinden nicht, weil die KI flüssig darüber sprechen kann.

Was uns die Softwareentwicklung zeigt

In der Softwareentwicklung lässt sich der Zielkonflikt zwischen Geschwindigkeit und Verlässlichkeit besonders gut beobachten. Automatisierte Tests können bekannte Fehler auffangen. Kleine Releases, Überwachung und ein schneller Rollback helfen dabei, weitere Probleme unter realen Bedingungen zu entdecken und zu begrenzen. Trotzdem gelangen Fehler zu Nutzer:innen.

Mehr Entwicklungsgeschwindigkeit kann mehr Versuche ermöglichen. Sie kann auch mehr fehlerhafte Änderungen und mehr Prüfaufwand erzeugen. Die DORA-Forschung beschreibt bei stärkerer KI-Nutzung einen Zusammenhang mit höherem Durchsatz und größerer Instabilität. Das ist kein Beleg dafür, dass KI jeden zusätzlichen Fehler verursacht. Es zeigt aber, warum wir Geschwindigkeit nicht mit Fortschritt gleichsetzen sollten.

In einem gut geführten Softwareprozess gibt es für dieses Risiko wenigstens Instrumente: Tests, Fehlermeldungen, Vergleichsgruppen, Qualitätsziele und Möglichkeiten zum Zurückrollen. Auch dort tragen reale Menschen die Kosten eines Fehlers. Wer bewusst schneller ausliefert, muss diese Kosten mitbedenken, statt sie stillschweigend an Kund:innen weiterzugeben.

Wo mehr Fehlschläge ein Gewinn sein können

Für die Forschung hat die Formel „mehr Output, mehr Experimente, mehr Fails, aber auch mehr Erfolge“ eine andere Bedeutung. Wissenschaft lebt davon, Hypothesen aufzustellen und an der Wirklichkeit scheitern zu lassen. Eine widerlegte Vermutung kann wertvoll sein, wenn sie uns hilft, die nächste Frage besser zu stellen.

Gerade bei der Suche in großen Datenbeständen kann KI Möglichkeiten erschließen, die ein Forschungsteam allein kaum alle prüfen könnte. Das erklärt einen Teil der großen Erwartungen an KI für die Wissenschaft. Anthropic investiert inzwischen nicht nur in KI-Forschung, sondern auch in ein eigenes Biologielabor, Werkzeuge für Forschende und Projekte zu seltenen Krankheiten.

Ein frühes Beispiel zeigt zugleich die Stärke und die Grenze dieses Ansatzes: Nach Angaben von Anthropic durchsuchten Claude-Agenten große Mengen genetischer Daten und identifizierten ein bislang nicht beschriebenes Enzymsystem. Wissenschaftler:innen prüften den Kandidaten anschließend im Labor. Was das System biologisch genau tut, ist noch offen. Das ist ein Forschungsergebnis, kein entwickeltes Medikament.

Dario Amodei verbindet solche Möglichkeiten mit der Hoffnung, medizinischen Fortschritt drastisch zu beschleunigen. In seinem Essay über KI und Wissenschaft bezeichnet er seine weitreichenden Vorhersagen selbst als spekulativ. Zwischen einer interessanten Hypothese, einem experimentellen Befund und einer sicheren, wirksamen Behandlung liegen weitere Prüfungen, die mehr Rechenleistung allein nicht erledigt.

Trotzdem finde ich die Richtung faszinierend. Wenn KI viele prüfbare Hypothesen erzeugt und Forschende die aussichtsreichen Kandidaten unabhängig untersuchen, können auch die verworfenen Vorschläge Erkenntnis bringen. Die entscheidende Leistung ist dann nicht der bloße Output, sondern ein Forschungsprozess, der aus ihm verlässliches Wissen gewinnt.

Mehr Output ist noch kein Lernen

Genau diesen letzten Schritt übersehen wir leicht, wenn wir die Logik auf Geschäftsprozesse übertragen. Die Verlockung ist verständlich: mehr Ideen, mehr Experimente, mehr Veröffentlichungen, mehr Entscheidungen. Darunter werden auch Erfolge sein. Aber die Zahl der Versuche allein sagt uns nicht, ob wir besser geworden sind.

Lernen setzt voraus, dass wir ein Ergebnis beurteilen und es einigermaßen zuverlässig auf unsere Entscheidung zurückführen können. Wenn das Feedback spät kommt oder die Ursache unklar bleibt, kann ein Agent denselben Irrtum in großer Zahl wiederholen, bevor jemand ihn bemerkt.

Deshalb würde ich Autonomie an die jeweilige Aufgabe binden. Was kann das System selbst prüfen? Welche Folgen sind umkehrbar? Wie schnell erkennen wir einen Fehler? Wer schaut auf die langfristigen Wirkungen? Und wer entscheidet, wenn die messbaren Ziele mit dem eigentlichen Interesse des Unternehmens kollidieren?

Das NIST AI Risk Management Framework beschreibt laufende Prüfung, Rückmeldungen aus dem Einsatz und klar zugewiesene menschliche Zuständigkeiten als Teile eines verantwortlichen KI-Einsatzes. Für mich ist das vor allem eine praktische Erinnerung: Ein Agent wird nicht dadurch zuverlässig, dass wir ihm einen Auftrag und viel Freiheit geben. Wir müssen auch wissen, wie wir seine Arbeit beurteilen und wann wir eingreifen.

Meine Sorge gilt deshalb weniger dem einzelnen misslungenen KI-Ergebnis als einer Organisation, die immer schneller Ergebnisse produziert und immer schlechter erkennt, was diese Ergebnisse bewirken.

In der Forschung können hundert verworfene Hypothesen der Preis einer wichtigen Entdeckung sein. In einem Geschäftsprozess können hundert unbemerkte Fehlentscheidungen hundert Menschen betreffen. Bevor wir dort fragen, wie viel Arbeit ein Agent übernehmen kann, sollten wir fragen: Welche seiner Irrtümer können wir rechtzeitig erkennen, begrenzen und verantworten?

Abonniere das AFAIK-Update

KI verstehen. Fundiert entscheiden. Wirksam umsetzen.

Im AFAIK-Update teile ich meine Einordnungen und Erfahrungen zu KI im Unternehmen: von Strategie und sinnvollen Anwendungsfällen über die Auswahl passender Lösungen bis zur praktischen Umsetzung. Kostenlos, persönlich und mit einem klaren Blick auf Chancen und Grenzen.

Keine Sorge, ich mag Spam genauso wenig wie Du und gebe Deine Daten niemals weiter! Du bekommst höchstens einmal pro Monat eine E-Mail von mir. Versprochen.

Kai Spriestersbach

Geschrieben von

Ich bin Kai Spriestersbach, M.Sc. in Web Science. Ich verbinde Forschung zu generativer KI mit Erfahrung als Head of AI, technischer Entwicklung und unternehmerischer Praxis.

Als externer Head of AI und in abgegrenzten Projekten unterstütze ich Unternehmen bei Strategie, Technologieauswahl und Umsetzung. Auf AFAIK teile ich wissenschaftliche Quellen, technische Erfahrungen und nachvollziehbare Einschätzungen – mit ihren Möglichkeiten, Grenzen und offenen Fragen.

Mehr über Kai