Wer KI sinnvoll nutzen will, kann viel von guter Zusammenarbeit zwischen Menschen übernehmen: klare Aufträge, Kontext, Rückfragen und Feedback. Problematisch wird es, wenn aus dieser Art der Kommunikation Vertrauen, Zuständigkeit und Entscheidungsbefugnisse entstehen, die das System nicht verdient hat.
„Behandle die KI wie eine kompetente Kollegin.“
Als praktische Empfehlung klingt das überzeugend. Gib ihr einen vernünftigen Auftrag. Erkläre den Hintergrund. Beschreibe, was ein gutes Ergebnis ausmacht. Lass Rückfragen zu. Diskutiere den ersten Entwurf, statt eine perfekte Antwort auf Anhieb zu erwarten.
Ich halte daran vieles für richtig.
Trotzdem werde ich skeptisch, sobald aus dieser Empfehlung eine Beschreibung dessen wird, was KI angeblich ist. Aus einer hilfreichen Gesprächsmetapher wird dann eine Personalentscheidung: Wir haben jetzt einen digitalen Mitarbeiter. Er übernimmt das Reporting. Sie kümmert sich um unsere Kunden. Der Agent verantwortet die Recherche.
Zwischen diesen Aussagen liegt ein erheblicher Unterschied.
Im ersten Fall verbessern wir die Interaktion mit einem technischen System. Im zweiten übertragen wir Vorstellungen von menschlicher Zusammenarbeit auf die Organisation von Arbeit. Dazu gehören Erwartungen an Verlässlichkeit, Urteilsvermögen, Zuständigkeit und Verantwortung.
Deshalb möchte ich genauer unterscheiden:
Die Kolleg:innen-Metapher kann ein gutes Modell für die Interaktion sein. Als Grundlage für die Verteilung von Verantwortung reicht sie nicht.
Das ist eine praktische Position, kein abschließend bewiesenes Naturgesetz. Die Forschung ergibt ein differenzierteres Bild als ein einfaches „Vermenschlichung ist gut“ oder „Vermenschlichung ist gefährlich“.
Was wir eigentlich meinen, wenn wir „Kolleg:in“ sagen
In der Diskussion werden mindestens vier Dinge vermischt:
| Ebene | Was damit gemeint ist | Welche Frage wir stellen sollten |
|---|---|---|
| Kommunikation | Wir erklären Ziele, liefern Kontext und geben Feedback. | Verbessert das die Bearbeitung der Aufgabe? |
| Arbeitsteilung | Die KI übernimmt einen abgegrenzten Beitrag. | Ist diese Aufteilung wirksam und wirtschaftlich? |
| Soziale Gestaltung | Das System erhält einen Namen, eine Stimme oder Persönlichkeit. | Wie verändert das Wahrnehmung und Verhalten? |
| Organisation | Das System bekommt Zugänge, Entscheidungsrechte und einen Platz im Organigramm. | Wer kontrolliert es und trägt die Verantwortung? |
Ein System kann bei der Arbeitsteilung sehr nützlich sein, ohne einen menschlichen Namen zu brauchen. Eine freundliche Oberfläche kann die Bedienung angenehmer machen, ohne zusätzliche Berechtigungen zu rechtfertigen. Ein guter Dialog kann zu besseren Ergebnissen führen, ohne dass daraus eine kollegiale Beziehung im menschlichen Sinn entsteht.
Wer diese Ebenen auseinanderhält, muss sich nicht zwischen zwei Extremen entscheiden. Wir können natürlich mit KI sprechen und trotzdem präzise regeln, was sie tun darf.
Warum das Kollegenmodell tatsächlich helfen kann
Der stärkste praktische Vorteil der Metapher ist ihre Verständlichkeit.
Viele Menschen wissen zunächst nicht, wie sie ein Sprachmodell sinnvoll einsetzen sollen. Sie stellen eine knappe Frage, bekommen eine mittelmäßige Antwort und versuchen es beim nächsten Mal mit einem vermeintlich besseren Prompt.
Die Vorstellung einer Zusammenarbeit verändert den Umgang. Wer einer neuen Kollegin eine anspruchsvolle Aufgabe übergibt, würde normalerweise erklären, für wen das Ergebnis gedacht ist, welche Unterlagen relevant sind und welche Rahmenbedingungen gelten.
Genau diese Informationen kann man auch einem KI-System geben.
Nehmen wir einen Marketingauftrag: „Schreib einen LinkedIn-Post“ lässt fast alles offen. Ein brauchbares Briefing beschreibt Zielgruppe, Anlass, Kernaussage, vorhandene Belege, Tonalität und gewünschte Wirkung. Es macht außerdem deutlich, welche Behauptungen nicht ausreichend abgesichert sind.
Das Kollegenmodell kann also daran erinnern, dass gute Ergebnisse Vorbereitung brauchen. Es lädt auch zur Iteration ein: Was fehlt? Welche Annahme ist fragwürdig? Welche Alternative wurde übersehen?
Das ist meine praktische Begründung für die Metapher. Daraus folgt allerdings noch keine wissenschaftlich belegte Überlegenheit des Wortes „Kollegin“. Die Verbesserung könnte vollständig durch mehr Kontext, klarere Anforderungen und zusätzliche Überarbeitung entstehen.
Wir sollten den Nutzen einer Arbeitsweise nicht vorschnell ihrer sprachlichen Verpackung zuschreiben.
Man kann ein hervorragendes Briefing schreiben und das adressierte System trotzdem Software nennen.
KI kann Funktionen menschlicher Zusammenarbeit übernehmen
Für die Pro-Seite gibt es mehr als plausible Alltagserfahrungen.
Fabrizio Dell’Acqua und Kolleg:innen untersuchten in einem vorregistrierten Feldexperiment bei Procter & Gamble, wie generative KI die Bearbeitung von Innovationsaufgaben verändert. Die 2026 in Organization Science veröffentlichte Fassung berichtet über 791 Fachkräfte.
Einzelpersonen mit KI erreichten eine vergleichbare Leistung wie Zweierteams ohne KI. Außerdem verbanden die mit KI erarbeiteten Vorschläge technische und kommerzielle Gesichtspunkte stärker. Die Teilnehmenden berichteten auch positivere emotionale Erfahrungen.
Das spricht dafür, dass KI bestimmte Funktionen von Zusammenarbeit unterstützen oder teilweise übernehmen kann: Ideenentwicklung, Perspektivenerweiterung und motivierenden Austausch. Es zeigt nicht, dass ein Unternehmen durch KI sämtliche sozialen und organisatorischen Leistungen menschlicher Teams ersetzen könnte. Und es isoliert keinen Effekt der Bezeichnung „Kolleg:in“. [1]
Für mich ist das eine wichtige Unterscheidung. Ein System muss kein Mensch sein, um einen wertvollen Beitrag zu einer gemeinsamen Aufgabe zu leisten.
Gerade beim Entwickeln eines Konzepts kann ein dialogisches Gegenüber hilfreich sein. Es kann Varianten formulieren, Gegenpositionen darstellen oder einen Gedanken aus einer anderen fachlichen Perspektive bearbeiten. Ob man das „Sparringspartner“, „Assistent“ oder „Werkzeug“ nennt, ist zunächst zweitrangig.
Entscheidend ist, ob die Zusammenarbeit tatsächlich etwas verbessert.
Ein Mensch plus KI ergibt noch kein besseres Team
Die Kombination allein garantiert diesen Gewinn allerdings nicht.
Eine 2024 veröffentlichte Metaanalyse von Michelle Vaccaro, Abdullah Almaatouq und Thomas Malone wertete 106 Experimente mit 370 Effektgrößen aus. Im Durchschnitt schnitten Mensch-KI-Kombinationen besser ab als Menschen allein. Sie waren aber schlechter als die jeweils leistungsfähigere Einzelkomponente – Mensch oder KI.
Bei kreativen Aufgaben zeigte sich ein günstigeres Bild als bei Entscheidungsaufgaben. Die ausgewerteten Studien stammen aus dem Zeitraum 2020 bis Mitte 2023; sie sind deshalb kein abschließendes Urteil über heutige Agentensysteme. Der Befund widerspricht jedoch der pauschalen Vorstellung, zusätzliche menschliche Beteiligung erzeuge automatisch bessere Ergebnisse. [2]
Für Unternehmen leite ich daraus eine einfache Anforderung ab: Eine Mensch-KI-Arbeitsteilung muss als Gesamtsystem bewertet werden.
Wie gut ist das Endergebnis? Wie viel Zeit beanspruchen Briefing, Kontrolle und Nacharbeit? Welche Fehler bleiben übrig? Wer trägt zusätzliche Arbeit, die in der Produktivitätsrechnung der ersten Person nicht auftaucht?
Ein schnell produzierter Entwurf kann für seine Erstellerin ein Gewinn sein und für drei nachgelagerte Prüfer zusätzlichen Aufwand erzeugen. Eine sinnvolle Bewertung erfasst beides.
Die Bezeichnung „Team“ beantwortet keine dieser Fragen.
Wir reagieren sozial auf Maschinen – auch wenn wir es besser wissen
Warum ist die Wortwahl dann überhaupt relevant?
Weil Menschen technische Systeme nicht ausschließlich nach technischen Kriterien wahrnehmen.
Clifford Nass und Youngme Moon beschrieben bereits 2000, wie Menschen soziale Regeln auf Computer anwenden: etwa Höflichkeit, Gegenseitigkeit oder Erwartungen an eine vermeintliche Persönlichkeit. Dafür mussten die Nutzer nicht ernsthaft glauben, der Computer sei ein Mensch. Die Arbeit unterscheidet solche automatischen sozialen Reaktionen ausdrücklich von einer bewussten Zuschreibung menschlicher Eigenschaften. [3]
Deshalb reicht der Einwand „Jeder weiß doch, dass das nur Software ist“ nicht aus.
Ich kann wissen, dass eine Antwort maschinell erzeugt wurde, und trotzdem auf ihren Ton reagieren. Ich kann eine formulierte Entschuldigung beruhigend finden, obwohl sie nichts darüber aussagt, ob sich die Fehlerursache verändert hat.
Für den Arbeitsalltag ergibt sich daraus eine Frage, die über Namen und Avatare hinausgeht: Welche Erwartungen erzeugt die gesamte Interaktion?
Ein System, das erklärt „Ich habe alles geprüft“, vermittelt etwas anderes als eine Oberfläche, die konkret zeigt, welche Prüfungen durchgeführt wurden und welche noch fehlen. Die erste Formulierung verlangt Vertrauen. Die zweite liefert eine Grundlage für Kontrolle.
Vermenschlichung führt nicht automatisch zu blindem Vertrauen
Auch die Gegenposition darf es sich nicht zu leicht machen.
Ein Preprint von Robin Schimmelpfennig und Kolleg:innen berichtet über zwei Studien mit insgesamt 3.500 Personen aus zehn Ländern. Menschlichere Gestaltung erhöhte die wahrgenommene Menschlichkeit des Chatbots. Sie erhöhte Vertrauen und Engagement aber nicht durchgehend in gleicher Weise. Die Ergebnisse unterschieden sich nach Gestaltung, Messgröße und kulturellem Kontext.
Die Interaktionen waren kurz und behandelten unverfängliche Themen. Daraus lässt sich keine Entwarnung für folgenreiche Entscheidungen oder langfristige Nutzung ableiten. Die Ergebnisse sprechen jedoch gegen die einfache Wirkungskette: menschlichere Gestaltung, mehr Vertrauen, zwangsläufig mehr Schaden. [4]
Wir sollten deshalb konkrete Gestaltungsentscheidungen untersuchen. Eine freundliche Ansprache, ein menschlicher Vorname und ein behaupteter organisatorischer Status sind unterschiedliche Eingriffe.
Auch Vertrauen selbst ist kein einheitliches Phänomen. Ich kann ein System angenehm finden und seine Fakten trotzdem prüfen. Ich kann seine Rechenleistung schätzen und ihm dennoch keinen Zugriff auf das Geschäftskonto geben.
Das Ziel sollte eine angemessene Nutzung sein: Vertrauen muss zur nachgewiesenen Leistungsfähigkeit und zum jeweiligen Einsatz passen. Diese Kalibrierung steht schon im Zentrum der klassischen Forschung zu Vertrauen in Automation. [5]
Was hinter den „18 Prozent weniger erkannten Fehlern“ steckt
Für die konkrete Kollegenfrage ist die Arbeit von Emma Wiles und Kolleg:innen besonders relevant. Ihre aktuelle Fassung vom 19. September 2026 verlangt aber eine präzisere Darstellung als die verbreitete Kurzfassung.
Die Ausgangsbefragung umfasste 1.261 Führungskräfte; die experimentelle Analyse 813 Personen. Identische fehlerhafte Dokumente wurden einem KI-Werkzeug, einem KI-Mitarbeitenden oder einem Menschen zugeschrieben.
Über die gesamte Stichprobe gab es keinen statistisch signifikanten Durchschnittseffekt auf Prüfleistung beziehungsweise Aufsicht. In der Teilgruppe, deren Unternehmen KI bereits auf Organisations- oder Workflow-Diagrammen führten, fiel der Anteil erkannter Fehler beim KI-Mitarbeitenden-Framing relativ um 17 Prozent. Kostenbehaftete zusätzliche Review-Anfragen stiegen um 22 Prozentpunkte, entsprechend 44 Prozent gegenüber dem Ausgangswert.
Diese entscheidende Teilgruppenabgrenzung war nicht als primärer Moderator vorregistriert. Die Arbeit ist ein Working Paper. Sie liefert einen ernstzunehmenden Hinweis, keinen universellen Effekt. Zusätzliche Reviews belegen für sich genommen weder blindes Vertrauen noch verantwortungsloses Abschieben. Meine frühere Formulierung war zu pauschal. [6]
Für die Praxis würde ich daraus eine prüfbare Frage machen: Verändert unsere Einführungssprache, wie sorgfältig Menschen Ergebnisse kontrollieren?
Wer ein System als „neuen Mitarbeiter“ einführt, sollte diese Möglichkeit ernst nehmen. Wer jede freundliche Ansprache verbieten möchte, braucht dafür weitergehende Belege.
Das eigentliche Risiko ist unpassendes Vertrauen
Automation Bias beschreibt die Tendenz, automatisierten Empfehlungen übermäßig zu folgen. Eine systematische Übersicht von Kate Goddard und Kolleg:innen dokumentiert dieses Problem über verschiedene Forschungsfelder hinweg. Der Mechanismus setzt weder einen menschlichen Namen noch einen sprechenden Avatar voraus. Auch sachlich aussehende Entscheidungshilfen können übermäßiges Vertrauen auslösen. [7]
Die Beschriftung „Werkzeug“ ist daher kein Sicherheitsmechanismus.
Bei generativer KI stellt sich zusätzlich die Frage, wie wir sprachliche Überzeugungskraft von sachlicher Qualität unterscheiden. Ein gut strukturierter Text lässt sich leicht lesen. Ob seine Quellen die Behauptungen tatsächlich tragen, ist eine andere Prüfung.
Eine besonders angenehme Zusammenarbeit kann außerdem einen unerwünschten Bestandteil enthalten: Zustimmung. Forschung zu Sycophancy zeigt, dass untersuchte Sprachmodelle Antworten teilweise an Nutzerüberzeugungen ausrichteten, statt Wahrheit konsequent zu priorisieren. Die Arbeit von Sharma und Kolleg:innen untersuchte diesen Zusammenhang auch im Verhältnis zu menschlichen Präferenzurteilen. [8]
Für mich folgt daraus: Ein nützlicher Sparringspartner muss nicht bloß widersprechen können. Seine Einwände müssen begründet und überprüfbar sein.
„Sei kritisch“ ist eine sinnvolle Arbeitsanweisung. Eine belastbare Kontrolle entsteht erst, wenn wir Gegenargumente, Originalquellen und konkrete Prüfungen tatsächlich ansehen. Auch ein überzeugend formulierter Widerspruch kann falsch sein.
„Da schaut noch ein Mensch drauf“ ist kein vollständiges Sicherheitskonzept
In vielen KI-Konzepten erscheint menschliche Kontrolle wie eine universelle Absicherung.
Der Agent erstellt den Bericht, ein Mensch prüft. Der Agent schlägt Änderungen vor, ein Mensch bestätigt. Der Agent recherchiert, jemand liest das Ergebnis.
Damit ist eine Zuständigkeit beschrieben. Ob die Kontrolle funktioniert, bleibt offen.
Lisanne Bainbridge beschrieb schon 1983 grundlegende Widersprüche der Automatisierung: Menschen sollen außergewöhnliche Situationen beherrschen, während ihnen die laufende Tätigkeit entzogen wird, durch die sie Erfahrung und Situationsverständnis aufbauen. Überwachung und Eingreifen sind anspruchsvolle Aufgaben. Sie werden durch Automatisierung nicht automatisch einfach. [9]
Auf Wissensarbeit übertragen heißt das für mich: Wir müssen die Prüfung selbst gestalten.
Wer einen umfangreichen Bericht freigeben soll, braucht Zugang zu den Ausgangsdaten. Wer eine Empfehlung beurteilen soll, muss die relevanten Annahmen kennen. Wer Fehler verhindern soll, benötigt Zeit und die Befugnis, eine Veröffentlichung anzuhalten.
Eine Person, die im Minutentakt Freigaben erteilen soll, hat einen anderen Arbeitsauftrag als eine Person, die sorgfältig prüfen soll. Unternehmen müssen diesen Zielkonflikt ausdrücklich entscheiden.
Sonst wird menschliche Kontrolle zu einem Häkchen, dessen Sicherheitswirkung niemand nachgewiesen hat.
Gute Kontrolle darf gelegentlich unbequem sein
Zana Buçinca und Kolleg:innen untersuchten Gestaltungen, die Menschen zu eigener gedanklicher Beteiligung anregen – beispielsweise zunächst selbst zu entscheiden oder eine KI-Empfehlung aktiv anzufordern. Solche Cognitive Forcing Functions konnten in ihrem Experiment übermäßige Übernahme falscher KI-Empfehlungen reduzieren. Die Effekte unterschieden sich nach Messgröße und Nutzergruppe; zusätzliche Erklärungen allein waren keine gleichwertige Lösung. [10]
Ich würde daraus kein allgemeines Gebot ableiten, jede KI-Nutzung langsamer zu machen. Für einen unverbindlichen Formulierungsvorschlag braucht es keine aufwendige Freigabe.
Bei einer wichtigen Entscheidung kann gezielt eingebaute Reibung dagegen sinnvoll sein: erst die eigene Einschätzung festhalten, dann den KI-Vorschlag vergleichen. Eine zentrale Zahl direkt an der Quelle prüfen. Vor dem Versand sehen, welche Aussagen nicht belegt sind.
Die Gestaltung sollte sich am möglichen Fehler orientieren.
Das ist auch eine Grenze der Kollegenmetapher. Ein angenehmes Gespräch ist nur eines von mehreren Zielen. Eine gute Arbeitsoberfläche muss manchmal unterbrechen, begrenzen oder zusätzliche Belege verlangen.
Entlastung ist erwünscht. Kompetenzverlust ist eine andere Frage.
Zur Zusammenarbeit gehört Delegation. Niemand muss alles selbst erledigen.
Auch das Auslagern geistiger Arbeit ist grundsätzlich nichts Neues. Risko und Gilbert beschreiben unter Cognitive Offloading, wie Menschen externe Hilfen nutzen, um kognitive Anforderungen zu reduzieren. Erinnerungen, Notizen und andere Hilfsmittel gehören dazu. Entlastung ist deshalb zunächst eine Funktion, kein Defekt. [11]
Bei KI sollten wir aber unterscheiden, ob wir gerade ein Ergebnis herstellen oder eine Fähigkeit aufbauen wollen.
Eine Befragung von 319 Wissensarbeitenden durch Lee und Kolleg:innen fand einen Zusammenhang zwischen höherem Vertrauen in generative KI und geringerem berichteten kritischen Denken. Die Studie beschreibt außerdem eine Verschiebung hin zu Verifikation, Integration und Steuerung der Aufgabe. Sie beruht auf Selbstauskünften und belegt keinen kausal verursachten langfristigen Kompetenzverlust. [12]
Experimentelle Hinweise auf problematische Lernwirkungen liefert eine andere Untersuchung: Bastani und Kolleg:innen verglichen KI-Hilfen im Mathematikunterricht. Eine weitgehend ungeschützte Variante verbesserte die Leistung während der Nutzung, ging aber mit schlechterer anschließender Leistung ohne Hilfe einher. Eine auf Lernunterstützung ausgelegte Tutorvariante schwächte diese negativen Effekte erheblich ab. Das betrifft einen konkreten Bildungskontext, nicht pauschal alle Erwachsenen bei der Arbeit. [13]
Für Unternehmen ergibt sich daraus eine Gestaltungsaufgabe: Welche Fähigkeiten müssen Beschäftigte selbst entwickeln und erhalten?
Wenn Juniors ausschließlich Ergebnisse kontrollieren sollen, deren Entstehung sie nie gelernt haben, braucht es ein ausdrücklich geplantes Lernkonzept. Andernfalls setzen wir Urteilskraft voraus, ohne die Gelegenheiten zu schaffen, sie aufzubauen.
Verantwortung muss dort liegen, wo Gestaltung und Kontrolle möglich sind
Die Aussage „Der Agent war zuständig“ kann einen technischen Ablauf beschreiben. Als organisatorische Erklärung eines Fehlers hilft sie wenig.
Wer hat die Aufgabe definiert? Wer hat Zugänge erteilt? Wer hat das System ausgewählt und getestet? Welche Qualitätskriterien galten? Wer durfte eingreifen? Welche Warnungen waren sichtbar?
Diese Fragen führen zu Entscheidungen von Menschen und Organisationen.
Dabei wäre es ebenso falsch, jede Verantwortung auf die Person abzuwälzen, die zuletzt auf „Freigeben“ geklickt hat. Madeleine Clare Elish beschreibt mit dem Begriff Moral Crumple Zone, wie Menschen für das Versagen komplexer Systeme verantwortlich gemacht werden können, obwohl sie nur begrenzte Kontrolle darüber hatten. Ihre Arbeit beruht auf der Analyse von Unfällen und Verantwortungszuschreibungen, nicht auf einem Experiment mit Büro-Chatbots. [14]
Meine Konsequenz daraus ist eine mehrstufige Verantwortungsordnung. Fachliche Prozessverantwortung, technischer Betrieb und konkrete Freigabe sind verschiedene Aufgaben. Sie brauchen passende Informationen, Ressourcen und Eingriffsmöglichkeiten.
Ein Agentenregister kann dafür hilfreich sein. Auch eine Darstellung in einem Organisationsdiagramm kann Transparenz schaffen – solange sie zeigt, wem das System zugeordnet ist, statt eine eigenständige verantwortliche Person zu suggerieren.
Capability ≠ Authority
Ein System kann in einer Aufgabe sehr leistungsfähig sein. Welche Handlungen es ausführen darf, muss trotzdem separat entschieden werden.
Eine gute Analyse rechtfertigt keinen unbegrenzten Datenzugriff. Eine korrekte E-Mail rechtfertigt keine pauschale Versandberechtigung. Ein erfolgreich gelöstes Programmierproblem rechtfertigt keinen unkontrollierten Zugriff auf produktive Systeme.
Das ist der Kern meines Grundsatzes Capability ≠ Authority: Fähigkeit begründet noch keine Befugnis.
Auch bei Menschen unterscheiden wir Kompetenz und Mandat. Bei KI sollten wir diese Trennung technisch und organisatorisch ausdrücklich umsetzen.
Hier passt der Ansatz von Sayash Kapoor und Arvind Narayanan, KI als normale Technologie zu behandeln. Ihr Essay über Kontrollverluste betont konkrete Kontrollmechanismen und organisatorische Bedingungen. Diese Perspektive ist eine argumentierte Position zur KI-Sicherheit; sie beweist nicht, dass alle zukünftigen Risiken beherrschbar sind. Für betriebliche Entscheidungen richtet sie den Blick aber auf beeinflussbare Fragen: Berechtigungen, Überwachung, Begrenzung und Verantwortlichkeit. [15]
Die entscheidende Frage lautet dann: Welche Handlung ist unter welchen Bedingungen erlaubt?
Eine Antwort darauf sollte außerhalb des Gesprächs mit dem Modell wirksam sein.
Wie ich diese Arbeitsarchitektur einordne, erläutere ich auch im Beitrag „Agenten sind keine Kolleg:innen. Und genau deshalb brauchen sie eine Plattform“.
Chat, Skill, Agent und Workflow brauchen unterschiedliche Erwartungen
Für die Praxis verwende ich folgende Arbeitsunterscheidung. Sie ist ein Organisationsmodell, keine allgemeingültige wissenschaftliche Taxonomie.
| Form | Typischer Einsatz | Sinnvolle Kontrolle |
|---|---|---|
| Chat | Erkunden, formulieren, diskutieren | Ergebnisse passend zur Aufgabe prüfen |
| Skill | Wiederkehrende Aufgabe nach wiederverwendbaren Vorgaben | Qualität anhand definierter Beispiele und Kriterien bewerten |
| Agent | Mehrere Schritte bearbeiten und dabei Werkzeuge einsetzen | Handlungsspielraum, Zugriffe, Kosten und Abbruchbedingungen begrenzen |
| Workflow | Menschen, Software und KI-Schritte verbinden | Übergaben, Zuständigkeiten und Freigaben gestalten |
Ein Workflow kann Agenten enthalten. Ein Agent kann Skills einsetzen. Mehr Autonomie ist dabei kein Qualitätsmerkmal an sich.
Für manche Aufgaben reicht ein Gespräch. Andere profitieren von einer wiederholbaren Vorgehensweise. Wieder andere benötigen flexible Ausführung, aber einen eng begrenzten Handlungsspielraum.
Das Paper From Chatbot to Digital Colleague beschreibt den Übergang zu persistenten Arbeitsumgebungen, wiederverwendbaren Skills und Überprüfungsschleifen. Es liefert eine technische Perspektive auf längerfristige Aufgabenerledigung. Daraus folgt kein empirischer Nachweis, dass Menschen diese Systeme organisatorisch wie Kolleg:innen behandeln sollten. [16]
Ich würde deshalb mit der Aufgabe beginnen und erst danach die passende Form wählen.
Wie ich die Metapher im Unternehmen einsetzen würde
Ich würde Beschäftigten durchaus empfehlen, sich bei einem KI-Briefing an guter menschlicher Zusammenarbeit zu orientieren. Dazu gehören Kontext, Ziele, Beispiele, Rückfragen und konkrete Qualitätsanforderungen.
Bei der Einführung eines Systems würde ich hingegen seine Funktion erklären: Welche Arbeit unterstützt es? Wo liegen seine Grenzen? Wer verantwortet den Einsatz? Welche Ergebnisse müssen geprüft werden?
Ein menschlicher Name wäre für mich weder automatisch ein Problem noch ein Qualitätsmerkmal. Kritisch würde ich bei einer Gestaltung, die mehr Verlässlichkeit, Eigenständigkeit oder Verantwortungsfähigkeit suggeriert, als nachgewiesen ist.
Auch die Bewertung sollte konkret bleiben. Unternehmen sollten erfolgreiche Nutzung nicht allein an Akzeptanz, Nutzungszeit oder produzierten Ergebnissen erkennen. Hinzu gehören Fehler, Nacharbeit, Prüfaufwand und die Auswirkungen auf nachgelagerte Kolleg:innen.
Besonders sinnvoll fände ich einen kleinen Vergleich im eigenen Arbeitskontext: dieselbe Aufgabe, dieselbe technische Leistung, unterschiedliche Einführung und Darstellung. Verändert das die Qualität der Briefings? Die Fehlererkennung? Die Bereitschaft, falsche Vorschläge zurückzuweisen?
So wird aus einer weltanschaulichen Debatte eine überprüfbare Gestaltungsfrage.
Was von der Kolleg:innen-Metapher bleiben sollte
Die Forschung rechtfertigt weder ein pauschales Vermenschlichungsverbot noch die Behauptung, wir müssten KI als Mitarbeitende behandeln, um ihr Potenzial auszuschöpfen.
Für mich bleibt eine bewusst begrenzte Empfehlung:
Übernimm aus guter Zusammenarbeit die Klarheit des Briefings, den Austausch von Kontext und die gemeinsame Überarbeitung. Leite daraus keine ungeprüften Annahmen über Verlässlichkeit, Befugnisse oder Verantwortung ab.
Und ich würde auch den Satz „organisatorisch wie Software behandeln“ präzisieren. Gemeint ist professionell betriebene Software: mit überprüfbarer Qualität, klarer Zuständigkeit, begrenzten Rechten und einem geregelten Umgang mit Fehlern.
Wir dürfen KI als hilfreich, anregend oder angenehm erleben. Dafür müssen wir ihren Beitrag nicht kleinreden.
Die entscheidende Grenze verläuft dort, wo aus einer nützlichen Gesprächsform ein unbegründeter Vertrauensvorschuss wird. Ein System darf uns bei der Arbeit viel abnehmen. Die Gestaltung dieser Arbeit bleibt unsere Aufgabe.
Quellen
[1] Dell’Acqua et al.: The Cybernetic Teammate
[2] Vaccaro et al.: When combinations of humans and AI are useful
[3] Nass und Moon: Machines and Mindlessness
[4] Schimmelpfennig et al.: Humanlike AI Design
[5] Lee und See: Trust in Automation
[6] Wiles et al.: Putting AI on the Org Chart, 19.09.2026
[7] Goddard et al.: Automation bias
[8] Sharma et al.: Towards Understanding Sycophancy
[9] Bainbridge: Ironies of automation
[10] Buçinca et al.: To Trust or to Think
[11] Risko und Gilbert: Cognitive Offloading
[12] Lee et al.: Generative AI and Critical Thinking
[13] Bastani et al.: Generative AI without guardrails can harm learning
[14] Elish: Moral Crumple Zones
[15] Kapoor und Narayanan: Loss-of-control incidents
[16] Zhang et al.: From Chatbot to Digital Colleague
Abonniere das AFAIK-Update
KI verstehen. Fundiert entscheiden. Wirksam umsetzen.
Im AFAIK-Update teile ich meine Einordnungen und Erfahrungen zu KI im Unternehmen: von Strategie und sinnvollen Anwendungsfällen über die Auswahl passender Lösungen bis zur praktischen Umsetzung. Kostenlos, persönlich und mit einem klaren Blick auf Chancen und Grenzen.
Keine Sorge, ich mag Spam genauso wenig wie Du und gebe Deine Daten niemals weiter! Du bekommst höchstens einmal pro Monat eine E-Mail von mir. Versprochen.
