Ein Gastbeitrag in der MIT Technology Review stellt die Denkfähigkeit von Sprachmodellen infrage. Mir ist die Schlagzeile zu pauschal. Die Konsequenz für Unternehmen halte ich trotzdem für zentral: Wir müssen aufhören, überzeugende Ausgaben mit verlässlicher Arbeit zu verwechseln.
Ich bin begeistert. Und genervt.
Mit dieser Spannung bin ich in meine OMT-Keynote zum State of AI in Marketing gegangen. Sie beschreibt meine Haltung zur aktuellen KI-Debatte ziemlich gut. Begeisterung für die Möglichkeiten. Genervtheit darüber, wie schnell aus einer beeindruckenden Fähigkeit ein Geschäftsversprechen wird, bei dem niemand mehr nach den Voraussetzungen fragt.
Jetzt liefert Thore Graepel, einer der Mitentwickler von AlphaGo, einen passenden Anlass, diese Unterscheidung noch einmal zu schärfen. In seinem Gastbeitrag vom 2. Oktober 2026 für die MIT Technology Review argumentiert er, dass längere „Gedankengänge“ von Sprachmodellen nicht mit einem überprüfbaren Verfahren des Schlussfolgerns gleichzusetzen sind. Der Titel ist deutlich zugespitzter: „Don’t be fooled—LLMs don’t reason“. 1 2
Man könnte daraus einen bequemen „Habe ich doch immer gesagt“-Beitrag machen. Alles nur Statistik. Die Maschinen verstehen nichts. Weitergehen.
Das wäre mir zu einfach. Und es würde an dem vorbeigehen, was mich als Anwender, Forscher und Berater tatsächlich interessiert:
Unter welchen Bedingungen wird aus der Fähigkeit eines Modells ein Ergebnis, auf das wir uns verlassen können?
„Nur das nächste Wort“ erklärt weniger, als es klingt
Der Einwand gegen Sprachmodelle ist bekannt: Sie erzeugen schrittweise Text. Also könnten sie nicht wirklich denken, sondern lediglich bekannte Muster fortsetzen.
Der erste Teil beschreibt ein technisches Prinzip. Der zweite ist eine Schlussfolgerung, die daraus nicht automatisch folgt. Dass ein Modell auf die Vorhersage des nächsten Tokens trainiert wird, legt noch nicht vollständig fest, welche internen Verfahren es dafür erlernt.
Anthropic hat das 2025 an Claude 3.5 Haiku untersucht. In ausgewählten Experimenten fanden die Forschenden Hinweise auf vorausplanende Verarbeitung beim Schreiben von Reimen und auf das Verknüpfen von Fakten über Zwischenschritte. Die Methode erfasst nur einen Teil der internen Berechnungen und hat eigene Grenzen. Trotzdem passt das Ergebnis schlecht zur Vorstellung einer Maschine, die ausschließlich fertige Antworten aus dem Gedächtnis abruft. 3
Auch die Leistungsgewinne durch spezielles Reasoning-Training sind nicht einfach eine optische Täuschung. Die Arbeit zu DeepSeek-R1 zeigt beispielsweise Verbesserungen bei überprüfbaren Mathematik- und Programmieraufgaben durch Reinforcement Learning. Das ist ein konkreter Befund über Fähigkeiten unter bestimmten Bedingungen – kein Beleg für allgemeine Unfehlbarkeit. 4
Ich halte deshalb wenig davon, den Hype durch eine ebenso pauschale Gegenbehauptung zu ersetzen. Ob man bestimmte Leistungen „Denken“, „Schlussfolgern“ oder anders nennt, hängt auch davon ab, welche Anforderungen man an diese Begriffe stellt.
Für den betrieblichen Einsatz müssen wir diese Debatte nicht abschließend entscheiden. Wir müssen etwas viel Konkreteres wissen: Bei welchen Aufgaben funktioniert das System, wie erkennen wir seine Fehler und was passiert, wenn wir einen davon übersehen?
Ein Modell muss nicht wie ein Mensch denken, um nützlich zu sein. Umgekehrt macht eine menschenähnliche Erklärung sein Ergebnis nicht automatisch richtig.
Ein Denkprotokoll ist noch kein Beweis
Den stärksten Punkt des Gastbeitrags sehe ich deshalb nicht in seiner Schlagzeile. Graepel fordert einen expliziten, überprüfbaren Arbeitsstand: Welche Annahmen gelten? Welche Belege tragen sie? Was ist offen? Und aufgrund welcher neuen Information wird eine Schlussfolgerung revidiert? Eine fortlaufende sprachliche Herleitung ersetzt eine solche Architektur nicht automatisch. 1
Das trifft eine wichtige Unterscheidung: Eine Erklärung kann plausibel sein, ohne den tatsächlichen Entstehungsweg einer Antwort zuverlässig abzubilden.
In einer Anthropic-Untersuchung von 2025 bekamen Reasoning-Modelle gezielt Hinweise auf mögliche Antworten. In untersuchten Fällen beeinflussten diese Hinweise die Antwort, ohne in der ausgegebenen Gedankenkette entsprechend offengelegt zu werden. Die Experimente waren künstlich angelegt und betrafen bestimmte Modelle und Aufgaben. Sie beweisen nicht, dass jede Gedankenkette erfunden ist. Sie zeigen aber, warum wir sie nicht ohne Weiteres als vollständiges Protokoll der entscheidenden Einflüsse behandeln dürfen. 5
Dabei sind zwei Fragen auseinanderzuhalten. Hilft die Erzeugung von Zwischenschritten dem Modell beim Lösen einer Aufgabe? Und können wir anhand dieser Zwischenschritte zuverlässig kontrollieren, wie das Ergebnis zustande kam? Die Antwort auf die erste Frage kann ja lauten, während die zweite weiterhin offenbleibt.
Für die Praxis folgt daraus eine einfache Regel: „Ich habe das geprüft“ ist zunächst eine Behauptung. Bei einem Menschen würde ich bei wichtigen Entscheidungen ebenfalls nachfragen. Welche Daten? Welche Rechnung? Welcher Test?
Bei KI sollten wir denselben Anspruch haben. Wenn das System behauptet, eine Quelle ausgewertet zu haben, möchte ich die relevante Stelle sehen. Wenn es eine Berechnung beschreibt, möchte ich sie nachvollziehen können. Und wenn es Tests als bestanden meldet, brauche ich das tatsächliche Testergebnis – nicht nur einen Absatz darüber, wie gewissenhaft getestet wurde.
Die interessante Lehre aus AlphaGo ist die Architektur
AlphaGo verband neuronale Netze zur Auswahl und Bewertung von Zügen mit einem Suchverfahren, das mögliche Spielverläufe untersuchte. Es blieb also nicht bei einer Einschätzung, welcher Zug vielversprechend aussah. Die Einschätzung wurde in einem Verfahren weiterverarbeitet, das Konsequenzen von Zügen durchspielen konnte. 6
Für mich liegt darin eine wichtige Anregung: Vorschläge erzeugen und Vorschläge überprüfen sind unterschiedliche Aufgaben. Ein gutes Gesamtsystem muss beides sinnvoll organisieren.
Allerdings ist ein Unternehmen kein Go-Brett. Eine Kampagnenentscheidung hat keine vollständig bekannten Regeln, die sich beliebig oft ohne Kosten durchspielen lassen. Wir kennen nicht alle Einflussfaktoren, die Daten können unvollständig sein, und selbst das Ziel ist manchmal umstritten. Soll die Kampagne möglichst viele Leads liefern oder möglichst passende? Umsatz heute steigern oder die Marke langfristig stärken?
Deshalb wäre auch „Wir brauchen einfach ein AlphaGo für Marketing“ die nächste Abkürzung an der falschen Stelle.
Mein Schluss ist bescheidener: Wo wir prüfen können, sollten wir Prüfungen einbauen. Wo wir nur Annahmen haben, sollten wir sie sichtbar halten. Und wo eine Frage durch die vorliegenden Informationen nicht beantwortbar ist, darf das System nicht durch besonders überzeugende Formulierungen darüber hinweggehen.
Eine Demo zeigt eine Möglichkeit. Ein Prozess muss sich bewähren.
Genau an dieser Stelle setzt meine OMT-Argumentation an.
Stellen wir uns vor, ein KI-System entwickelt aus einem Briefing ein vollständiges Kampagnenkonzept. Zielgruppen, Botschaften, Kanäle, Budgetverteilung, Zeitplan. Alles sauber gegliedert, alles gut begründet. Der Entwurf liegt nach wenigen Minuten vor.
Das ist eine beeindruckende Leistung. Aber die entscheidende Arbeit ist damit noch nicht erledigt.
Vielleicht basiert die Zielgruppenableitung auf einer veralteten Studie. Vielleicht wurde aus einer Korrelation eine Ursache gemacht. Vielleicht passt der vorgeschlagene Kanal nicht zu den verfügbaren Ressourcen. Vielleicht ist die Argumentation intern schlüssig, beantwortet aber eine andere Frage als die, die das Unternehmen eigentlich lösen muss.
Das sind mögliche Fehler in unserem Beispiel, keine Behauptung, dass KI-Konzepte zwangsläufig so aussehen. Der Punkt ist: Die gute Darstellung verrät uns nicht, ob diese Fragen geklärt wurden.
Eine Demo zeigt, dass etwas entstehen kann. Professionelle Arbeit muss zeigen, dass das Richtige entstanden ist.
Deshalb gehören für mich drei Fragen vor jeden größeren KI-Einsatz: Welchen Wert wollen wir schaffen? Woran erkennen wir ein verwendbares Ergebnis? Und was darf das System selbst entscheiden und tun?
Beim Kampagnenkonzept könnte der Wert darin liegen, schneller zu mehreren prüfbaren Optionen zu kommen. Verwendbar wäre ein Entwurf erst, wenn zentrale Annahmen belegt, Budgetrechnungen korrekt und offene Fragen markiert sind. Selbst veröffentlichen oder Budgets verändern dürfte das System deshalb noch lange nicht.
Das ist ein anderes Projekt als „Die KI macht jetzt unsere Kampagnen“. Und vor allem eines, dessen Erfolg sich sinnvoll untersuchen lässt.
Für einen Piloten würde ich deshalb nicht den schönsten Durchlauf auswählen. Ich würde typische Aufgaben, schwierige Fälle und wiederholte Durchläufe betrachten. Welche Fehler treten auf? Welche davon entdeckt unser Verfahren? Wie viel Nacharbeit bleibt? Wo müssen wir die Aufgabe enger fassen?
Ein erfolgreicher Durchlauf ist ein Anfang. Er ist noch kein Betriebsnachweis.
Der Mensch am Ende ist noch kein Kontrollsystem
Die schnelle Antwort auf solche Einwände lautet häufig: Am Ende schaut ja noch jemand drüber.
Für mich beginnt dort die nächste Frage. Wer ist „jemand“? Was genau soll diese Person erkennen? Welche Informationen bekommt sie? Und wie viel Zeit haben wir dafür eingeplant?
Nehmen wir unser Kampagnenkonzept. Wer es freigeben soll, braucht mehr als den fertigen Text. Hilfreich wären die verwendeten Daten, die entscheidenden Annahmen, nachvollziehbare Berechnungen und Hinweise darauf, wo das System keine ausreichende Grundlage gefunden hat. Sonst muss die prüfende Person die Recherche womöglich noch einmal von vorn beginnen.
Ein Freigabeknopf kann diese Arbeit nicht ersetzen.
Meine Forderung ist deshalb nicht, überall zusätzliche Freigaben einzubauen. Ich möchte wirksamere Kontrolle. Dazu gehören fachliche Kompetenz, ein konkreter Prüfauftrag, ausreichend Zeit und die tatsächliche Möglichkeit, ein Ergebnis zurückzuweisen oder einen Ablauf zu stoppen.
In meinem Beitrag über den „KI-Graben“ habe ich die Rolle der Urteilskompetenz bereits beschrieben: Ob Delegation hilft, hängt wesentlich davon ab, ob ich die Qualität der delegierten Arbeit beurteilen kann oder dafür verlässliche Rückmeldungen bekomme. 7
Das gilt auch organisatorisch. Wenn wir mehr Entwürfe produzieren, als qualifiziert geprüft werden können, haben wir das Problem nicht gelöst. Wir haben es an die nächste Stelle verschoben.
Human-in-the-Loop ist nur dann ein Qualitätsversprechen, wenn wir die Arbeit dieses Menschen auch ermöglichen.
Für Schaden braucht es keine Superintelligenz
Noch wichtiger wird die Unterscheidung, sobald das System nicht nur Vorschläge macht, sondern handelt.
Ein fehlerhaftes Kampagnenkonzept kann ich verwerfen. Hat ein Agent auf seiner Grundlage bereits Anzeigen veröffentlicht, Kundendaten weitergegeben oder Budgets verändert, ist die Situation eine andere. Deshalb gehören Berechtigungen, begrenzte Werkzeugzugriffe und Kontrollen vor folgenreichen Aktionen zum Systemdesign. Auch OWASP empfiehlt für KI-Agenten minimale Rechte, explizite Freigaben für folgenreiche Handlungen und eine Trennung zwischen vorgeschlagener Entscheidung und autorisierter Ausführung. 8
In meiner Keynote habe ich es so formuliert:
Für erheblichen Schaden braucht ein KI-System weder Bewusstsein noch eine Strategie zur Weltherrschaft.
Diese Aussage ist für mich gerade kein Argument gegen KI. Sie ist ein Argument gegen die falsche Risikodebatte. Wir müssen nicht erst klären, ob eine Maschine eigene Absichten besitzt, bevor wir ihr den Zugriff auf ein Werbekonto begrenzen.
Ein guter Prompt ersetzt keine klaren Befugnisse. „Bitte überschreite das Budget nicht“ ist etwas anderes als ein technisch durchgesetztes Limit. „Veröffentliche erst nach Freigabe“ ist etwas anderes als ein System, das ohne gültige Freigabe überhaupt nicht veröffentlichen kann.
Was KI kann, ist nicht dasselbe wie das, was sie darf.
Mein Gegenentwurf: die Arbeit so gestalten, dass Fehler auffallen
Aus all dem folgt für mich kein Rückzug auf manuelle Arbeit. Ich möchte die Fähigkeiten der Modelle nutzen – aber in einer Umgebung, die nicht allein auf deren Selbstauskunft angewiesen ist.
Für unser Kampagnenbeispiel würde das heißen: Das Briefing und freigegebene Daten bilden eine definierte Grundlage. Die KI entwickelt Optionen und kennzeichnet Annahmen. Budgetrechnungen werden separat ausgeführt und geprüft. Fachlich strittige Aussagen bleiben zur Entscheidung offen. Das Konzept wird als Entwurf übergeben, zusammen mit den Unterlagen, die für eine Freigabe gebraucht werden.
Ein zweites Modell könnte dabei zusätzliche Kritik liefern. Seine Zustimmung wäre für mich aber kein Ersatz für den Abgleich mit Daten oder für eine fachliche Entscheidung. Zwei überzeugende Antworten machen aus einer unbelegten Annahme noch keinen Beleg.
Dabei muss nicht jeder Schritt von KI gesteuert werden. Wenn die Reihenfolge feststeht oder eine Regel eindeutig ist, würde ich sie in Software abbilden. Die KI kommt dort zum Einsatz, wo ihr Umgang mit Sprache, Varianten und unstrukturierten Informationen tatsächlich einen Vorteil bringt.
Diese Zurückhaltung ist auch technisch gut begründbar: Anthropic unterscheidet zwischen vordefinierten Workflows und Agenten, die ihre nächsten Schritte selbst bestimmen, und empfiehlt, mit der einfachsten ausreichenden Lösung zu beginnen. Mehr Eigenständigkeit bedeutet zusätzliche Abwägungen bei Kosten, Laufzeit und möglichen Fehlerketten. 9
Für mich ergibt sich daraus ein Entwicklungsweg: zunächst im Chat Aufgaben und Qualitätsmaßstäbe verstehen; funktionierende Vorgehensweisen als wiederverwendbare Skills festhalten; daraus kontrollierte Abläufe entwickeln. Agentische Entscheidungen kommen hinzu, wo ihre Flexibilität einen nachweisbaren Vorteil bringt.
Das ist keine Pflichtleiter zur Vollautonomie. Ein begrenzter Workflow kann die dauerhaft bessere Lösung sein.
Und auch ein gut gebauter Ablauf bleibt fehlbar. Ein bestandener Test belegt zunächst nur, dass dieser Test bestanden wurde. Eine dokumentierte Quelle kann trotzdem ungeeignet sein. Die fachliche Frage, ob wir das Richtige prüfen, verschwindet nicht dadurch, dass die Prüfung automatisiert läuft.
Die Rechnung endet nicht beim Modellpreis
Damit sind wir bei einem weiteren Punkt meiner Keynote:
Eine Monatsflatrate ist noch keine Kalkulation für einen automatisierten Geschäftsprozess.
Für das Kampagnenkonzept interessiert mich nicht nur, wie lange die Generierung gedauert hat. Ich möchte wissen, wie viel Aufwand bis zum verwendbaren Ergebnis entstanden ist: Daten aufbereiten, Aufgabe formulieren, Varianten erzeugen, Quellen kontrollieren, Fehler korrigieren, Abstimmungen durchführen und das Ergebnis in die tatsächliche Arbeit überführen.
Dazu kommen bei einer eigenen Lösung Entwicklung, Pflege und Betrieb. Ob sich der Einsatz lohnt, lässt sich erst beurteilen, wenn wir diese Rechnung dem bisherigen Vorgehen gegenüberstellen – bei vergleichbarer Qualität.
Das kann sehr deutlich zugunsten von KI ausgehen. Eine vorbereitete Analyse kann eine fachliche Prüfung erheblich erleichtern. Ein guter erster Entwurf kann Zeit für die eigentliche Entscheidung schaffen. Aber das muss sich im jeweiligen Prozess zeigen. Die Geschwindigkeit des ersten Outputs allein reicht mir als Nachweis nicht.
Dass ein System länger „nachdenkt“, ist deshalb weder automatisch gut noch automatisch schlecht. Entscheidend ist, ob der zusätzliche Aufwand zu besseren, besser prüfbaren oder insgesamt günstigeren Ergebnissen führt.
Ich möchte weder möglichst viele Tokens noch möglichst viele Agenten. Ich möchte bessere Arbeit zu vertretbaren Kosten.
AI native oder naiv?
Ich bleibe begeistert. Gerade weil ich KI nützlich finde, möchte ich sie nicht mit Erwartungen belasten, die ein konkretes System im konkreten Einsatz nicht nachweislich erfüllen kann.
Graepels Beitrag ist für mich deshalb kein Anlass, Sprachmodelle abzuschreiben. Er ist ein Anlass, genauer hinzusehen: Was ist eine Fähigkeit? Was ist eine plausible Erklärung? Was ist ein überprüftes Ergebnis? Und was davon brauchen wir, bevor wir einem System Entscheidungen und Handlungen überlassen?
Wir sollten die philosophische Frage nach dem Denken nicht benutzen, um uns vor diesen praktischen Fragen zu drücken. Weder mit „Das ist alles nur Statistik“ noch mit „Das Modell ist inzwischen so intelligent, dass wir ihm vertrauen können“.
Meine Vorstellung von AI native ist, Arbeit mit KI neu zu gestalten und ihren Nutzen nachzuweisen. Dazu gehört auch die Entscheidung, einen Schritt nicht zu automatisieren oder einem System weniger Rechte zu geben, als technisch möglich wären.
Naiv wäre, eine beeindruckende Vorführung mit einem belastbaren Verfahren zu verwechseln – und die fehlende Prüfung anschließend „menschliche Verantwortung“ zu nennen.
Ob KI denkt, können wir weiter diskutieren. Dass wir ihren Einsatz zu Ende denken müssen, steht für mich fest.
Quellen und weiterführende Texte
- Thore Graepel: Don’t be fooled—LLMs don’t reason. MIT Technology Review, 2. Oktober 2026.
- Thore Graepel: Eigene Zusammenfassung des Gastbeitrags auf LinkedIn, 2. Oktober 2026.
- Anthropic: Tracing the thoughts of a large language model. 27. März 2025.
- DeepSeek-AI et al.: DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
- Anthropic: Reasoning models don’t always say what they think. 3. April 2025.
- David Silver et al.: Mastering the game of Go with deep neural networks and tree search. Nature, 2016; Forschungsseite bei Google Research.
- Kai Spriestersbach: Der KI-Graben: Warum GenAI die einen besser macht – und die anderen abhängig. AFAIK, 15. Juni 2026.
- OWASP: AI Agent Security Cheat Sheet.
- Anthropic: Building effective agents.
Abonniere das AFAIK-Update
Bleib auf dem Laufenden in Sachen Künstliche Intelligenz im Online Marketing!
Melde Dich jetzt mit Deiner E-Mail-Adresse an und ich versorge Dich kostenlos mit News-Updates, Tools, Tipps und Empfehlungen Rund um KI aus den Bereichen Online-Marketing, SEO, GEO, WordPress und vieles mehr.
Keine Sorge, ich mag Spam genauso wenig wie Du und gebe Deine Daten niemals weiter! Du bekommst höchstens einmal pro Monat eine E-Mail von mir. Versprochen.
