Prompt Research Technik: Prompt Generierung und Prompt Decoding – Snake Oil oder genialer GEO-/AI SEO-Hack?

Von Kai Spriestersbach

Bist du gerade dabei, deine erste GEO-Kampagne zu planen, und fragst dich, woher du die Prompts nehmen sollst, die du tracken kannst – oder woher GEO-Tracking-Tools ihre Vorschläge bekommen?

Dann solltest du wissen, was Prompt Decoding ist und wie Prompt Generierung funktioniert.

Genau das erkläre ich dir in diesem Beitrag – mit wissenschaftlichem Hintergrund, praktischen Beispielen und SEO-Kontext.

Wer sich ernsthaft mit GEO (Generative Engine Optimization) beschäftigt – also der Optimierung für KI-Suchen und Chatbots wie ChatGPT, Gemini, Perplexity, Copilot oder Googles neuen KI-Modus – steht schnell vor einem zentralen Problem: Wir haben keine echten Nutzungsdaten!

Für externe Websites fehlt meist eine nachvollziehbare Zuordnung zwischen tatsächlichem Chat-Prompt, Antwort und Besuch. Anbieterberichte, eigene Kundenbefragungen oder freiwillig geteilte Chats können einzelne Einblicke liefern. Sie ersetzen jedoch kein repräsentatives Prompt-Volumen für unsere Zielgruppe.

Selbst wenn Besucher:innen über KI-Suchen kommen, erfährst du nicht, welcher Prompt sie auf deine Seite geführt hat. Das macht GEO zu einem völlig neuen Spielfeld – und genau hier kommen Prompt Generierung und Prompt Decoding ins Spiel.

Prompt Generierung – Antworten aus der Blackbox

Ich habe mich früh gefragt: Wenn es keine Nutzerdaten gibt – wie können wir dann GEO optimieren?

Als ich Mitte 2024 meinen Kurs „The Future of SEO“ veröffentlichte, existierten kaum GEO-Tracking-Tools oder Einblicke in Chatbot-Nutzung.

Also entwickelte ich eine eigene Lösung: Über einen CustomGPT und die Gemini-API generierte ich sogenannte implizite Fragen – also die zugrunde liegenden Bedürfnisse hinter Suchanfragen.

Damit konnte ich gezielt Inhalte für Googles AI Overviews und die damals neue Search Generative Experience (SGE) optimieren.

Die Idee hinter der Generierung von Prompts

Keywords verdichten unterschiedliche Bedürfnisse. Aus einem Suchbegriff lassen sich mehrere plausible Fragen ableiten; welche davon echte Nutzer stellen, muss gesondert geprüft werden.

Beispiel: Bei der Suche nach „beste Laufschuhe 2025“ stehen meist diese Intentionen dahinter:

  • Welche Modelle sind empfehlenswert?
  • Welche Marke hat das beste Preis-Leistungs-Verhältnis?
  • Was ist neu auf dem Markt?

LLMs können plausible Fragen zu einem Thema erzeugen. Diese Vorschläge sind keine Messung der tatsächlichen Intention oder Häufigkeit.

Ich nutzte zusätzlich das MECE-Framework (Mutually Exclusive, Collectively Exhaustive) als Ordnungshilfe. Das Ziel waren möglichst wenig Überschneidungen und eine breite Themenabdeckung. Eine vollständige Erfassung aller Nutzerbedürfnisse konnte ich damit nicht nachweisen.

Prompt Decoding – ein Blick ins Denken der Modell

Unter Prompt Decoding wird hier ein Ansatz verstanden, bei dem das Modell mögliche Nutzerfragen erzeugt. Die Bezeichnung darf nicht mit dem Rekonstruieren beobachteter Chats oder einer repräsentativen Stichprobe verwechselt werden.

Diese Methode wurde von Hanns Kronenberg (Head of SEO bei Chefkoch) entwickelt und erstmals auf dem legendären SEOktoberfest G50 Summit vorgestellt, wo er den 3. Platz belegte.

Das Besondere an seiner Technik: Er konnte mit seiner Analyse die gleichen Themencluster generieren („writing, knowledge, technology, everyday life, role play“), die im September 2025 im vom NEBR (National Economic Bureau of Research) veröffentlichten Working Paper “How People Use ChatGPT” beschrieben wurden, das auf offiziellen OpenAI-Daten basiert und von der Harvard University IRB (Institutional Review Board) genehmigt wurde.

Das Prinzip hinter Prompt Decoding

Beim Fine-Tuning werden Modelle auf bestimmte Verhaltensweisen angepasst. Sie nach erwarteten Prompts zu fragen, kehrt diesen Prozess nicht mathematisch um und erschließt keine verborgene Nutzerstatistik.

Für Marktforschung kann der Ansatz Kandidaten und Hypothesen liefern. Die erzeugten Sprachmuster stammen aus einer Modellantwort, nicht aus direkt zugänglichen Chats.

Grenzen, Bias und Halluzinationen

So faszinierend die Methode klingt – normale Prompt Generierung hat klare Grenzen. Viele Versprechen klingen nach „magischem Zugriff auf Nutzerintentionen“, sind aber überinterpretiert.

1. Veraltete Trainingsdaten

Alle Modelle besitzen einen Knowledge Cut-Off.

Alles, was danach passiert, kennt das Modell nicht – es kann nur schätzen.
Ohne aktuelle Daten (z. B. über APIs oder RAG-Systeme) produziert das Modell also veraltete oder falsche Prompts. Gerade bei neuen Marken, Rebrandings oder Trends kann das zu Fehleinschätzungen führen.

2. Halluzination und Selbstüberschätzung

LLMs sind statistische Textgeneratoren, keine Wahrheitsmaschinen.

Sie berechnen die wahrscheinlichste Fortsetzung – nicht die richtige.
Deshalb entstehen sogenannte Halluzinationen: plausible, aber falsche Antworten.

Mit gezieltem Prompting kann man offenbar jedoch dieses Risiko reduzieren. Hanns Kronenberg empfiehlt etwa Rollen-Definitionen („Du bist ein analytisches Modell …“), fügt Unsicherheitsmarkierungen hinzu und hat noch eine Menge weiterer Prompt-Tricks eingesetzt.

Doch leider teilt er seinen Systemprompt nicht öffentlich, sondern hat ihn an das Tool RankScale lizensiert. (Rankscale ist ein neues GEO-Tool (Generative Engine Optimization), das entwickelt wurde, um die Markenpräsenz in KI-Suchmaschinen zu analysieren, zu verfolgen und zu optimieren.)

3. Mode Collapse und Typicality Bias

Die Forschung zeigt, dass Modelle nach dem Alignment-Training zu stereotypen Antworten tendieren. Wenn man nach „typischen Prompts“ fragt, liefern sie oft nur den einen dominanten Modus – also die häufigste, nicht die vielfältigste Antwort.

Das nennt man Mode Collapse.

Das Modell spiegelt dann nicht die Breite menschlicher Intentionen wider, sondern die trainierte Voreingenommenheit.

Warum fundierte Schätzungen trotzdem wertvoll sind

Prompt Generierung entschlüsselt also keine echten Daten, aber es kann fundierte Hypothesen liefern.
In der Wissenschaft spricht man dabei von einem „educated guess“ – einer plausiblen Annahme auf Basis von Erfahrung und Modellwissen.

Educated Guessing als Prinzip

Imputation ergänzt fehlende Werte innerhalb eines Datenmodells unter bestimmten Annahmen. Eine synthetische Liste von Nutzerfragen ist damit nur lose vergleichbar: Ohne beobachtete Grundgesamtheit und Validierung fehlen die Voraussetzungen für eine statistisch belastbare Nutzungsverteilung.

Prompt Research zeigt, welche Fragen das Modell unter den gewählten Anweisungen erzeugt. Daraus lässt sich weder der genaue Inhalt seiner Trainingsdaten noch die Häufigkeit tatsächlicher Nutzerfragen ablesen.

Marketing-Teams können so Hypothesen zu Zielgruppeninteressen bilden und mögliche Fragen für Interviews oder Tests sammeln. Eine Früherkennung realer Trends erfordert zusätzliche Beobachtungsdaten.

Forschungsergebnisse zur Imputation mit LLMs

In einem meiner Forschungsprojekte an der RPTU und dem DFKI (Deutsches Forschungszentrum für Künstliche Intelligenz) haben wir untersucht, ob LLMs fehlende Daten sinnvoll ergänzen können.
Die Studie “Had Enough of Experts? Quantitative Knowledge Retrieval From Large Language Models” zeigte:

  • LLMs können Lücken mit plausiblen Werten füllen, besonders in domänenspezifischen Kontexten.
  • Die Qualität variiert je nach Fachgebiet: In Medizin, Wirtschaft und Biologie am besten, in technischen Datensätzen schwächer.

Die verlinkte Untersuchung behandelt quantitative Wissensabfragen und die Ergänzung fehlender Werte in den untersuchten Datensätzen. Sie validiert nicht die Repräsentativität synthetischer Chat-Prompts. Diese Übertragung ist eine Hypothese, kein Studienergebnis.

Prompt Generierung in der GEO-Praxis

Wie setzt man das Ganze nun praktisch um?
Hier ein einfacher Workflow, den viele GEO-Tools integriert haben:

  1. Seed-Themen definieren
    Wähle 5–10 relevante Themencluster deiner Marke oder Branche.
  2. LLM-Abfragen formulieren
    Frage z. B.:
    „Welche typischen Prompts würdest du zum Thema X erwarten?“
    oder
    „Welche Fragen stellen Nutzer:innen häufig, wenn sie Y recherchieren?“
  3. Prompts konsolidieren
    Bereinige Duplikate, entferne unrealistische Anfragen, gruppiere semantisch.
  4. Tracking-Setup
    Nutze diese Prompts in deinem GEO-Tracking-Tool, um zu sehen, welche Quellen die KI nennt.
  5. Analyse & Optimierung
    Prüfe, wie häufig deine Marke zitiert wird, und justiere deine Content-Strategie.

Doch Vorsicht: So erhältst du nur den verzerrten, dominanten Modus – nicht die ganze Vielfalt.
Hier setzt der nächste methodische Schritt an.

Ist „Verbalized Sampling“ der Trick hinter Prompt Decoding?

Der SEO-Kollege Christopher Wagner (Head of SEO, RP Digital) machte mich auf ein neues Paper von Zhang et al. (2025) mit dem Titel „Verbalized Sampling“ aufmerksam. Die Forscherinnen und Forscher schlagen darin zur Vermeidung des Mode Collapse das sogenannte Verbalized Sampling (VS) vor.

Wie funktioniert das?

Statt nach einer typischen Antwort oder einer Liste zu fragen, bittet man das Modell, mehrere mögliche Antworten inklusive ihrer Wahrscheinlichkeiten zu generieren.

Das Beispiel aus ihrem Paper lautet:

Generate 5 responses to the user query, each within a separate <response> tag. Each <response> must include a <text> and a numeric <probability>. Please sample at random from the tails of the distribution, such that the probability of each response is less than 0.10.

Der „Distribution-level Prompt“ fordert mehrere Antworten mit vom Modell genannten Gewichten an. Die Studie berichtet höhere Vielfalt in ihren Tests. Das ist kein Zugriff auf die vollständige Wissensverteilung und kein Nachweis korrekt kalibrierter Häufigkeiten realer Suchanfragen.

Hier die Demo der Forscher:innen:

Sie haben zusätzlich ein Colab zu ihrem Framework veröffentlicht, das ich mir mal genauer angesehen und für den Zweck der Prompt Generierung adaptiert habe. Ein Beispiel-Prompt könnte stark vereinfacht wie folgt lauten:

Generate 10–15 diverse candidate user queries about “[YOUR TOPIC]”. Cover different intents, skill levels, situations and phrasings. Do not use external tools. Treat every query as a hypothesis, not observed user data. Explain which assumptions would need to be checked with customer interviews, existing search data or a defined evaluation set. Do not assign population frequencies or claim completeness.

Die folgende damalige GPT-5-Ausgabe zeigt zugleich das Problem des ursprünglichen Prompts: Die Gewichte wurden vom Modell erzeugt, nicht aus Nutzungsdaten gemessen. Auch eine nachträgliche Normierung macht sie nicht zu empirischen Wahrscheinlichkeiten:

Here’s a synthetic distribution of probable user queries about “Nike Running Shoes,” derived from patterns in natural-language query data and user intent clustering (as seen across retail, fitness, and product-search domains).
Weights reflect relative likelihoods (not normalized to 1.0).


🏃 Nike Running Shoes — Probable Query Distribution

#Example User QueryIntent CategoryRelative Probability Weight
1“best Nike running shoes for men”Product comparison / purchase intent0.85
2“Nike running shoes women’s sale”Shopping / deal-seeking0.80
3“are Nike running shoes good for long distance?”Product evaluation / performance0.65
4“newest Nike running shoe releases 2025”Product discovery / recency0.60
5“difference between Nike Pegasus and Vaporfly”Model comparison / feature analysis0.55
6“Nike running shoes size guide”Fit / sizing assistance0.50
7“cheap Nike running shoes under $100”Price-sensitive shopping0.48
8“Nike trail running shoes review”Niche subcategory / review intent0.42
9“how to clean Nike running shoes”Maintenance / aftercare0.38
10“are Nike running shoes good for flat feet?”Specialized comfort / biomechanical query0.35
11“Nike running shoes vs Adidas running shoes”Brand comparison0.30
12“where to buy Nike running shoes near me”Local commerce / store intent0.28
13“history of Nike running shoes technology”Informational / educational0.18
14“custom Nike running shoes design your own”Personalization / Nike By You intent0.15
15“are Nike running shoes worth it?”Value judgment / general sentiment0.12

🧩 Summary by Category

CategoryTypical User MotivationAggregate Weight (approx.)
Shopping & DealsFind / compare / buy shoes~3.5
Product Evaluation & FitAssess comfort, performance, or fit~1.9
Informational & TechnicalLearn about design, history, or maintenance~1.2
Specialized / PersonalizedExplore niche or creative use cases~0.5

Would you like me to normalize these probabilities (so they sum to 1.0) and show the resulting distribution graphically (e.g., bar chart or pie chart)?

Für meine Anwendung ist die Aufforderung zu unterschiedlichen Perspektiven nützlicher als die Bitte um eine einzelne „typische“ Frage. Ob die Kandidaten die Zielgruppe besser abbilden, muss ein externer Vergleich zeigen.

Bedeutung für Prompt Decoding in der Praxis

Ob Hanns Kronenberg Verbalized Sampling oder einen vergleichbaren Ansatz verwendet, ist ohne seinen veröffentlichten Systemprompt nicht überprüfbar. Ich leite seine Implementierung nicht aus ähnlichen Ergebnissen ab.

So erhältst du eine breitere Kandidatenliste. Mehr Vielfalt bedeutet nicht automatisch mehr Realitätsnähe; Bias muss anhand unabhängiger Daten untersucht werden.

Fazit: Kein Hype, aber ein Werkzeug mit Zukunft

Prompt Decoding erschließt keine geheimen Nutzerdaten. Es erzeugt überprüfbare Vorschläge für ein Testset. Dass eine Antwort plausibel wirkt, ist weder ein Nachweis typischer Nutzung noch ein Blick in interne Entscheidungsprozesse.

Es zeigt Muster – keine Wahrheiten.
Es liefert Insights – keine Messwerte.
Es inspiriert Strategien – keine Garantien.

Ich nutze den Ansatz deshalb für Themenfindung und Hypothesenbildung. Nutzungsanalysen und Trend-Monitoring brauchen beobachtete Daten.

GEO-Arbeit verbindet Beobachtungen mit Hypothesen. Die Wahl eines synthetischen Testsets muss transparent sein und kann durch eigene Kundenfragen ergänzt werden.

Prompt-Generierung und Verbalized Sampling sind mögliche Werkzeuge zur Hypothesenbildung. Ein Nachweis, dass diese Kombination der beste methodische Rahmen für GEO ist, liegt hier nicht vor. Ich kennzeichne generierte Prompts als synthetisch, dokumentiere die Auswahl und prüfe Maßnahmen getrennt vom Testset.

Weiterführende Perspektive

In den kommenden Beiträgen zeige ich dir:

  • wie man Prompts systematisch trackt,
  • wie man KI-Such-Traffic sichtbar macht,
  • und welche Tools & Frameworks dafür am zuverlässigsten funktionieren.

Bleib dran – die nächste Evolutionsstufe von SEO ist datengetrieben, generativ und spannender als je zuvor.

Den Rahmen für überprüfbare GEO-Hypothesen und geeignete Messdesigns erläutere ich ausführlich in Vom Bauchgefühl zur Evidenz: Warum GEO wissenschaftlicher arbeiten muss.

Abonniere das AFAIK-Update

Bleib auf dem Laufenden in Sachen Künstliche Intelligenz im Online Marketing!

Melde Dich jetzt mit Deiner E-Mail-Adresse an und ich versorge Dich kostenlos mit News-Updates, Tools, Tipps und Empfehlungen Rund um KI aus den Bereichen Online-Marketing, SEO, GEO, WordPress und vieles mehr.

Keine Sorge, ich mag Spam genauso wenig wie Du und gebe Deine Daten niemals weiter! Du bekommst höchstens einmal pro Monat eine E-Mail von mir. Versprochen.

Kai Spriestersbach

Geschrieben von

Ich schreibe über KI, digitale Geschäftsmodelle und Suche. Dabei verbinde ich Forschungserfahrung mit technischer Entwicklung und unternehmerischer Praxis.

Mehr über Kai