← Wissen

Leitfaden

Dürfen simulierte Kund:innen die nächste Produktentscheidung bestimmen?

Ein KI-Modell kann tausend plausible Antworten erzeugen. Ein Nachweisbogen hilft zu prüfen, welche Produktentscheidung diese Antworten tatsächlich stützen können.

Von Dr. Sven JungmannVeröffentlicht: · Geprüft:
Eine Lupe über einer Reihe gleichartiger blauer Silhouetten und unterschiedlich gemalten Porträts auf einzelnen Karten.

Auf einen Blick

  • Legen Sie vorab fest, ob die Simulation Fragen vorbereiten oder eine Kund:innenpräferenz schätzen soll.
  • Verlangen Sie einen Vergleich mit geeigneten menschlichen Antworten, die für die Prüfung zurückgehalten wurden.
  • Halten Sie erzeugte Antworten, beobachtete Menschen und die zulässige Entscheidung in jeder Ergebnisvorlage auseinander.

Ein fiktives Medizintechnikunternehmen entscheidet über die nächste Funktion seines Kund:innenportals. Zur Wahl stehen aktuelle Lieferinformationen und der Abruf von Wartungsunterlagen. Das Team lässt ein KI-Modell aus der Sicht von Einkaufsverantwortlichen antworten. Nach tausend erzeugten Antworten gibt es einen deutlichen Favoriten. Nun soll das Entwicklungsbudget freigegeben werden.

Vor dieser Zusage würde ich fragen, was die Übung über die Menschen belegt, die das Portal tatsächlich nutzen sollen. Tausend erzeugte Antworten beschreiben die Ausgabe des gewählten Verfahrens. Die wirtschaftliche Entscheidung betrifft Kund:innen mit konkreten Zuständigkeiten, vorhandenen Alternativen und begrenzter Zeit. Die Verbindung zwischen beidem braucht Belege.

Als Gründer von aiomics interessiert mich die dahinterliegende Ressourcenentscheidung: Was lässt sich mit geringem Aufwand klären, bevor Entwicklungszeit gebunden wird, und welche Unsicherheit erfordert weiterhin den Kontakt zu den vorgesehenen Nutzer:innen? Simulierte Gespräche können ein Vorschlag sein, um Fragen zu erkunden. Dieser Status muss erkennbar bleiben, wenn aus einer Erkundung eine Budgetvorlage wird.

Vorab festlegen, welche Entscheidung die Simulation stützen darf

Beim fiktiven Portal würde ich drei mögliche Verwendungen unterscheiden. Das Team könnte denkbare Einwände gegen beide Funktionen sammeln, ein Gespräch üben oder schätzen, welche Funktion Kund:innen bevorzugen. Dafür sind unterschiedliche Belege nötig. Ein vorgestellter Einwand kann zu einer Untersuchungsfrage werden. Eine Schätzung, die als Kund:innenpräferenz vorgelegt wird, braucht einen nachvollziehbaren Bezug zu diesen Menschen.

Angenommen, die simulierte Einkaufsverantwortliche erklärt, Lieferinformationen seien wichtig, weil Kolleg:innen ständig wegen verspäteter Bestellungen anrufen. Daraus entsteht eine Gesprächsfrage: Wann gab es zuletzt eine solche Unterbrechung, welche Information fehlte, und wie wurde sie beschafft? Wie häufig das im Kund:innenkreis vorkommt, ist damit noch offen. Im nächsten Schritt lässt sich der vermutete Zusammenhang untersuchen.

Ich würde die Übung entsprechend kennzeichnen: erzeugte Hypothesen für Kund:innengespräche. Soll später eine Prozentzahl in einer Vorstandsvorlage stehen, muss das Team diese zusätzliche Verwendung begründen. Häufigeres Erzeugen liefert für sich genommen keine neuen Beobachtungen von Kund:innen.

Forschung anhand ihrer konkreten Aufgabe lesen

Argyle und Kolleg:innen bildeten mit GPT-3 und Hintergrundangaben echter Befragter ausgewählte Muster amerikanischer politischer Umfragen nach. Ihre Studie von 2023 macht die Eignung vom Kontext und der Bevölkerung abhängig. Eine Genauigkeit für unsere Portalentscheidung belegt sie nicht. [1]

Bisbee und Kolleg:innen verglichen Antworten von ChatGPT 3.5 Turbo mit 7.530 Profilen amerikanischer politischer Umfragen von 2016 und 2020. Die Veröffentlichung von 2024 zeigt ähnliche Gesamtmittelwerte bei geringerer Streuung und verzerrten Zusammenhängen. Sie bewertet keine heutigen Marktforschungsprodukte. [2]

Modelle, Fragen und Verfahren unterscheiden sich zwischen diesen Studien. Für Auftraggeber:innen bleibt eine praktische Frage: Welche Untersuchung stützt genau die angebotene Verwendung? Eine Vorführung flüssiger Dialoge ermöglicht zunächst, diese Dialoge zu betrachten. Die beabsichtigte wirtschaftliche Aussage braucht eine eigene Prüfung.

Einen Vergleich verlangen, der die Entscheidung verändern könnte

Für das Portalbeispiel schlage ich einen kurzen Nachweisbogen mit fünf Einträgen vor. Das ist mein eigener organisatorischer Vorschlag; eine Wirkung auf die Entscheidungsqualität ist hier nicht nachgewiesen. Eine Fachperson für empirische Forschung sollte die eigentliche Prüfung und den erforderlichen Stichprobenumfang mitgestalten.

Erstens: die Entscheidung. Wählen wir eine Funktion für weitere Gespräche, einen zu prüfenden Prototyp oder die tatsächlich zu entwickelnde Funktion? Halten Sie die Kosten eines Irrtums und den Zeitpunkt fest, ab dem die Wahl schwer umkehrbar wird. Eine erste Erkundung und eine erhebliche Entwicklungszusage sollten nicht ungeprüft denselben Belegmaßstab erhalten.

Zweitens: die Menschen. Wer bestellt, wer benötigt Lieferinformationen, und wer genehmigt Ausgaben? Im Beispiel könnten das unterschiedliche Rollen sein. Eine erzeugte Figur namens „Einkaufsverantwortliche“ lässt diese Unterschiede möglicherweise offen. Benennen Sie die Zielgruppe und ihre tatsächlich bekannten Merkmale einschließlich der Herkunft dieses Wissens.

Drittens: der Vergleich. Bitten Sie den Anbieter, Vorhersagen mit geeigneten menschlichen Antworten zu prüfen, die für die Auswertung zurückgehalten wurden. Diese Antworten dürfen dem Modell weder zur Erzeugung der Vorhersagen vorgelegen haben noch zur Anpassung des geprüften Verfahrens gedient haben. Fragen Sie auch nach möglichen Überschneidungen mit früheren Trainingsdaten. Lässt sich das nicht klären, gehört diese Unsicherheit in den Bericht.

Viertens: der vorab vereinbarte Maßstab. Legen Sie vor Einsicht in die Ergebnisse fest, was als ausreichend gelten würde. Für diese Wahl möchte ich wissen, ob das Verfahren dieselbe Funktion bevorzugt und ob wichtige Nutzer:innengruppen zu anderen Entscheidungen führen. Die Untersuchung sollte Unsicherheit und Belegumfang für jede Gruppe berücksichtigen. Eine gute Gesamtübereinstimmung kann mit einer offenen Entscheidung für eine kleinere Gruppe einhergehen.

Fünftens: die zulässige Folge. Ein Ergebnis könnte rechtfertigen, die Simulation zur Gesprächsvorbereitung einzusetzen, während die Funktionsauswahl weiterhin von Kund:innenforschung abhängt. Ein stärkerer Vergleich im konkreten Einsatz könnte eine eng umrissene Verwendung stützen. Halten Sie Modellversion, Anweisungen, Eingangsdaten und Prüfdatum fest, damit spätere Änderungen eine Entscheidung über eine erneute Prüfung auslösen.

Die gezählten Einheiten sichtbar halten

Nehmen wir an, 700 der tausend erzeugten Antworten bevorzugen Lieferinformationen. In dieser fiktiven Rechnung beschreiben 70 Prozent erzeugte Antworten unter dem angegebenen Verfahren. Die Formulierung „70 Prozent der Kund:innen bevorzugen Lieferinformationen“ verändert die beschriebene Grundgesamtheit. Eine solche Aussage braucht Belege dafür, wie das Verfahren Präferenzen in dieser Bevölkerung schätzt und welche Unsicherheit mit der Schätzung verbunden ist.

Weitere tausend erzeugte Antworten können helfen, die Schwankungen des Verfahrens zu untersuchen. Sie fügen keine tausend unabhängig beobachteten Kund:innen hinzu. Auch ein sehr schmales Intervall um einen erzeugten Anteil ließe die Unsicherheit über dessen Bezug zu tatsächlichen Präferenzen offen. Ich würde die verantwortliche Fachperson bitten, beide Fragen getrennt zu erläutern.

Selbst eine sorgfältige Befragung von Menschen lässt eine weitere Unterscheidung bestehen: welche Möglichkeit sie nach eigener Aussage bevorzugen und welche sie tatsächlich nutzen, wenn sie verfügbar ist. Für unsere fiktive Entscheidung könnte ein begrenzter Prototypversuch die Nutzung vor einer größeren Zusage untersuchen. Ob dieser vorgeschlagene Schritt passt, hängt vom Produkt und der Entscheidung ab.

Die Herkunft bei der Präsentation erhalten

Der ICC/ESOMAR-Kodex von 2025 verlangt die Offenlegung synthetischer Daten und menschlicher Aufsicht gegenüber Auftraggeber:innen; für Veröffentlichungen fordert er methodische Transparenz. Er ist ein berufsständischer Kodex. Offenlegung allein belegt keine Vorhersagegüte. [3]

Ich würde den Nachweisbogen jeder Folie mit dem Ergebnis beifügen. Kolleg:innen sollten den erzeugten Anteil, den menschlichen Vergleich, offene Lücken und die freigegebene Entscheidung erkennen können. Die Kennzeichnung sollte erhalten bleiben, wenn die Folie in eine andere Präsentation wandert.

Für die nächste Produktbesprechung lautet die unmittelbare Frage damit: Was würden wir wegen dieser simulierten Antworten anders entscheiden, und welche Beobachtung trägt diese Änderung? Wo die Antwort offenbleibt, kann die Simulation Fragen für die nächste Untersuchung liefern. Das Entwicklungsbudget kann anschließend dem folgen, was diese Untersuchung tatsächlich belegt.

Quellen und weiterführende Lektüre

  1. Argyle et al. (2023)Political Analysis

    Politische Antworten.

  2. Bisbee et al. (2024)Political Analysis

    Verteilungen und Zusammenhänge.

  3. ICC/ESOMAR-Kodex (2025)ICC/ESOMAR

    Artikel 7 und 9.

Ausgangspunkt dieser Einordnung

Argyle et al. (2023)

Perspektive und Interessen

Dieser Beitrag wurde mit KI-Unterstützung erarbeitet. Unternehmen, Portal und Zahlenbeispiel sind fiktiv. Der Nachweisbogen ist ein eigener organisatorischer Vorschlag ohne wissenschaftliche Validierung.

Ich bin Gründer und Geschäftsführer von aiomics. Der Beitrag berichtet keine Kund:innenergebnisse und bewertet keine heutigen Anbieter. Die Quellen wurden am 3. Oktober 2026 geprüft.

Weiterlesen

Worum soll es bei Ihrer Veranstaltung gehen?

Nennen Sie Publikum, Anlass und Termin. Im Vorgespräch klären wir, welche Veränderungen Ihre Organisation beschäftigen und was der Vortrag dazu beitragen soll.

Vortrag anfragen