Das Versprechen synthetischer Zielgruppen ist verlockend: Bevor du einen Dollar in Media steckst, zeigst du dein Werbemittel einem Panel aus KI-Personas, das auf dein Zielsegment kalibriert ist, und bekommst in Minuten vorhergesagte Reaktionen zurück. Wenn KI-Generierung 50 Varianten eines Briefings günstig macht, lautet die naheliegende Frage, welche der 50 du wirklich schalten sollst, und ein synthetischer Pretest verspricht, sie zu beantworten, ohne Testbudget zu verbrennen. Das Geld in diesem Markt ist echt, und manche veröffentlichten Ergebnisse gegenüber echten Umfragedaten wirken stark, auch wenn die weiter unten zitierte kommerzielle Zahl vom Kunden eines Anbieters stammt und nicht aus einem unabhängigen Test. Man vertraut ihnen auch leicht zu sehr. Dieser Text zeigt, wo sich ein synthetischer Pretest in einem kreativen Workflow einen Platz verdienen kann und wo es dich still und leise teuer zu stehen kommen kann, dich darauf zu verlassen.
Was eine synthetische Zielgruppe eigentlich ist
Eine synthetische Zielgruppe ist ein Panel aus KI-generierten Personas, gebaut, um die Antworten eines echten Zielsegments zu simulieren. Du befragst es wie ein Umfragepanel oder eine Fokusgruppe, nur dass kein einziger Mensch dabei ist. Du beschreibst deine Zielgruppe, das System erzeugt oder holt passende Personas, und du zeigst ihnen Werbemittel und sammelst vorhergesagte Reaktionen, Vorlieben und Rankings. Das Panel sagt Antworten vorher, statt sie zu messen.
Investoren setzen auf die Idee. Simile, deren Gründungsteam laut dem Lead-Investor Index Ventures "introduced the original concepts of generative agents" (die ursprünglichen Konzepte der generativen Agenten eingeführt hat), gab im Februar 2026 eine Finanzierung über 100 Millionen US-Dollar unter Führung von Index Ventures bekannt, unter anderem mit Bain Capital Ventures, Andrej Karpathy und Fei-Fei Li. Am 2026-07-30 folgte eine Series B über mehr als 200 Millionen US-Dollar bei einer Post-Money-Bewertung von 2 Milliarden US-Dollar, gemeinsam angeführt von Greenoaks und Index Ventures.
Bei Aaru, einem weiteren Unternehmen für KI-Simulation, ist die verfügbare Zahl die Aussage eines Kunden, kein unabhängiges Ergebnis. In einem am 2025-10-07 veröffentlichten Beitrag schreibt EY, das den Test mit Aaru durchgeführt hat: "Using Aaru's proprietary multi-agent infrastructure, EY recreated its Global Wealth Management Survey, which normally spans 3,600 affluent investors across 30+ markets and takes six months to complete. The simulation was completed in one day and evaluated across 53 single-select questions, achieving a median Spearman correlation of 0.90." (Kurz gesagt: Mit der Multi-Agenten-Infrastruktur von Aaru hat EY seine globale Vermögensumfrage, die sonst sechs Monate dauert, an einem Tag nachgebildet und beim Vergleich der Antworten diese mediane Spearman-Korrelation erreicht.) Dieselbe Seite nennt als durchschnittliche Abweichung pro Frage 7,1 Prozentpunkte und berichtet außerdem von "notable divergences" (deutlichen Abweichungen), darunter "a -37.82% correlation" (eine negative Korrelation) bei der Nachlassplanung. Lies das als EYs Bericht über das eigene Projekt mit dem Anbieter.
Die akademische Arbeit hinter datenbasierten Agenten ist eine Studie von Joon Sung Park und Kollegen, die Agenten von 1.052 US-Amerikanern aus zweistündigen Interviews, aus Umfragen oder aus beidem gebaut haben. In der aktuellen Fassung des Papers erreichten die Agenten bei zurückgehaltenen Fragen des General Social Survey 83 % (nur Interviews), 82 % (nur Umfragen) und 86 % (beides) der Konsistenz, die die Teilnehmenden selbst bei einer Wiederholung nach zwei Wochen zeigen, gegenüber 74 % bei Agenten, die nur demografische Angaben bekamen.
Diese Zahlen klingen stark. Die Falle ist die Annahme, sie ließen sich auf deine konkrete kreative Entscheidung übertragen: Gemessen wurden sie an Umfragefragen, nicht an Reaktionen auf eine neue Anzeige.
Was sie vorhersagen kann und was nicht
Am stärksten ist die veröffentlichte Evidenz bei Umfragefragen, deren Antworten davon abhängen, wer antwortet. Der Verasight-Bericht vom Januar 2026 sagt es klar: Fragen, die "heavily discussed in public discourse and well-represented in LLM training data, particularly political attitudes, are easier to impute than questions about personal behaviors and preferences that lack strong demographic correlates" (die öffentlich viel diskutiert und in den Trainingsdaten von LLMs gut vertreten sind, vor allem politische Einstellungen, lassen sich leichter imputieren als Fragen zu persönlichem Verhalten und Vorlieben ohne starke demografische Korrelate), denn "an LLM has few demographic proxies for what type of consumer prefers a pumpkin spice latte to a regular cup of coffee." (ein LLM hat kaum demografische Anhaltspunkte dafür, welcher Typ Konsument einen Pumpkin Spice Latte einem normalen Kaffee vorzieht). Reaktionen auf eine neue Anzeige liegen näher am Pumpkin-Spice-Ende. Wenn du also ein synthetisches Panel nutzt, stell ihm relative Fragen zu einem Batch (welcher dieser fünf Hooks, welche Botschaft relevant wirkt, wie ein Konzept im Vergleich zu den Alternativen abschneidet) und nimm die Antwort als Hilfe bei der Entscheidung, was in einen echten Test geht, nicht als Prognose dafür, wie eine einzelne Anzeige abschneidet.
Derselbe Bericht zeigt, wo es bricht. Bei Mehrfachauswahl-Fragen wählte das LLM 31 % der Optionen nie aus, und die Autoren schreiben: "do not recommend using LLMs to generate data for multi-response questions" (wir raten davon ab, LLMs für Daten zu Mehrfachauswahl-Fragen zu nutzen). Am schlechtesten schnitten Fragen zu persönlichen Erfahrungen und Verhaltensvorlieben ab, die "lack strong demographic predictors" (keine starken demografischen Prädiktoren haben), mit mittleren absoluten Fehlern von 27 % bis 33 % bei den vier Beispielen, die der Bericht nennt; über die Antwortoptionen der Einfachauswahl-Fragen lag der Fehler im Schnitt bei 14,5 Prozentpunkten, und der Bericht fand "a systematic tendency to regress predictions toward the mean" (eine systematische Tendenz, Vorhersagen zum Mittelwert hin zu ziehen). Paglieri und Kollegen (2026) halten fest, dass die meisten Ansätze zur Persona-Generierung detaillierte Daten über die Zielpopulation brauchen und oft "density matching (replicating what is most probable) rather than support coverage (spanning what is possible), leaving long-tail behaviors underexplored." priorisieren (das Wahrscheinlichste nachbilden statt das Mögliche abdecken, wodurch Verhalten im Long Tail kaum erkundet wird). Und eine Übersicht von Batzner und Kollegen über 63 begutachtete Studien, die zwischen 2023 und 2025 auf führenden NLP- und KI-Konferenzen erschienen, fand, dass Repräsentativität und ökologische Validität synthetischer Personas "vary considerably between studies" (sich von Studie zu Studie stark unterscheiden), dass Aufgabe und Zielpopulation oft unzureichend festgelegt sind und dass nur 35 % der Studien diskutierten, wie repräsentativ ihre Personas waren.
Übersetzt in kreative Entscheidungen: Ein Panel, das Antworten zur wahrscheinlichsten hin zieht, kann dir helfen, einen Batch zu sortieren, aber erwarte nicht, dass es dich überrascht. Es kann ungewöhnliche Reaktionen unterschätzen, und eine ungewöhnliche Idee ist vielleicht genau das, was du testest. Verlass dich nicht darauf, dass es eine Kränkung oder ein kulturelles Missverständnis erkennt, das ein echter Mensch bemerken würde.
Der Workflow: erst Pretest, dann Budget
Als Filter statt als Orakel eingesetzt, passt ein synthetischer Pretest in eine KI-gestützte Kreativ-Pipeline.
Breit generieren. Starte mit einem Batch: ein Briefing, daraus 40 bis 50 Varianten mit unterschiedlichen Hooks, Bildern und Botschaften, mit dem Workflow für KI-Anzeigenvarianten-Tests. Menge ist der Rohstoff: Der Pretest braucht etwas zum Filtern.
Vortesten, um zu sortieren, nicht um zu entscheiden. Lass den Batch von deiner synthetischen Zielgruppe ranken und clustern. Ziel ist, die offensichtlichen Verlierer auszusortieren und 10 bis 15 Kandidaten für einen echten Test herauszuarbeiten, nicht einen einzigen Sieger zu küren.
Budget auf die Überlebenden, im Markt. Bring die Shortlist in einen echten Markttest mit kleinem Budget auf Meta oder TikTok. Diesen Schritt darf niemand überspringen. Stell jeder synthetischen Vorhersage einen echten Check im Markt gegenüber: Die synthetische Ebene grenzt das Feld günstig ein, die Live-Ebene liefert die Wahrheit.
Ergebnisse zurückspielen. Was im Markt gewinnt, wird zum Kalibrierungssignal. Mit der Zeit lernst du, wie gut die Rankings deines synthetischen Panels deine Live-Ergebnisse vorhergesagt haben, und daraus, wie sehr du ihm beim nächsten Mal trauen kannst. Über diese Feedbackschleife findest du heraus, ob das Panel in deiner Kategorie ein Filter oder eine Krücke ist.
Der ganze Wert des Workflows liegt in der Reihenfolge: synthetisch, um günstig zu filtern, live, um ehrlich zu bestätigen. Dreh die Reihenfolge um oder lass den Live-Schritt weg, und du hast eine validierte Entscheidung gegen eine selbstbewusste Vermutung getauscht.
Der skeptische Teil
Ein paar Punkte, damit das Werkzeug nicht vom Filter zur Autorität wird.
Kalibrierung ist nicht Wahrheit. Die von EY berichtete mediane Korrelation von 0,90 mit einer bestehenden Umfrage oder die 83 % bis 86 % Wiederholungskonsistenz im Paper von Park beschreiben, wie gut Modelle Antworten auf Umfragefragen getroffen haben. Über dein konkretes neues Werbemittel sagen sie nichts Direktes, vor allem wenn es etwas Ungewöhnliches macht.
Die Neigung zum Durchschnitt kann gegen das arbeiten, was du von einem Werbemittel willst. Verasight fand bei Umfrageantworten "a systematic tendency to regress predictions toward the mean" (eine systematische Tendenz, Vorhersagen zum Mittelwert hin zu ziehen); macht ein Panel dasselbe mit Anzeigen, neigt es zur sichersten Variante. Bevor du eine Variante nur deshalb streichst, weil das Panel sie weit unten einsortiert hat, prüf, ob sie wegen ihrer Ungewöhnlichkeit unten gelandet ist, und überleg, ein oder zwei Ausreißer im Live-Test zu behalten.
Frag, was eine Zahl misst. Anbieter und ihre Kunden berichten ihre eigenen Genauigkeitswerte, und "eine Korrelation von 0,90" kann je nach Vergleichsmaßstab sehr Verschiedenes bedeuten: Die Zahl von EY ist eine Rangkorrelation (Spearman) über 53 Umfragefragen, keine Trefferquote bei Anzeigenentscheidungen. Frag, woran eine Zahl gemessen wurde, bevor du ihr in einer Entscheidung Gewicht gibst.
Nichts davon macht synthetische Zielgruppen zu einem schlechten Werkzeug. Es macht sie zu einem Filter mit blinden Flecken, der trotzdem nützlich sein kann, wenn du entscheidest, welche 12 von 50 Varianten echtes Budget verdienen.
Was das für Markenteams bedeutet
Ehrlich betrachtet verdichtet ein synthetischer Pretest den oberen Teil des Funnels, nicht den ganzen. Er kann die Frage "welche davon sollten wir überhaupt testen" günstiger und schneller beantworten, und das zählt, wenn KI-Generierung 50 Varianten leicht herstellbar und unmöglich gleichzeitig testbar macht.
Was er nicht tut: den Test im Markt ersetzen, und jedes Versprechen, das etwas anderes sagt, geht über die Forschung hinaus. Als Triage-Ebene passt er: breit generieren, per Pretest eine Shortlist bilden, mit Budget bestätigen, mit der Zeit kalibrieren. Als Entscheidung eingesetzt, lässt er eine selbstsicher klingende Vorhersage den Teil ersetzen, in dem die Realität mitstimmt.
Häufige Fragen
Wie genau sind synthetische Zielgruppen?
Das hängt von der Frage ab, und die kommerzielle Zahl hier ist die Aussage eines Kunden über einen Anbieter. EY sagt, seine Nachbildung einer Vermögensumfrage mit Aaru habe eine mediane Spearman-Korrelation von 0,90 erreicht (EY, 2025-10-07). Im Paper von Park erreichten datenbasierte Agenten von 1.052 US-Amerikanern 83 % bis 86 % der Wiederholungskonsistenz der Teilnehmenden selbst bei Fragen des General Social Survey. Verasight fand deutlich größere Fehler bei Mehrfachauswahl-Fragen und bei persönlichem Verhalten mit schwachen demografischen Prädiktoren. Reaktionen auf Werbemittel liegen näher an dieser zweiten Art.
Kann eine synthetische Zielgruppe einen A/B-Test ersetzen?
Nein. Nutze sie, um Varianten günstig zu ranken und eine Shortlist zu bilden, und setz dann ein kleines Marktbudget auf die Shortlist. Spiel die Live-Ergebnisse zurück, um zu lernen, wie gut die synthetischen Rankings deine Ergebnisse vorhersagen.
Bietet 8frame synthetische Zielgruppen an?
Nein. 8frame generiert die Bild- und Videovarianten; das synthetische Panel ist ein separates Werkzeug.
Was kostet es, 50 Varianten für einen Pretest zu generieren?
Auf 8frame kosten 50 Standbilder mit Nano Banana 2 in 1K 550 Credits (11 pro Bild). Video kostet mehr: 50 fünfsekündige Clips mit Kling v3 Standard kosten 4.300 Credits mit Ton (86 pro Clip, die Voreinstellung des Kling-Tools) oder 2.850 ohne Ton (57 pro Clip), und Kling v3 braucht für jeden Clip ein Startbild, etwa eines dieser Standbilder. Ein Credit ist zum Paketpreis etwa 0,01 US-Dollar wert.
Quellen
- Finanzierung von Simile über 100 Mio. US-Dollar und Investoren: Simile, "The Simulation Company" (veröffentlicht am 2026-02-12) und Index Ventures, "Life, the Universe, and Simile: Leading Simile's Series A", 12. Februar 2026 ("the founding team introduced the original concepts of generative agents", das Gründungsteam hat die ursprünglichen Konzepte der generativen Agenten eingeführt), abgerufen am 2026-10-02
- Series B von Simile: Simile, "Announcing Simile's Series B" (veröffentlicht am 2026-07-30; "over $200 million at a $2 billion post-money valuation, co-led by Greenoaks and Index Ventures", Runde, Bewertung und Lead-Investoren in Similes eigenen Worten), abgerufen am 2026-10-02
- Aaru und die Nachbildung der EY-Umfrage, EYs eigener Bericht über ein Projekt mit Aaru (mediane Spearman-Korrelation von 0,90 über 53 Einfachauswahl-Fragen, 3.600 Anleger, durchschnittliche Abweichung von 7,1 Prozentpunkten, "a -37.82% correlation" bei der Nachlassplanung): EY, veröffentlicht am 2025-10-07, abgerufen am 2026-10-02
- Park et al., "LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals" (erstmals im November 2024 als "Generative Agent Simulations of 1,000 People" veröffentlicht; aktuelle Fassung überarbeitet am 2026-06-28; 83 %, 82 % und 86 % für Agenten nur aus Interviews, nur aus Umfragen und aus beidem gegenüber 74 % nur mit demografischen Angaben): arXiv 2411.10109, abgerufen am 2026-10-02
- Verasight, "Can Large Language Models Replicate Survey Data Across Topics?" (G. Elliott Morris und Benjamin Leff, 2026-01-13; 31 % der Mehrfachauswahl-Optionen nie gewählt; schlechteste genannte Beispiele mit 33 %, 30 %, 29 % und 27 % mittlerem absolutem Fehler; insgesamt 14,5 Prozentpunkte; das Beispiel mit dem Pumpkin Spice Latte): verasight.io, abgerufen am 2026-10-02
- Paglieri et al., "Persona Generators: Generating Diverse Synthetic Personas for Arbitrary Contexts" (eingereicht am 2026-02-03): arXiv 2602.03545, abgerufen am 2026-10-02
- Batzner et al., "Whose Personae? Synthetic Persona Experiments in LLM Research and Pathways to Transparency" (63 begutachtete Studien, 2023 bis 2025; nur 35 % diskutierten die Repräsentativität): arXiv 2512.00461, abgerufen am 2026-10-02
- Preise von Nano Banana 2 und Kling v3 Standard auf 8frame, Voreinstellung des Kling-Tools, Startbild-Pflicht bei Kling v3 und das Fehlen jedes Tools für synthetische Zielgruppen: Tool-Registry von 8frame, gelesen am 2026-10-02
Ein synthetischer Pretest braucht einen breiten Batch zum Filtern. Generiere die Varianten auf 8frame, bilde dann eine Shortlist und setz Budget ein. Fang mit dem Workflow für KI-Anzeigenvarianten-Tests an und lies was eine synthetische Zielgruppe ist für die Grundlagen.
Probier es ohne Anmeldung aus: Du landest direkt auf einem echten Board. Der 8frame-Canvas ist kostenlos und unbegrenzt; die Generierung ist kostenpflichtig ab 19 US-Dollar im Monat.