Mehr Daten. Mehr Insights?
Die Idee klingt verlockend: Was wäre, wenn wir aus einer Stichprobe von 500 Befragten plötzlich 1.500 oder sogar 2.000 Fälle machen könnten? Genau das erreichen wir durch moderne Verfahren zur Generierung synthetischer Daten. Durch sogenannte Boosting-Ansätze werden bestehende Datensätze um künstlich erzeugte Fälle erweitert, die die wesentlichen Muster und Zusammenhänge der Originaldaten widerspiegeln. Vereinfacht gesagt: Das Modell lernt, wie die Daten „funktionieren“, und erzeugt anschließend zusätzliche Fälle, die sich statistisch ähnlich verhalten wie reale Beobachtungen. So können kleine Zielgruppen detaillierter analysiert, regionale Auswertungen stabilisiert und zusätzliche Analysepotenziale erschlossen werden.
Der entscheidende Punkt ist dabei: Synthetische Daten ersetzen Daten von Menschen bis auf Weiteres nicht. Sie können jedoch helfen, deren Informationsgehalt besser auszuschöpfen. Gleichzeitig stellt sich eine zentrale Frage: Wenn wir tiefer in das Datenmeer eintauchen, sehen wir dadurch tatsächlich mehr Perlen oder wirbeln wir lediglich mehr Sand auf?
Mehr Daten oder mehr Erkenntnisse?
Größere Stichproben reduzieren Zufallsschwankungen und ermöglichen detailliertere Analysen. Mit synthetischen Daten lassen sich Datensätze nun gezielt erweitern, ohne zusätzliche Interviews durchführen zu müssen. Doch nicht jede Vergrößerung eines Datensatzes führt automatisch zu besseren Entscheidungen.
Schlechte Modelle können reale Muster sichtbar machen, aber auch bestehende Verzerrungen verstärken oder zufällige Effekte reproduzieren. Im schlimmsten Fall entsteht eine größere Stichprobe mit Scheinsicherheit, ohne dass tatsächlich mehr Wissen entstanden ist. Die entscheidende Frage lautet daher nicht: „Wie stark können wir einen Datensatz vergrößern?", sondern: „Wie viel zusätzlicher Erkenntnisgewinn entsteht tatsächlich?". Oder anders formuliert: Die Kunst besteht darin, echte Perlen von aufgewirbeltem Sand zu unterscheiden.
Ipsos setzt dabei auf verschiedene Modelle, darunter sogenannte Tabular Diffusion Models. Das zugrunde liegende Prinzip ist vielen Anwendern aus der KI-gestützten Bildgenerierung bekannt: Diese KI-Modelle lernen statistische Zusammenhänge wie die Pixel von Bildern und erzeugen neue, realistische Datensätze mit hoher Datenintegrität. Vor der Generierung werden Variablen standardisiert, Inkonsistenzen bereinigt unter Berücksichtigung von Ausreißern Gewichte angepasst und Zusammenhänge geprüft. Da das Modell aus diesen Daten lernt, gilt auch hier: Die Qualität dieser Daten von echten Menschen ist entscheidend. Wir brauchen also insofern Human Intelligence.
Nicht jede Perle glänzt wirklich: Der SURE-Ansatz
Zur Bewertung synthetischer Daten hat Ipsos das SURE-Framework entwickelt. Es beschreibt sehr treffend die grundlegenden Anforderungen an moderne Insight-Gewinnung. SURE betrachtet vier Dimensionen, die darüber entscheiden, ob synthetische Daten tatsächlich einen Mehrwert liefern. Dabei kommt ein sogenanntes Holdout-Sample der erhobenen Daten zum Einsatz, das heißt ein Teil der menschlichen Daten wird nicht zum Training des Modells verwendet, sondern zur Validierung der synthetischen Daten zurückgehalten:
S wie Statistical Similarity (Statistische Ähnlichkeit)
Spiegelt die erzeugte Datenbasis die erhobenen Daten ausreichend gut wider? Diese Dimension bewertet, wie präzise die synthetischen Daten die statistischen Eigenschaften des ursprünglichen Datensatzes reproduzieren. Dabei wird untersucht, ob Verteilungen, Korrelationen, Kreuztabellen und logische Zusammenhänge sowohl insgesamt als auch innerhalb wichtiger Subgruppen erhalten bleiben.
U wie Utility (Analytischer Nutzen)
Liefert die Datenerweiterung zusätzliche Informationen oder lediglich zusätzliche Fälle? Um auf unsere Metapher zurückzukommen: Ist die Perle wertvoll? Ein größerer Datensatz ist nicht automatisch wertvoller. Entscheidend ist, ob er zusätzliche analytische Informationen liefert und somit die Analysekraft erhöhen kann, ohne bestehende Verzerrungen zu verstärken oder künstliche Signifikanzen zu erzeugen. Andernfalls kann eine größere Stichprobe zwar den Eindruck höherer Sicherheit vermitteln, tatsächlich aber zu falschen Entscheidungen führen.
R wie Rarity & Novelty (Seltenheit & Neuartigkeit)
Bringt der synthetische Datensatz tatsächlich neue Erkenntnisse? Entdecken wir neue Perlen? Synthetische Daten sollen zusätzliche Perspektiven ermöglichen und bisher schwach besetzte Bereiche besser repräsentieren. Die Neuartigkeit synthetischer Daten liegt darin, realistische neue Merkmalskombinationen zu erzeugen, die den Informationsraum erweitern, anstatt lediglich bestehende Fälle zu reproduzieren. Die zentrale Frage dieser Dimension lautet: Erweitern die synthetischen Daten die realen Daten, indem sie Lücken schließen, seltene Muster sichtbar machen oder den „Long Tail“ realen Verhaltens besser abbilden, ohne bestehende Beobachtungen zu duplizieren oder unrealistische Kombinationen zu erzeugen?
E wie Expert Validation (Expertenvalidierung)
Ergibt das Ergebnis aus Sicht von Fachleuten Sinn? Die vierte Dimension des SURE-Frameworks stellt sicher, dass synthetische Daten nicht nur mathematischen und statistischen Anforderungen genügen, sondern auch einer Plausibilitätsprüfung durch Fachexpertinnen und -experten standhalten. Um dies sicherzustellen, sollte menschliche Fachexpertise bereits zu Beginn des Generierungsprozesses eingebunden werden.
Mit Fachverständnis werden logische und strukturelle Rahmenbedingungen definiert, fachliche Regeln in den Modellierungsprozess integriert, unrealistische Ergebnisräume ausgeschlossen und sichergestellt, dass die Modelle innerhalb plausibler Grenzen arbeiten. Anschließend erfolgt eine zweite Expertenprüfung nach der Datengenerierung. Dabei wird bewertet, ob die erzeugten Ergebnisse weiterhin realistisch und im jeweiligen Kontext glaubwürdig sind. Diese doppelte Qualitätssicherung kombiniert präventive Kontrolle während der Modellierung mit einer abschließenden inhaltlichen Validierung. Natürlich kommt auch im Prozess selbst KI zum Einsatz, um das Vorgehen schnell und effizient zu machen – jedoch bleibt der Mensch nicht nur „in the loop”, sondern im Endergebnis immer „in the lead”.
Die Rolle von Human Intelligence und Artificial Intelligence
Innovation entsteht, wenn technologische Leistungsfähigkeit und menschliche Expertise zusammenwirken. Dieser Grundsatz sollte für alle KI-Lösungen gelten, einschließlich des Synthetic Data Boosting. Durch die Kombination von menschlicher und künstlicher Intelligenz sollen Erkenntnisse entstehen, die belastbarer und schneller verfügbar sind, den menschlichen Kontext berücksichtigen sowie dadurch für Kunden einen höheren praktischen Nutzen liefern.
Fazit: Größere Datenmengen führen nicht zwangsläufig zu besseren Entscheidungen
Das Datenmeer wird auch in Zukunft weiter wachsen. Gleichzeitig wird die Versuchung zunehmen, jede neue Datenquelle und jede neue KI-Technologie als Lösungsweg zu betrachten.
Doch mehr Daten bedeuten nicht automatisch mehr Wissen. Synthetische Daten können – richtig angewendet – einen wichtigen Beitrag leisten, um Informationslücken zu schließen, kleine Zielgruppen besser zu verstehen und zusätzliche Analysepotenziale zu erschließen. Ihr Mehrwert entsteht jedoch nicht durch die bloße Vergrößerung einer Stichprobe, sondern durch ihren tatsächlichen Beitrag zum Erkenntnisgewinn. Der Schlüssel liegt nicht in der Technologie allein, sondern in einer konsequenten Validierung der Ergebnisse und einer hochqualitativen Trainingsdatenmenge, die auf echten menschlichen Einstellungen und Meinungen basiert. Das SURE-Framework liefert dafür einen hilfreichen Kompass. Es erinnert uns daran, dass echte Insights vier Voraussetzungen erfüllen müssen: Sie müssen die Realität abbilden, einen nachvollziehbaren Nutzen stiften, neue Perspektiven eröffnen und fachlich plausibel sein. Synthetische Daten können dabei helfen, tiefer zu tauchen, bislang verborgene Bereiche sichtbar zu machen und seltene Fundstücke aufzuspüren. Der Wert entsteht jedoch erst dann, wenn wir sicher sein können, dass die gefundenen Perlen echt sind. Genau dabei hilft SURE.
Dieser Beitrag erschien unter gleichnamigem Titel am 05.10.2026 auf marktforschung.de im Dossier "Im Datenmeer nach Perlen tauch: Wie aus Daten Insights werden".