German General Social Survey Personas: A Survey-Derived Persona Prompt Collection for Population-Aligned LLM Studies

Sociedad, cultura y comportamiento colectivo2025arXivRevisión editorial aprobada

Autores: Jens Rupprecht, Leon Fröhling, Claudia Wagner, Markus Strohmaier

Palabras clave: Survey-grounded personas, ALLBUScompact 2023, Population response simulation, Jensen-Shannon distance, Representativeness and data quality

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
9
Hallazgos
19
Limitaciones
4
Evidencias

Resumen editorial

Español

El artículo presenta German General Social Survey Personas (GGSS Personas), nombre adoptado en la versión 2 para la colección antes llamada German General Personas. Convierte en prompts los registros de 5.246 participantes de ALLBUScompact 2023. Cada persona contiene un bloque sociodemográfico fijo y un bloque TOP-k. Para construir este último, los autores eliminan paradata, campos sociodemográficos y 27 variables elegidas como resultados; después entrenan 406 random forests, cada uno con las otras 405 variables, y agregan las diez importancias principales de cada modelo. De ahí sale un ranking global de 380 atributos y versiones con k entre 2 y 380. Como el cuestionario se reparte en módulos, las personas están incompletas: TOP-2 contiene de media 1,34 atributos y TOP-380, 242,27; a partir de TOP-16 ninguna persona tiene todos los atributos posibles.

La evaluación pide a cinco modelos abiertos, Mistral-7B-Instruct-v0.3, Llama-3.1-8B-Instruct, Qwen3-8B, Gemma-3-12B-it y Llama-3.3-70B-Instruct, que respondan 27 preguntas, tres en cada uno de nueve temas. La variable objetivo no aparece literalmente en el prompt. Las respuestas individuales se agregan y se comparan con la distribución observada mediante distancia de Jensen-Shannon (JSD). Los baselines son random forests con los mismos conjuntos TOP-k y entre 2 y 2.048 ejemplos de entrenamiento; el 20% de los participantes se reserva como test. No se publican semillas, repeticiones, intervalos ni pruebas de significación. Llama-3.3-70B con TOP-2 es la mejor configuración observada. Supera al mejor random forest probado en 13 de 27 preguntas y en la media de cinco de nueve temas cuando el baseline usa hasta 512 casos. Añadir atributos no mejora de forma monótona y a menudo empeora la JSD.

El resultado sobre representatividad es más débil que la narrativa del recurso: al comparar una submuestra ALLBUS de 500 personas con submuestras sobrerrepresentadas por ingresos, conservadurismo o estudiantes, PersonaHub y ausencia de persona, las distribuciones quedan próximas y el propio artículo concluye que la representatividad tiene poca influencia en esa prueba. Además, se agregan respuestas sin informar uso de pesos, aunque el archivo oficial describe un muestreo probabilístico multietápico, estratificado y desproporcional. Por tanto, el objetivo empírico es la distribución bruta de participantes ALLBUS 2023, no una estimación demostrada de toda la población alemana. La JSD marginal tampoco mide acierto individual, fidelidad por subgrupos, dependencias multivariantes ni comportamiento real. El texto es ambiguo sobre si el LLM se compara sobre las 5.246 personas mientras el random forest se evalúa solo en el 20% de test, y no explica cómo trata el 1,44-9,91% de respuestas inválidas.

La colección ofrece formato clave-valor y prosa generada por Gemini. Dos coautores revisan 80 personas de TOP-2 a TOP-16 y consideran fieles 69: 11, o 13,75%, contienen omisiones o representaciones erróneas. No se informa acuerdo entre anotadores y no se valida sistemáticamente TOP-32 o superiores. El apéndice reconoce bucles graves en TOP-380. La auditoría del ZIP público de GitHub, commit de 22 de enero de 2026 y por tanto no necesariamente idéntico al archivo GESIS posterior, cuantifica el problema: hay filas de más de 100.000 caracteres en 5 personas TOP-64, 11 TOP-128, 79 TOP-256 y 556 TOP-380; esta última versión tiene 690 filas por encima de 10.000 caracteres y alcanza 446.981. También existe una fila TOP-16 de 66.349 caracteres dominada por un símbolo repetido. Los JSONL parsean y tienen el número esperado de filas, pero eso no garantiza fidelidad semántica.

GESIS preserva el dataset como ZA9089 v1.0.0 con DOI y codebook. Sin embargo, el repositorio público no incluye el código de construcción o evaluación, revisiones de modelos, semillas, generaciones, decisiones sobre inválidos ni datos de figuras. Su README aún usa el nombre antiguo, ofrece una URL de clonación de plantilla, deja cita y contacto como TBA y menciona un LICENSE inexistente. El paper dice Gemini-2.5-flash y la ficha GESIS, Gemini-2.5-flash-lite. ALLBUScompact reduce detalle y elimina geografía fina, pero la edición oficial conserva un respid enlazable y combinaciones sensibles de hogar, ingresos, migración, religión y política; esto deja riesgo residual de enlace e inferencia, sin que esta auditoría afirme una reidentificación. La contribución sólida es un corpus versionado y un benchmark preliminar de alineamiento agregado. No demuestra gemelos digitales fieles, sustitución de encuestas, representatividad universal ni reproducibilidad completa.

English

The paper introduces German General Social Survey Personas (GGSS Personas), the version-2 name for the collection previously called German General Personas. It converts records from 5,246 ALLBUScompact 2023 participants into prompts. Each persona contains a fixed sociodemographic block and a TOP-k block. To construct the latter, the authors remove paradata, core sociodemographics, and 27 selected outcome variables; they then train 406 random forests, each using the other 405 variables, and aggregate each model's ten largest feature importances. This produces a global ranking of 380 attributes and variants with k from 2 to 380. Questionnaire splits make the personas incomplete: TOP-2 contains 1.34 attributes on average and TOP-380 contains 242.27; from TOP-16 onward, no persona contains every possible attribute.

The evaluation asks five open-weight models, Mistral-7B-Instruct-v0.3, Llama-3.1-8B-Instruct, Qwen3-8B, Gemma-3-12B-it, and Llama-3.3-70B-Instruct, to answer 27 questions, three from each of nine topics. The target variable is not included literally in the prompt. Individual answers are aggregated and compared with the observed distribution using Jensen-Shannon distance (JSD). Baselines are random forests using the same TOP-k feature sets and 2 to 2,048 training examples; 20% of participants are held out for testing. Seeds, repeated runs, intervals, and significance tests are not reported. Llama-3.3-70B with TOP-2 is the best observed configuration. It beats the best tested random forest on 13 of 27 questions and on the mean of five of nine topics when the baseline uses up to 512 cases. Adding attributes is not monotonically beneficial and often worsens JSD.

The representativeness result is weaker than the resource narrative. When a representative 500-person ALLBUS subset is compared with income-, conservative-, or student-oversampled subsets, PersonaHub, and no persona, distributions cluster closely; the paper itself concludes that representativeness has little influence in this test. Responses are also aggregated without reported survey weights even though the official archive describes a disproportional stratified multistage probability design. The empirical target is therefore the raw 2023 ALLBUS respondent distribution, not demonstrated fidelity to the entire German population. Marginal JSD does not measure individual correctness, subgroup fidelity, multivariate dependence, or real behavior. The manuscript is ambiguous about whether LLMs are compared on all 5,246 personas while random forests are evaluated only on the 20% test set, and it does not explain how the 1.44-9.91% invalid responses enter the metric.

The collection provides key-value and Gemini-generated prose formats. Two coauthors inspect 80 personas from TOP-2 through TOP-16 and judge 69 faithful: 11, or 13.75%, contain omissions or misrepresentations. No inter-rater agreement is reported, and TOP-32 and larger variants are not systematically validated. The appendix acknowledges severe TOP-380 loops. An audit of the public GitHub ZIP at the 22 January 2026 commit, which may differ from the later GESIS archive, quantifies the problem: rows above 100,000 characters occur in 5 TOP-64, 11 TOP-128, 79 TOP-256, and 556 TOP-380 personas. TOP-380 has 690 rows above 10,000 characters and reaches 446,981; TOP-16 already contains a 66,349-character row dominated by a repeated symbol. Every JSONL parses and has the advertised row count, but container integrity does not establish semantic fidelity.

GESIS preserves the dataset as ZA9089 v1.0.0 with a DOI and codebook. The public repository nevertheless lacks construction and evaluation code, model revisions, seeds, raw generations, invalid-output decisions, and figure data. Its README retains the old name, gives a placeholder clone URL, leaves citation and contact as TBA, and refers to a missing LICENSE file. The paper names Gemini-2.5-flash as the prose generator, while current GESIS metadata says Gemini-2.5-flash-lite. ALLBUScompact coarsens sensitive fields and removes fine geography, but the official edition retains a linkable respid alongside combinations of household, income, migration, religious, and political attributes; residual linkage and attribute-inference risk remains, although this audit does not claim a reidentification. The solid contribution is a versioned corpus and a preliminary aggregate-alignment benchmark. It does not establish faithful digital twins, survey replacement, universal representativeness, or complete reproducibility.

Pregunta de investigación

¿Puede una colección de prompts-persona derivada de ALLBUS aproximar distribuciones agregadas de respuestas con LLMs sin entrenamiento específico, y cómo cambian esa aproximación el número de atributos y la composición de la muestra?

Método

Se transforman 5.246 registros de ALLBUScompact 2023 en personas clave-valor y textuales. Un ranking global, obtenido agregando importancias de 406 random forests, define variantes TOP-k de 2 a 380 atributos. Cinco LLMs responden 27 variables excluidas del prompt; sus distribuciones marginales se comparan mediante JSD con ALLBUS y con random forests entrenados con n=2-2.048. Se ensayan además submuestras de 500 personas representativas, sobrerrepresentadas, PersonaHub y sin persona. Dos coautores revisan 80 personas textuales cortas.

Muestra: La colección contiene 5.246 personas por variante y 20 variantes archivadas en GESIS. Se evalúan 27 resultados, tres por cada uno de nueve temas. El baseline reserva un 20% fijo para test y usa de 2 a 2.048 participantes restantes para entrenamiento. Las comparaciones de composición usan 500 personas por subconjunto. La validación textual cubre 80 casos: 20 de TOP-2, TOP-4, TOP-8 y TOP-16. No se informan semillas, repeticiones ni N efectivo tras respuestas inválidas.

Hallazgos

  • Llama-3.3-70B con TOP-2 es la configuración de menor JSD observada en el conjunto evaluado.
  • Esa configuración supera al mejor random forest probado en 13 de 27 resultados y en cinco de nueve medias temáticas con hasta 512 casos de entrenamiento.
  • La ventaja del LLM es mayor frente a baselines con muy pocos datos y disminuye al crecer la muestra de entrenamiento.
  • Añadir atributos no mejora de forma monótona; TOP-2 supera a variantes más extensas en las configuraciones probadas.
  • La manipulación de representatividad produce diferencias pequeñas y muy dependientes del tema.
  • Las tasas de respuesta inválida van de 1,44% a 9,91% y aumentan en algunas poblaciones alternativas.
  • La validación manual considera fieles 69 de 80 personas textuales cortas; 13,75% presenta algún error.
  • El artefacto GitHub auditado contiene cientos de generaciones textuales desbocadas en TOP-256 y TOP-380 y fallos aislados desde TOP-16.
  • El corpus está archivado con DOI, pero no hay código público suficiente para reproducir su construcción o sus experimentos.

Limitaciones

  • La muestra se agrega sin pesos publicados pese a un diseño estratificado multietápico desproporcional.
  • Representar a participantes ALLBUS 2023 no equivale automáticamente a representar toda la población alemana.
  • Solo se evalúan distribuciones marginales; faltan acierto individual, subgrupos, dependencias conjuntas y conducta externa.
  • No queda claro que LLM y random forest se evalúen contra exactamente los mismos participantes objetivo.
  • Se elige la mejor configuración y se informa el resultado principal sobre las mismas 27 tareas, sin holdout de tareas.
  • Solo se toma un conjunto aleatorio de 27 variables y no se publica su semilla ni repetición.
  • No hay intervalos, contrastes, corrección por multiplicidad, repeticiones de decodificación o splits repetidos.
  • El tratamiento de respuestas inválidas en la JSD no está especificado.
  • El ranking por importancia de impureza no controla cardinalidad, correlación, multicolinealidad o missingness.
  • La selección de atributos usa todo el dataset, incluidos participantes luego reservados para test.
  • Los cortes de conocimiento no descartan contaminación, sobre todo por preguntas repetidas de olas previas.
  • La validación humana es interna, pequeña y excluye todas las variantes textuales de TOP-32 a TOP-380.
  • No se informa fiabilidad entre anotadores ni se liberan etiquetas por fila.
  • El artefacto textual público tiene bucles y corrupciones masivas que el paper no cuantifica.
  • Faltan código, entornos, revisiones de modelo, seeds, outputs, decisiones sobre inválidos y datos de figuras.
  • Paper y GESIS discrepan entre Gemini-2.5-flash y Gemini-2.5-flash-lite.
  • La ficha y el README conservan nomenclatura antigua y el repositorio carece del LICENSE que anuncia.
  • La riqueza de atributos y el respid enlazable dejan riesgo residual de privacidad no analizado en el paper.
  • El trabajo sigue siendo un preprint arXiv v2 sin venue revisado por pares establecido.

Qué no demuestra

  • Que las personas sean gemelos digitales fieles de individuos reales.
  • Que el LLM prediga correctamente la respuesta de cada participante.
  • Que una JSD marginal baja implique fidelidad por subgrupos, conjunta, causal o conductual.
  • Que el corpus sin ponderar reproduzca la población alemana para cualquier tarea.
  • Que la representatividad de la colección mejore generalmente las respuestas del LLM.
  • Que TOP-2 sea óptimo fuera de las tareas, modelos y prompts usados para seleccionarlo.
  • Que los LLMs sustituyan encuestas, participantes o ground truth humano.
  • Que la comparación con random forest esté libre de ventajas por selección o población objetivo.
  • Que la colección textual completa sea semánticamente fiel o utilizable sin filtrado.
  • Que los cortes declarados eliminen toda posibilidad de contaminación por ALLBUS.
  • Que el dataset carezca de riesgo de enlace o inferencia de atributos sensibles.
  • Que el pipeline y las figuras puedan reproducirse con los artefactos publicados.
  • Que el DOI del dataset o arXiv v2 impliquen revisión por pares.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2511.21722v2, 20 pages; GESIS ZA9089 v1.0.0 and public GitHub data snapshot also audited

Fuente consultada: https://arxiv.org/abs/2511.21722

Revisión: Codex 20-page arXiv-v2 visual, GESIS dataset/codebook, survey-design/metric, full-text artifact, privacy, reproducibility and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Mistral-7B-Instruct-v0.3
  • Llama-3.1-8B-Instruct
  • Qwen3-8B
  • Gemma-3-12B-it
  • Llama-3.3-70B-Instruct (8-bit)
  • Gemini-2.5-flash or Gemini-2.5-flash-lite prose generator
  • scikit-learn RandomForestClassifier baselines

Instrumentos y métricas

  • ALLBUScompact 2023 question and response labels
  • Core sociodemographic plus TOP-k persona construction
  • Global random-forest feature-importance ranking
  • JSON-like key-value persona format
  • LLM-generated full-text persona format
  • Twenty-seven held-out survey outcome variables across nine topics
  • Normalized Jensen-Shannon distance
  • Representative and oversampled 500-person population comparison
  • Manual full-text fidelity annotation on 80 personas
  • Invalid-response rate

Datos utilizados

  • German General Social Survey ALLBUScompact 2023 (ZA8831)
  • German General Social Survey Personas, GESIS ZA9089 v1.0.0
  • Public German-General-Personas GitHub artifact snapshot
  • PersonaHub comparison personas
  • Income-, ideology- and student-oversampled ALLBUS subsets

Evidencia y localización

  • Diseño, construcción, modelos, resultados, anexos, limitaciones y ética: arXiv:2511.21722v2, 20 PDF pages; all pages rendered and visually inspected
  • Versión archivada, muestra, muestreo, formatos y enlace mediante respid: GESIS ZA9089 v1.0.0 landing page and 10-page codebook, DOI 10.4232/1.14707
  • Integridad de JSONL, calidad textual, archivos y reproducibilidad pública: germanpersonas/German-General-Personas commit ed0e1a08e6bf19f5b27b181e7d53655170c3ac04
  • Representatividad, métrica, privacidad, calidad del artefacto y límites de afirmación: reports/verification/article-269-ggss-personas-representativeness-metric-fulltext-artifact-and-reproducibility-audit.json