Beyond Demographics: Enhancing Cultural Value Survey Simulation with Multi-Stage Personality-Driven Cognitive Reasoning

Sociedad, cultura y comportamiento colectivo2025ACL AnthologyRevisión editorial aprobada

Autores: Haijiang Liu, Qiyuan Li, Chao Gao, Yong Cao, Xiangyu Xu, Xun Wu, Daniel Hershcovich, Jinguang Gu

Palabras clave: Large Language Models, Survey Simulation, Cultural Values, World Values Survey, MBTI Type Dynamics, Synthetic Respondents, Demographic Stereotyping, Reproducibility

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

8
Autores
13
Hallazgos
24
Limitaciones
12
Evidencias

Resumen editorial

Español

Este artículo de EMNLP 2025 propone MARK, un pipeline de prompting de varias llamadas para predecir respuestas individuales y distribuciones agregadas del World Values Survey. No mide personalidad ni estrés en los participantes. Primero, un LLM asigna a cada atributo demográfico un nivel de estrés de 0 a 100 y resume el perfil; después infiere funciones cognitivas MBTI dominante y auxiliar, completa las funciones terciaria e inferior mediante reglas; genera una respuesta y un peso bajo cada función; y otro paso revisa, repondera y sintetiza la opción final. Por tanto, estrés, personalidad, trayectoria cognitiva y explicación son texto generado por el modelo, no observaciones psicológicas. El paper usa WVS Wave 7 de Estados Unidos y China, declara 30 rasgos demográficos, 20 clusters, 400 sujetos y 102.800 pares pregunta-respuesta en EE. UU., y 20 sujetos/4.340 pares en China. Compara GLM-4-air, GPT-4o-2024-08-06 y Doubao-1.5-pro a temperatura 0,9, sin repeticiones ni incertidumbre publicada. En la distribución muestreada de EE. UU., MARK obtiene 33,69 %, 38,11 % y 46,98 % de accuracy. Frente al baseline de mayor accuracy de cada modelo, las ganancias reales son 6,71, 1,15 y 15,53 puntos, no un 10 % uniforme. La prosa de Section 5.2 tampoco coincide con Table 2: contra Demo.+Ideo.+Opiniontop3, la tabla da +8,63, +5,04 y +15,53 puntos, no +4,3, +8,9 y +15,5. En China, MARK no es el método más preciso con GLM: 31,58 % frente a 35,21 % con prompts chinos y 31,37 % frente a 35,60 % con prompts ingleses, aunque el caption afirma superioridad general. La auditoría del artefacto cambia además la interpretación metodológica. El notebook de extracción no agrupa por los 30 datos demográficos descritos: usa únicamente SACSECVAL y RESEMAVAL, índices WVS de valores seculares y emancipativos derivados de las respuestas. La selección de grupos y representantes está así informada por el dominio objetivo. El mismo notebook fija 5 clusters, no 20, selecciona como máximo 20 personas en cada uno, no define seed, llama a drop_duplicates sin conservar el resultado y etiqueta una curva SSE como silhouette analysis. La llamada personalidad oracle tampoco es personalidad medida: personal_assign.py recorre Q1-Q258, usa las respuestas reales del sujeto, incluida cada pregunta objetivo, y acumula probabilidades de personalidad generadas por otro LLM. Table 17 compara el predictor con esa etiqueta sintética filtrada por respuestas; 70 % de acierto a nivel de role y 15/31 % a nivel de type no valida MBTI. De hecho, el análisis de robustez muestra que asignaciones random, predicted y oracle producen curvas casi solapadas, y el propio texto dice que la similitud de personalidad tiene influencia mínima. Esto debilita la atribución causal a la personalidad. Las métricas publicadas tampoco cuentan con una implementación válida. El notebook calcula 1 menos la distancia Jensen-Shannon de SciPy, no 1 menos la divergencia que nombra. Para EMD pasa los vectores de masas como posiciones muestrales a wasserstein_distance; dos distribuciones binarias invertidas [0,7, 0,3] y [0,3, 0,7] reciben así distancia cero en vez de 0,4 sobre soportes ordenados. El script de kappa entrega recuentos por opción a cohen_kappa_score como si fueran etiquetas de dos jueces, y el paper alterna Cohen y Fleiss. Se muestran p-values aislados, incluido 0,6, pero no se publica test, unidad muestral, código, predicciones, repeticiones, intervalos, bootstrap ni corrección múltiple. El repositorio omite WVS, muestras, outputs, resultados y requirements.txt; los tres notebooks tienen cero celdas ejecutadas y cero outputs. Paper, README y código nombran respectivamente Gemini-2-pro, Gemini-2.5 y gemini-1.5-flash-exp-0827; el script de augmentación falla en print(a), duplica append en memoria y los 21 JSON publicados contienen 1.254 objetos de probabilidad vacíos. El runner central expone además una credencial API no placeholder, que debe considerarse comprometida. La conclusión defendible es limitada: una estructura de deliberación con más llamadas y contexto puede cambiar y a veces mejorar predicciones sintéticas de encuestas, especialmente con Doubao. No se demuestra personalidad, estrés, cognición, interpretabilidad fiel, significación, generalización a demografías nuevas ni sustitución de encuestas humanas. Antes de usar MARK como evidencia psicológica o social se necesitan muestreo independiente de respuestas, métricas recalculadas a nivel de participante, constructos medidos o labels neutrales, tests held-out de personas/preguntas/grupos, ablations igualadas en cómputo, repeticiones, auditoría de estereotipos y artefactos completos.

English

This EMNLP 2025 paper proposes MARK, a multi-call prompting pipeline for predicting individual World Values Survey answers and aggregate response distributions. It does not measure participant personality or stress. An LLM first assigns each demographic attribute a 0-100 stress score and summarizes the profile; it then infers dominant and auxiliary MBTI cognitive functions, completes tertiary and inferior functions by rule, generates one answer and weight under each function, and uses another call to review, reweight, and synthesize the final option. Stress, personality, cognitive trajectory, and explanation are therefore model-generated text rather than psychological observations. The paper uses WVS Wave 7 U.S. and China case studies, claims thirty demographic features, twenty clusters, 400 subjects and 102,800 question-answer pairs in the U.S., and twenty subjects/4,340 pairs in China. It compares GLM-4-air, GPT-4o-2024-08-06, and Doubao-1.5-pro at temperature .9 without published repetitions or uncertainty. On the U.S. sampled distribution, MARK reports 33.69%, 38.11%, and 46.98% accuracy. Against each model's strongest accuracy baseline, the actual gains are 6.71, 1.15, and 15.53 points, not a uniform 10%. Section 5.2 also conflicts with Table 2: against Demo.+Ideo.+Opiniontop3 the table yields +8.63, +5.04, and +15.53 points, not +4.3, +8.9, and +15.5. In China, MARK is not the most accurate GLM method: 31.58% versus 35.21% with Chinese prompts and 31.37% versus 35.60% with English prompts, despite the table caption's broad superiority claim. Artifact audit further changes the methodological interpretation. The extraction notebook does not cluster the thirty described demographics; it uses only SACSECVAL and RESEMAVAL, WVS secular-value and emancipative-value indices derived from survey responses. Group and representative selection are thus informed by the target domain. The same notebook hard-codes five clusters rather than twenty, selects at most twenty people within each, has no seed, calls drop_duplicates without keeping the result, and labels an SSE curve as silhouette analysis. Oracle personality is also not measured personality: personal_assign.py iterates Q1-Q258, uses each subject's actual answers, including target items, and accumulates LLM-generated personality scores. Table 17 compares a demographic predictor against this response-derived synthetic label; 70% role accuracy and 15/31% type accuracy do not validate MBTI. The robustness analysis in fact shows nearly overlapping curves for random, predicted, and oracle assignments, and the paper says personality similarity has minimal influence. This weakens causal attribution to personality. The released metrics also lack valid implementations. The notebook computes one minus SciPy Jensen-Shannon distance, not one minus the divergence it names. For EMD it passes probability-mass vectors as sample locations to wasserstein_distance; reversed binary distributions [.7,.3] and [.3,.7] therefore receive zero instead of .4 on ordered supports. The kappa script passes per-option count vectors to cohen_kappa_score as if they were two raters' labels, while the paper alternates Cohen and Fleiss. Isolated p-values are printed, including .6, but no test, sampling unit, code, predictions, repetitions, intervals, bootstrap, or multiplicity correction is released. The repository omits WVS data, samples, outputs, results, and requirements.txt; all three notebooks have zero executed cells and zero outputs. Paper, README, and code respectively name Gemini-2-pro, Gemini-2.5, and gemini-1.5-flash-exp-0827; augmentation code fails at print(a), appends each result twice in memory, and the 21 released JSON files contain 1,254 empty probability objects. The main runner also exposes a non-placeholder API credential that must be treated as compromised. The defensible conclusion is narrow: more structured calls and context can change and sometimes improve synthetic-survey predictions, especially with Doubao. The study does not establish personality, stress, cognition, faithful interpretability, significance, unseen-demographic generalization, or replacement of human surveys. A credible reference requires response-independent sampling, respondent-level metric recalculation, measured constructs or construct-neutral labels, held-out people/questions/groups, compute-matched ablations, repeated runs, stereotype auditing, and complete immutable artifacts.

Pregunta de investigación

¿Puede un pipeline multietapa inspirado en dinámica de tipos MBTI, que infiere estrés y funciones cognitivas desde demografía, mejorar la predicción zero-shot de respuestas y distribuciones del World Values Survey frente a prompts demográficos y de opiniones?

Método

MARK transforma atributos WVS en scores de estrés y un perfil sociodemográfico generados por LLM, infiere las funciones MBTI dominante/auxiliar y completa las otras dos, decide para cada pregunta si el estrés activa su versión positiva o negativa, genera cuatro respuestas con pesos y sintetiza una opción final. El paper declara K-means sobre demografía y evalúa exact match, 1-JSD, EMD y kappa en distribuciones sampled/global de EE. UU. y sampled de China. La auditoría contrasta las 23 páginas publicadas con el commit oficial, reconstruye el muestreo real, perfila 25.473 filas de augmentación y revisa fórmulas y código de métricas.

Muestra: El paper declara 400 representantes estadounidenses, 20 por cada uno de 20 clusters, y 102.800 respuestas, más 20 centroides chinos y 4.340 respuestas. No publica los workbooks usados, IDs, composición por cluster ni outputs. El notebook liberado contradice ese diseño: clusteriza con dos índices de valores derivados de respuestas, fija 5 clusters y selecciona hasta 20 representantes por cluster, por lo que no reconstruye los 400 casos.

Hallazgos

  • La fuente autoritativa es EMNLP 2025, DOI 10.18653/v1/2025.emnlp-main.928, páginas 18406-18428; se inspeccionaron visualmente las 23 páginas publicadas y las 23 de arXiv v1.
  • En sampled U.S., MARK obtiene ACC 33,69/38,11/46,98 % para GLM/GPT-4o/Doubao; las ganancias frente al mejor baseline de cada modelo son 6,71/1,15/15,53 puntos.
  • Los números 4,3/8,9/15,5 de Section 5.2 no se derivan de Table 2; contra el baseline que nombra la diferencia es 8,63/5,04/15,53 puntos.
  • Con GLM en China, MARK queda por debajo de Demo.+Ideo.+Opiniontop3 tanto con prompts chinos, 31,58 frente a 35,21, como ingleses, 31,37 frente a 35,60.
  • Random, predicted y oracle personality muestran performance muy similar; la precisión de personalidad declarada es 70 % role pero solo 15 %/31 % type.
  • La personalidad oracle se deriva de Q1-Q258 reales del mismo participante y no es una medición MBTI independiente.
  • El notebook de sampling usa SACSECVAL/RESEMAVAL, dos índices de valores derivados de respuestas, no los 30 demográficos descritos.
  • El notebook fija n_clusters=5 aunque paper/Figure 6 declaran 20 y no implementa silhouette_score.
  • La implementación 1-JSD usa 1 menos distancia JS; EMD usa masas como posiciones; kappa usa vectores de recuentos como labels.
  • No hay código de significación ni predicciones; se muestra al menos un p-value 0,6.
  • Los 21 JSON de augmentación suman 25.473 filas y 1.254 probability objects vacíos; role tiene 33,39 % vacíos.
  • Los tres notebooks tienen cero celdas ejecutadas y cero outputs; faltan datos WVS, samples, resultados, requirements y licencia.
  • El repositorio expone una credencial API no placeholder y debe revocarse.

Limitaciones

  • No existen ground truth independientes de estrés, MBTI, funciones cognitivas o explicaciones.
  • Los perfiles psicológicos se fabrican desde demografía y pueden convertir estereotipos en razonamientos plausibles.
  • La selección de muestra usa índices de valores derivados de las respuestas objetivo.
  • Oracle personality usa todas las respuestas reales, incluida la pregunta evaluada.
  • Table 17 valida contra labels sintéticos response-derived, no contra un instrumento MBTI.
  • El muestreo liberado no reproduce 20 clusters x 20 personas y carece de seeds o estabilidad.
  • No hay splits held-out de participantes, preguntas, culturas o grupos demográficos.
  • La evaluación global compara con el histograma de la misma población y no demuestra unseen demographics.
  • JSD está mal nombrada y las implementaciones EMD/kappa son conceptualmente inválidas.
  • Cohen y Fleiss kappa se usan de forma inconsistente.
  • No se publican tests, unidad de análisis, múltiples runs, CI, bootstrap o corrección múltiple.
  • Temperatura 0,9 sin repeticiones impide estimar varianza de generación.
  • El ablation de una función frente a cuatro confunde mecanismo con llamadas, tokens y contexto adicionales.
  • El ejemplo de síntesis usa pesos que suman 1,6 y ni prompts ni código exigen normalización.
  • Las mejoras no son consistentes entre modelos, métricas, idiomas y baselines.
  • GPT-4o solo se ejecuta en centroides por presupuesto, reduciendo comparabilidad.
  • Los 21 archivos de augmentación solo contienen 242 preguntas únicas mientras el asignador recorre 258.
  • Paper, README y código discrepan sobre el modelo Gemini utilizado.
  • El código de augmentación contiene un NameError y doble append; faltan dependencias y outputs.
  • No hay licencia, model/data cards, trazas API, configuración completa ni privacy statement para derivados.
  • Solo se estudian EE. UU. y China; no hay invariancia cultural o equivalencia de traducción.
  • La analogía con PTSD se aplica sin datos de trauma o salud mental.
  • No se auditan errores o estereotipos por sexo, edad, etnia, ciudadanía, religión, migración, ocupación, ingresos o estado civil.
  • No existe validación prospectiva que permita sustituir encuestas humanas representativas.

Qué no demuestra

  • No demuestra que los participantes tengan el estrés, MBTI o funciones cognitivas inferidos.
  • No demuestra que los LLM simulen procesos mentales humanos o que sus explicaciones sean fieles.
  • No demuestra que asignar correctamente personalidad sea la causa de las mejoras.
  • No establece una mejora uniforme del 10 % frente al mejor baseline.
  • No establece EMD o kappa válidos con el código liberado.
  • No prueba significación estadística de los resultados.
  • No demuestra generalización a demografías nuevas, participantes nuevos, preguntas nuevas o países nuevos.
  • No demuestra seguridad o ausencia de estereotipos en profiling demográfico.
  • No justifica usar personas sintéticas como sustitutas de población humana o encuestas sociales.

Trazabilidad

Alcance: Texto completo

Versión: Proceedings of EMNLP 2025, Anthology ID 2025.emnlp-main.928, DOI 10.18653/v1/2025.emnlp-main.928, pages 18406-18428, 23 pages

Fuente consultada: https://aclanthology.org/2025.emnlp-main.928/

Revisión: Codex complete bilingual full-text fidelity pass using the published EMNLP version and arXiv v1, all-page visual inspection of both PDFs, official repository commit audit, response-derived sampling analysis, oracle target-leakage tracing, exact Table 2 and Table 3 arithmetic reconciliation, metric-implementation review, personality augmentation profiling, construct-validity assessment, demographic-stereotyping review, credential exposure check, and end-to-end reproducibility inventory; summaries written from paper and artifact evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GLM-4-air
  • openai/gpt-4o-2024-08-06
  • Doubao-1.5-pro
  • Llama-3.1-7B and Llama-3.1-13B exploratory runs
  • Personality augmentation described inconsistently as Gemini-2-pro in paper, Gemini-2.5 in README, and gemini-1.5-flash-exp-0827 in code
  • bge-m3-v3 embedding model for the opinion baseline

Instrumentos y métricas

  • World Values Survey Wave 7 multiple-choice responses
  • LLM-generated 0-100 demographic stress scores
  • MBTI Type Dynamics cognitive-function prompts
  • Response-derived synthetic oracle personality assignment
  • Exact-match accuracy
  • Released 1 minus Jensen-Shannon distance implementation, mislabeled as 1-JSD
  • Released invalid Wasserstein/EMD implementation
  • Released invalid count-vector Cohen kappa implementation; paper also calls it Fleiss kappa
  • Independent construct, leakage, arithmetic, metric, stereotyping, and reproducibility audit

Datos utilizados

  • World Values Survey Wave 7, United States case study
  • World Values Survey Wave 7, China case study
  • Reported U.S. sample: 20 clusters x 20 subjects, 400 subjects and 102,800 QA pairs
  • Reported China sample: 20 cluster-centroid subjects and 4,340 QA pairs
  • Official artifact: 21 augmented personality JSON files, 25,473 rows, 242 unique question texts, 1,254 empty probability objects
  • Raw WVS, sampled workbooks, predictions, results, and execution outputs are not released

Evidencia y localización

  • Abstract, alcance y pipeline MARK: Published pages 18406-18409, Abstract and Sections 1-3
  • Datos, settings, modelos y métricas declaradas: Published pages 18409-18411, Sections 4.1-4.4 and Table 2
  • Resultados, arithmetic mismatch, robustez y China: Published pages 18412-18414, Sections 5.1-5.5 and Tables 2-4
  • Limitaciones MBTI, ética y estereotipos reconocidos: Published pages 18414-18415, Limitations and Ethics Statement
  • Prompts, clustering declarado, oracle y tablas completas: Published pages 18418-18428, Appendices B-E and Tables 5-17
  • Sampling real con índices de valores, n_clusters=5 y ausencia de seed/silhouette: Official repository commit 394e92b, Data Extract.ipynb audited 15 July 2026
  • Target leakage de oracle personality: Official repository commit 394e92b, utils/personal_assign.py audited 15 July 2026
  • Errores 1-JSD, EMD y kappa: Official repository commit 394e92b, Result Evaluation.ipynb and utils/cohen_kappa.py audited 15 July 2026
  • Augmentación incompleta, identidad de Gemini y fallos de código: Official repository commit 394e92b, 21 data/augmented JSON files, README and utils/personality_augmentation.py audited 15 July 2026
  • Reproducibilidad, archivos ausentes y credencial expuesta: Official repository tree at commit 394e92b audited 15 July 2026; credential value omitted
  • Auditoría integral de constructo, métricas y artefacto: reports/verification/article-193-mark-construct-and-artifact-audit.json
  • Inspección visual completa: All 23 published EMNLP pages and all 23 arXiv v1 pages rendered and visually inspected on 15 July 2026