Population-Aligned Persona Generation for LLM-based Social Simulation

Sociedad, cultura y comportamiento colectivo2025arXivRevisión editorial aprobada

Autores: Zhengyu Hu, Zheyuan Xiao, Max Xiong, Yuxuan Lei, Tianfu Wang, Jianxun Lian, Kaize Ding, Ziang Xiao, Nicholas Jing Yuan, Xing Xie

Palabras clave: population alignment, persona generation, social simulation, Big Five traits, computational social science, importance sampling, bias reduction

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

10
Autores
50
Hallazgos
153
Limitaciones
26
Evidencias

Resumen editorial

Español

Este preprint propone una cadena de tres etapas para construir personas destinadas a simulaciones sociales con LLM. Primero transforma publicaciones del Blog Authorship Corpus en perfiles narrativos y los filtra con dos LLM; después hace que un LLM responda cuestionarios psicométricos como cada persona y selecciona 5.000 perfiles mediante muestreo por importancia y transporte óptimo para aproximar una distribución humana de referencia; por último recupera y reescribe perfiles para grupos concretos de YRBSS y WVS. En las tablas publicadas, la variante Resample obtiene el menor error medio en IPIP Big Five (0,1715), en tres cuestionarios no usados para el ajuste (0,2085) y en el error entre matrices de correlaciones (0,3560); el recuperador entrenado obtiene 4,5329 en los cuatro escenarios de grupo. Estos resultados muestran que optimizar perfiles contra las mismas familias de respuestas reduce las distancias elegidas frente a los baselines evaluados. No prueban que las personas representen a la población mundial ni que una simulación prediga conducta social o decisiones de política pública. La auditoría integral detecta contradicciones materiales entre texto y tablas, incluidos el tamaño final del corpus, los promedios de Tables 2 y 3 y varios porcentajes, instrucciones regionales estereotipadas que anticipan las respuestas objetivo, ausencia de incertidumbre y artefactos reproducibles, cobertura de privacidad demasiado estrecha y fallos en las dos demostraciones teóricas. Por ello, el trabajo es una propuesta técnica prometedora de ajuste distribucional, pero su afirmación de representación poblacional y sus garantías formales no quedan establecidas por esta versión.

English

This preprint proposes a three-stage pipeline for constructing personas for LLM-based social simulation. It first turns Blog Authorship Corpus posts into narrative profiles and filters them with two LLMs; it then has an LLM answer psychometric questionnaires as each persona and selects 5,000 profiles through importance sampling and optimal transport to approximate a human reference distribution; finally, it retrieves and rewrites profiles for specific YRBSS and WVS groups. In the published tables, Resample has the lowest mean error on IPIP Big Five (0.1715), on three questionnaires not used for alignment (0.2085), and on error between correlation matrices (0.3560); the trained retriever scores 4.5329 across the four group settings. These results show that optimizing profiles against the same families of response distributions reduces the selected distances relative to the evaluated baselines. They do not show that the personas represent the world population or that a simulation predicts social behavior or policy outcomes. The full audit finds material contradictions between prose and tables, including the final corpus size, Table 2 and Table 3 averages, and several percentages, regional prompts that prescribe stereotyped target views, no uncertainty estimates or reproducible artifacts, overly narrow privacy coverage, and invalid steps in both theoretical proofs. The work is therefore a promising technical proposal for distributional fitting, but this version does not establish its population-representation claims or formal guarantees.

Pregunta de investigación

¿Puede construirse un conjunto de personas narrativas generadas desde huellas digitales humanas que, al condicionar varios LLM, reproduzca mejor distribuciones psicométricas globales y de grupos objetivo que los conjuntos públicos de personas existentes?

Método

El método agrega publicaciones por autor del Blog Authorship Corpus, limpia y filtra los textos, genera una persona de hasta cien palabras con una variante de Llama 3 de 70B y la puntúa con Qwen2.5-72B en alucinación, cobertura, concisión, relevancia y calidad. Conserva los perfiles con puntuación global superior a 8 y todas las dimensiones superiores a 7. Para la alineación global, un LLM congelado responde los 50 ítems IPIP Big Five condicionado por cada persona; se estiman densidades mediante KDE, se remuestrea el 70 % superior por pesos de importancia y se refina la selección con transporte óptimo entrópico y Sinkhorn, hasta obtener 5.000 personas. Para grupos específicos, Qwen2.5-72B genera dos consultas por persona y filtra negativos; Qwen3-Embedding-0.6B se entrena de forma contrastiva para recuperar perfiles, que luego Qwen reescribe siguiendo instrucciones de YRBSS o WVS. Se comparan tres modelos base y seis conjuntos públicos o sintéticos mediante AMW, distancia de Fréchet, Wasserstein cortada, MMD y error absoluto entre matrices de correlación. La revisión recalculó promedios y porcentajes a partir de las cuatro tablas, contrastó las estadísticas del corpus con su fuente primaria, examinó los prompts, las dos pruebas teóricas, la sección de privacidad y las veinte páginas renderizadas.

Muestra: La fuente de perfiles es el Blog Authorship Corpus: su documentación primaria describe 681.288 publicaciones de 19.320 blogueros recopiladas en 2004. Table 10 del preprint informa 681.000 textos brutos, 500.000 tras preprocesado, 368.000 tras control de calidad, 41.607 borradores por usuario y 30.738 personas finales; la alineación global selecciona 5.000. La referencia IPIP contiene 1.015.341 respuestas y el artículo declara 224 países o regiones. Para evaluación adicional, Table 7 declara CFCS con 15.034 respuestas de 144 países, FBPS con 41.841 de 169, Duckworth con 4.270 de 111, YRBSS con 20.103 respuestas y 105 ítems, y WVS completo con 97.221 respuestas y 294 ítems; los experimentos regionales generan 1.000 personas por escenario. El manuscrito ofrece otros conteos incompatibles, más de 30.000 usuarios, más de 100.000 y más de 160.000 personas, que no pueden reconciliarse con la fuente primaria ni con Table 10.

Hallazgos

  • Table 1 informa que Resample logra el menor promedio global de los métodos comparados: 0,1715.
  • En Qwen2.5-72B, Resample obtiene AMW 0,1527, FD 0,2628, SW 0,1272 y MMD 0,0840.
  • En Llama-3-70B, Resample obtiene 0,2013, 0,4036, 0,1955 y 0,1937 en esas cuatro métricas.
  • En Phi-4, Resample obtiene 0,0889, 0,1911, 0,1214 y 0,0353.
  • Raw y RandomSelect producen promedios casi idénticos, 0,2580 y 0,2577, lo que apoya que el cambio principal proviene de la selección distribucional y no del tamaño del subconjunto.
  • Los porcentajes de mejora de 49,8 %, 37,9 % y 45,1 % anunciados para Table 1 no se obtienen de una regla única y explícita aplicada a los promedios visibles.
  • Los modelos sin persona mejoran al subir la temperatura, pero quedan muy por detrás de los métodos condicionados por persona en Table 1.
  • Figure 3 confirma visualmente que la temperatura añade dispersión pero no cubre por sí sola la distribución humana de extraversión y estabilidad emocional.
  • Figure 3 también muestra que ningún conjunto sintético coincide perfectamente con la nube humana, pese al lenguaje de cobertura completa usado en el texto.
  • Table 2 informa para Resample un promedio real de 0,2085 en CFCS, FBPS y Duckworth.
  • El texto declara 0,2279 para el mismo promedio de Table 2, en contradicción con la tabla.
  • Frente al promedio 0,3344 de Bavard, 0,2085 supone una reducción aproximada del 37,6 %, no del 32 % declarado.
  • En FBPS, Table 2 informa FD 0,4004, mientras el texto afirma 0,4220.
  • El texto llama MED a la cuarta métrica de Table 2, pero la tabla y el método la identifican como MMD.
  • Resample presenta el valor mínimo de todas las celdas de Table 2 dentro de los métodos comparados.
  • La transferencia de Table 2 es a cuestionarios distintos dentro del mismo ecosistema de respuestas psicométricas en línea, no a nuevas poblaciones representativas.
  • Table 3 informa para Resample MAEcorr 0,4108 en Big Five, 0,2270 en CFCS, 0,3607 en FBPS y 0,4255 en Duckworth.
  • El promedio correcto de esa fila es 0,3560, como muestra Table 3.
  • El texto declara 0,3651 y una mejora del 16,2 % frente a Bavard; los valores tabulados implican aproximadamente 18,3 %.
  • MAEcorr compara matrices de correlación agregadas entre población humana y sintética; no mide consistencia longitudinal dentro de cada individuo.
  • Table 4 informa 4,5329 para el recuperador contrastivo entrenado, el mejor promedio entre las filas mostradas.
  • El 19,1 % de mejora declarado frente a AlignX es compatible, por redondeo, con 4,5329 frente a 5,6136.
  • La mejora del 8,9 % frente a Resample no puede verificarse porque Table 4 no incluye una fila Resample.
  • El recuperador sin entrenamiento obtiene 4,8702 y también supera a los conjuntos externos mostrados.
  • El término untrained describe al modelo de embeddings preentrenado sin el ajuste contrastivo del artículo, no a un modelo sin entrenamiento previo.
  • La evaluación de grupos usa YRBSS y tres regiones WVS: Hong Kong, Estados Unidos y Alemania.
  • Los prompts de grupo exigen que el perfil de Hong Kong represente la visión, confianza social e identidad cultural de la población general.
  • El prompt alemán prescribe opiniones típicas sobre familia, conciliación y bienestar social.
  • El prompt estadounidense prescribe perspectivas mainstream sobre identidad nacional, participación cívica y justicia social.
  • El prompt YRBSS exige incluir dieta, actividad, conducta sexual, consumo de sustancias, salud mental y seguridad.
  • Estas instrucciones proporcionan al generador los temas y estereotipos que después se comparan con las encuestas objetivo.
  • La cadena de semillas documentada en Table 10 termina en 30.738 personas de alta calidad.
  • Ese total contradice la afirmación de más de 160.000 personas de Section 3.1 y la de más de 100.000 del apéndice.
  • La documentación original del Blog Authorship Corpus informa 19.320 blogueros, no más de 30.000.
  • El manuscrito habla en plural de tres datasets abiertos o de cada fuente, pero solo identifica el Blog Authorship Corpus para la minería.
  • El corpus original contiene blogs de 2004 y tres franjas de edad discontinuas, por lo que no representa la población contemporánea.
  • El trabajo usa una muestra voluntaria en línea de OpenPsychometrics como proxy de población humana global.
  • El propio apéndice reconoce la infrarrepresentación de personas rurales, mayores, sin conexión y de comunidades con pocos recursos.
  • El filtro de seguridad y calidad elimina aproximadamente un 30 % de perfiles y puede reducir precisamente experiencias adversas relevantes para simulaciones sociales.
  • La sección de privacidad informa que GPT-4o marca 0,69 % de personas para reescritura y 99,31 % como sin PII según su taxonomía estrecha.
  • El detector solo considera nombre completo, dirección postal, correo, teléfono y tarjeta o cuenta bancaria.
  • La etiqueta negativa del detector es una salida de modelo, no una prueba de anonimato ni de ausencia de reidentificación.
  • Cinco anotadores revisan las salidas según el manuscrito, pero no se informa protocolo, acuerdo, formación, compensación ni datos demográficos.
  • Los nombres de figuras públicas se excluyen deliberadamente de PII.
  • Los prompts completos de limpieza, generación, evaluación, grupo y privacidad están incluidos, lo que mejora la inspección conceptual.
  • El apéndice identifica checkpoints y varios hiperparámetros: KDE 0,20, retención 70 %, epsilon 0,08, lotes de 10.000 y 250 iteraciones Sinkhorn.
  • La versión de Llama usada para generar semillas cambia entre Llama-3-70B, Llama-3.3-70B y sus nombres de checkpoint.
  • El manuscrito conserva cabeceras Trovato et al. y fechas editoriales de 2007–2009 del template ACM, señal de que no es una versión editorial final.
  • No se encontró una publicación revisada por pares ni un repositorio específico de código, personas o resultados asociado al trabajo hasta el 15 de julio de 2026.
  • La evidencia respalda una reducción de distancias de respuesta bajo el protocolo elegido, no la precisión de una simulación social completa.

Limitaciones

  • El documento es un preprint y no se encontró una versión revisada por pares.
  • Las cabeceras y fechas residuales del template indican una preparación editorial incompleta.
  • No se publica el código de la cadena de datos, muestreo, transporte o evaluación.
  • No se publica el conjunto final de 30.738 personas.
  • No se publican las 5.000 personas seleccionadas.
  • No se publican las personas de los cuatro grupos objetivo.
  • No se publican las respuestas crudas de los LLM a los cuestionarios.
  • No se publican los pesos KDE, de importancia o de transporte óptimo.
  • No se publica un artefacto ejecutable para reproducir las tablas.
  • No se informa una licencia para los datos derivados.
  • La fuente del corpus limita su uso a investigación no comercial y el manuscrito no discute las implicaciones para liberar derivados.
  • No se explica la procedencia de la cifra de más de 160.000 personas.
  • No se explica la procedencia de la cifra de más de 100.000 personas.
  • No se reconcilian esas cifras con las 30.738 personas de Table 10.
  • No se reconcilian los más de 30.000 usuarios del apéndice con los 19.320 autores de la fuente primaria.
  • El texto alude a tres datasets abiertos, pero documenta solo uno.
  • La gramática en plural de varias fuentes oculta que la tabla final contiene solo blogs.
  • El Blog Authorship Corpus se recopiló en 2004 y no se analiza deriva temporal.
  • El corpus contiene únicamente autores de Blogger y no una muestra probabilística.
  • El corpus está restringido al inglés.
  • Las edades del corpus se concentran en 13–17, 23–27 y 33–47 años.
  • No incluye de forma comparable infancia, 18–22, 28–32 ni mayores de 47 años.
  • El balance binario de sexo del corpus no equivale a diversidad de género.
  • Las etiquetas de edad, género, industria y signo fueron autodeclaradas y no se valida su exactitud.
  • No se estudia la representatividad geográfica de los blogueros.
  • No se estudian diferencias socioeconómicas de acceso a blogs en 2004.
  • No se informa consentimiento de los autores para generar perfiles psicológicos a partir de sus textos.
  • No se informa revisión ética, IRB o exención.
  • No se discute si la agregación de publicaciones permite reidentificar a sus autores.
  • Eliminar identificadores directos no elimina combinaciones biográficas únicas.
  • El detector de PII omite nombres parciales, alias y nombres de usuario.
  • El detector omite empleadores, centros educativos y ocupaciones raras.
  • El detector omite fechas, edades exactas y ubicaciones combinadas.
  • El detector omite eventos vitales singulares y relaciones familiares.
  • El detector omite huellas estilométricas.
  • El detector permite nombres de figuras públicas sin justificar el riesgo de perfiles atribuidos.
  • GPT-4o no se identifica por snapshot o fecha en la detección de PII.
  • No se informa sensibilidad, especificidad ni conjunto de prueba del detector.
  • El 99,31 % negativo no se valida contra un estándar humano independiente.
  • No se informa cuántas discrepancias detectaron los cinco revisores.
  • No se informa acuerdo interanotador.
  • No se informa cómo se resolvieron desacuerdos.
  • No se informa si los revisores vieron los textos originales.
  • No se informa compensación o condiciones de trabajo de los revisores.
  • La eliminación de contenido considerado dañino puede borrar experiencias de violencia, acoso o discriminación.
  • Ese filtrado introduce un sesgo de positividad reconocido por los autores.
  • El sesgo de positividad es especialmente problemático al evaluar YRBSS, donde salud mental, violencia y consumo son variables objetivo.
  • El LLM que genera personas y el que evalúa su calidad pertenecen a una cadena de evaluación automatizada sin validación humana integral.
  • No se valida manualmente la fidelidad de las 30.738 personas a sus publicaciones fuente.
  • Los umbrales 8 y 7 de calidad son arbitrarios y no se aporta calibración.
  • No se informa distribución de puntuaciones ni error del crítico.
  • No se estudia sensibilidad a los prompts de generación o crítica.
  • No se estudia sensibilidad al modelo generador de personas.
  • La versión exacta de Llama para la generación de semillas es contradictoria.
  • Qwen2.5-72B se usa tanto para varias generaciones como para filtrado, creando circularidad de modelo.
  • No se especifica claramente qué LLM responde el cuestionario durante cada fase de alineación.
  • Los perfiles se evalúan a través de respuestas del LLM y no mediante propiedades observadas de sus autores humanos.
  • La alineación puede seleccionar personas que inducen respuestas deseadas sin ser descripciones humanas fieles.
  • IPIP OpenPsychometrics es una muestra de conveniencia en línea, no una encuesta probabilística mundial.
  • Contar países o regiones no corrige el desequilibrio de tamaños entre países.
  • No se aplican pesos de encuesta o posestratificación demográfica a IPIP.
  • No se informa la composición por país, edad, sexo, educación o idioma de la referencia IPIP usada.
  • El manuscrito alterna entre 223 y 224 países o regiones.
  • No se demuestra invariancia de medida de IPIP entre culturas o lenguas.
  • Las respuestas de distintas traducciones pueden no ser directamente comparables.
  • CFCS, FBPS y Duckworth proceden también de respuestas psicométricas voluntarias en línea.
  • Por ello, la evaluación fuera de dominio cambia de instrumento pero no garantiza cambio de población o mecanismo de recogida.
  • Los números de ítems de FBPS son internamente incompatibles: 25 en la descripción y 76 en Table 7.
  • Los números de ítems de Duckworth son internamente incompatibles: 12 en la descripción y 50 en Table 7.
  • No se explica qué versiones o adaptaciones de CFCS, FBPS y Duckworth se emplearon.
  • No se aportan propiedades psicométricas de las escalas en las muestras usadas.
  • No se demuestra invariancia de medida entre humanos y respuestas generadas por LLM.
  • No se controla aquiescencia, deseabilidad social o estilos de respuesta de los LLM.
  • No se informa el orden de ítems ni si se aleatorizó.
  • No se informa cuántas réplicas se generaron por persona y modelo.
  • No se informan semillas aleatorias.
  • No se informan desviaciones estándar.
  • No se informan intervalos de confianza.
  • No se realizan pruebas de hipótesis para el uso de significativamente.
  • No se corrige por múltiples comparaciones.
  • No se informa variabilidad entre ejecuciones del muestreo o Sinkhorn.
  • No se analiza sensibilidad al ancho de banda KDE 0,20.
  • No se analiza sensibilidad a conservar el 70 % de candidatos.
  • No se analiza sensibilidad a epsilon 0,08.
  • No se analiza sensibilidad a los pesos por ítem del coste de transporte.
  • No se justifica el tamaño final de 5.000 personas.
  • No se compara contra remuestreo demográfico clásico o raking.
  • No se compara contra una muestra humana probabilística equivalente.
  • La evaluación in-domain reutiliza IPIP como objetivo de alineación y como criterio de éxito.
  • Esta reutilización mide en parte la optimización directa hacia el objetivo.
  • Las cuatro métricas distribucionales no son independientes y se promedian sin justificar escalas o pesos.
  • Los porcentajes de mejora de Table 1 no se acompañan de fórmula reproducible.
  • El promedio de Table 2 en el texto contradice la tabla.
  • El porcentaje de mejora de Table 2 contradice los valores tabulados.
  • El FD de FBPS en el texto contradice Table 2.
  • El nombre MED contradice MMD.
  • El promedio de Table 3 en el texto contradice la tabla.
  • El porcentaje de mejora de Table 3 contradice los valores tabulados.
  • MAEcorr agregado se presenta como consistencia individual sin medir estabilidad dentro de la persona.
  • La mejora frente a Resample en Table 4 no puede verificarse porque esa fila está ausente.
  • No se explica si untrained conserva el checkpoint Qwen preentrenado, aunque el contexto así lo sugiere.
  • Las regiones WVS se reducen a un país o territorio representativo por bloque.
  • Hong Kong no representa toda Asia Oriental.
  • Alemania no representa toda Europa Occidental.
  • Estados Unidos no representa toda Norteamérica.
  • No se usan pesos de encuesta WVS en la comparación descrita.
  • No se usan pesos de encuesta YRBSS en la comparación descrita.
  • Los prompts regionales introducen directamente valores y actitudes esperados.
  • La palabra mainstream en el prompt estadounidense reduce diversidad política y social.
  • La instrucción typical views del prompt alemán convierte estereotipos del generador en objetivo.
  • La instrucción representative of the general populace para Hong Kong no define una distribución medible.
  • El prompt YRBSS exige completar atributos sensibles aunque no estén en la semilla.
  • Las reescrituras pueden fabricar conducta sexual, consumo, salud mental o experiencias de seguridad.
  • No se mide daño estereotípico o estigmatización en los perfiles de grupo.
  • No se evalúan subgrupos protegidos dentro de cada región.
  • No se compara el contenido de las personas generadas con entrevistas humanas.
  • No se evalúa fidelidad individual entre semilla y reescritura regional.
  • No se evalúa si el recuperador memoriza expresiones de las consultas sintéticas.
  • Los positivos y negativos de entrenamiento son generados o filtrados por Qwen, no por relevancia humana independiente.
  • No se informa tamaño final del conjunto contrastivo.
  • No se informa una partición independiente de personas para entrenar y evaluar el recuperador.
  • No se demuestra generalización a grupos formulados fuera de los cuatro prompts.
  • No se evalúa ninguna dinámica multiagente real.
  • No se evalúan conversaciones entre personas.
  • No se evalúan predicciones temporales o de acontecimientos.
  • No se evalúan decisiones de intervención o política pública.
  • No se compara una salida simulada con resultados sociales observados fuera de los cuestionarios.
  • La coincidencia distribucional de respuestas no implica causalidad social.
  • La coincidencia poblacional no garantiza que cada persona sea coherente o verdadera.
  • La coincidencia de marginales y correlaciones no garantiza estructuras de dependencia superiores.
  • No se evalúa estabilidad de una misma persona entre modelos base.
  • No se evalúa estabilidad ante paráfrasis del cuestionario.
  • No se evalúa estabilidad longitudinal.
  • No se informa el coste computacional total.
  • No se informa el número total de llamadas o tokens.
  • No se informa tiempo de ejecución, hardware, energía o coste económico.
  • La construcción requiere generar y puntuar cientos de miles de textos y responder millones de ítems, lo que limita replicación.
  • La demostración de Theorem 1 equipara insesgadez de pesos con igualdad exacta de distribuciones.
  • Una distribución de importancia con soporte finito no tiene por qué coincidir exactamente con la distribución humana empírica.
  • Theorem 1 afirma que la suma de pesos exactos es Θ(1), aunque sin normalización previa normalmente escala con N.
  • Theorem 1 aplica una cota de Wasserstein con raíz cuadrada de TV pero conserva el mismo orden de error sin la raíz.
  • La tasa empírica de Wasserstein declarada omite la dependencia usual de la dimensión.
  • No se enumeran las condiciones de soporte, continuidad, densidad mínima y regularidad necesarias para las cotas KDE.
  • Theorem 2 afirma que todas las entradas de un acoplamiento son al menos 1/(N por M), pero los acoplamientos factibles pueden contener ceros.
  • La propia prueba obtiene epsilon por log(N por M), que no es O(epsilon) uniformemente cuando N y M varían.
  • El teorema del apéndice usa un coste euclídeo no ponderado mientras el método principal define un coste ponderado por ítem.
  • La garantía de transporte se refiere al coste entre vectores de respuesta, no a fidelidad humana de las biografías.
  • Las dos pruebas no justifican la frase provably recovers the target distribution.
  • No existe preregistro.
  • No existe replicación independiente reportada.
  • No se discute la posibilidad de resultados negativos o fallos por modelo.
  • No se ofrece una ficha de datos o model card para las personas derivadas.
  • No se establece gobernanza de acceso, retirada o eliminación para los autores del corpus.

Qué no demuestra

  • No demuestra que el conjunto final represente a la población mundial.
  • No demuestra representatividad nacional o regional de IPIP, WVS o YRBSS sin ponderación y diseño muestral explícitos.
  • No demuestra que los perfiles generados describan fielmente a los blogueros originales.
  • No demuestra que los blogueros consintieran inferencia psicométrica o generación de personas.
  • No demuestra que el 99,31 % de perfiles esté anonimizado o libre de riesgo de reidentificación.
  • No demuestra que el filtrado con LLM elimine alucinaciones.
  • No demuestra que las puntuaciones psicométricas generadas equivalgan a respuestas humanas.
  • No demuestra invariancia psicométrica entre países, lenguas, humanos y LLM.
  • No demuestra que minimizar AMW, FD, SW o MMD produzca personas individualmente válidas.
  • No demuestra consistencia individual mediante MAEcorr, porque compara correlaciones poblacionales.
  • No demuestra generalización fuera de cuestionarios psicométricos en línea relacionados.
  • No demuestra que los prompts regionales descubran cultura en vez de imponer estereotipos.
  • No demuestra que Hong Kong, Alemania o Estados Unidos representen sus regiones WVS completas.
  • No demuestra que las personas YRBSS correspondan a adolescentes reales.
  • No demuestra que fabricar atributos sensibles sea ético o seguro.
  • No demuestra una mejora estadísticamente significativa porque no informa incertidumbre ni réplicas.
  • No demuestra que los porcentajes anunciados sean reproducibles a partir de las tablas.
  • No demuestra la validez de Theorem 1.
  • No demuestra una cota O(epsilon) uniforme en Theorem 2.
  • No demuestra recuperación exacta de la distribución objetivo.
  • No demuestra comportamiento, interacción o dinámica social realista.
  • No demuestra capacidad predictiva sobre elecciones, salud, conflicto o valores observados.
  • No demuestra utilidad ni seguridad para decisiones de política pública.
  • No demuestra reproducibilidad sin código, datos derivados, pesos y salidas crudas.
  • No justifica desplegar las personas como sustitutos de participantes humanos.

Trazabilidad

Alcance: Texto completo

Versión: arXiv 2509.10127v2, 4 Oct 2025; open 20-page preprint

Fuente consultada: https://arxiv.org/pdf/2509.10127v2

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, dataset-provenance, psychometric-validity, metric-recalculation, theoretical-proof, privacy, ethics, internal-consistency and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Meta-Llama-3-70B-Instruct
  • Meta-Llama-3.3-70B-Instruct
  • Qwen2.5-72B-Instruct
  • Qwen3-Embedding-0.6B
  • Phi-4
  • GPT-4o

Instrumentos y métricas

  • IPIP Big Five 50-item inventory
  • Consideration of Future Consequences Scale (CFCS)
  • Free Will and Punishment and Retribution Scale (FBPS)
  • Duckworth Grit Scale
  • World Values Survey (WVS)
  • Youth Risk Behavior Surveillance System (YRBSS)
  • Averaged Monotonic Wasserstein (AMW)
  • Fréchet Distance (FD)
  • Sliced Wasserstein Distance (SW)
  • Maximum Mean Discrepancy (MMD)
  • MAEcorr between human and synthetic correlation matrices

Datos utilizados

  • Blog Authorship Corpus
  • OpenPsychometrics IPIP Big Five responses
  • OpenPsychometrics CFCS responses
  • OpenPsychometrics FBPS responses
  • OpenPsychometrics Duckworth responses
  • World Values Survey responses
  • Youth Risk Behavior Survey responses
  • Tulu-3-Persona
  • Bavard
  • Google Synthetic Personas
  • AlignX
  • Nvidia Nemotron personas
  • PersonalHub
  • SyncP personas

Evidencia y localización

  • Identidad bibliográfica y estado editorial: arXiv 2509.10127v2, submitted 12 Sep 2025 and revised 4 Oct 2025; Microsoft Research and DBLP list it as arXiv/CoRR; no peer-reviewed venue found, checked 15 Jul 2026
  • Texto completo abierto inspeccionado: .cache/editorial-sources/article-086/source.pdf; 20 pages; sha256 1ae6da2319faaf7ea959c44c06fe1c6287033585cd91fd9f5c40d8bb00a2cb35
  • Orden de autoría: arXiv v2 metadata and title page: Zhengyu Hu, Zheyuan Xiao, Max Xiong, Yuxuan Lei, Tianfu Wang, Jianxun Lian, Kaize Ding, Ziang Xiao, Nicholas Jing Yuan, Xing Xie
  • Cadena de generación de semillas: Sections 3.1 and Appendix F, pp. 3 and 17-20; Listings 13-16
  • Estadísticas finales de semillas: Table 10, p. 20: 681,000 raw; 500,000 preprocessed; 368,000 raw-QC; 41,607 persona generation; 30,738 persona-QC
  • Estadísticas primarias del corpus: Official Hugging Face Blog Authorship Corpus dataset card: 681,288 posts, 19,320 bloggers, collected August 2004, over 140 million words, non-commercial research use
  • Contradicciones de escala y fuentes: Section 3.1 p. 3 says over 160,000; Appendix B.1 p. 11 says over 30,000 users; Appendix F p. 17 says over 19,000 and over 100,000; Table 10 says 30,738
  • Alineación global: Section 3.2, pp. 3-5; equations 1-9; KDE importance sampling, 70% candidate retention, entropic OT and final sample of 5,000
  • Hiperparámetros: Appendix B.1, pp. 11-12: Gaussian KDE bandwidth 0.20, epsilon 0.08 scaled by median cost, batch size 10,000 and 250 Sinkhorn iterations
  • Construcción específica de grupo: Section 3.3, pp. 5-6; Appendix B.6, pp. 14-15; Listings 4-7
  • Prompts regionales estereotipados: Listings 5-7, pp. 14-15: representative general-populace Hong Kong views, typical German views, and mainstream U.S. perspectives
  • Prompt sensible de YRBSS: Listing 4, p. 14: requires diet, physical activity, sexual behavior, substance use, mental health and safety experiences
  • Modelos y checkpoints: Introduction, Sections 3.1-4 and Appendix B.1/F: Qwen2.5-72B, Qwen3-Embedding-0.6B, Llama-3-70B, Llama-3.3-70B, Phi-4 and GPT-4o; inconsistent Llama naming
  • Resultados in-domain: Table 1 and Section 4.1, pp. 6-7; Resample averages 0.1715 and Raw/RandomSelect 0.2580/0.2577
  • Resultados fuera de dominio y contradicciones: Table 2 and adjacent prose, p. 7: table average 0.2085 versus prose 0.2279; FBPS FD 0.4004 versus 0.4220; table MMD versus prose MED
  • Correlaciones agregadas y contradicción: Table 3 and Section 4.2, p. 7: row average 0.3560 versus prose 0.3651; metric compares Pearson correlation matrices
  • Resultados de grupos: Table 4, p. 8: EM w train 4.5329, EM w/o train 4.8702, AlignX 5.6136; Resample comparison claimed but row absent
  • Cobertura visual incompleta: Figure 3, pp. 7-8: synthetic clouds remain distinguishable from the human distribution despite improved coverage
  • Muestras e instrumentos: Appendix B.2 and Table 7, pp. 12-13; includes incompatible FBPS and Duckworth item counts between prose and table
  • Privacidad y revisión humana: Appendix C and Listings 8-12, pp. 15-17: GPT-4o detector taxonomy, 99.31% no, 0.69% rewritten and five annotators
  • Sesgo de filtrado y cobertura poblacional: Limitations, pp. 9-10: positivity bias and underrepresentation of rural, elderly, offline and under-resourced communities
  • Fallo de Theorem 1: Theorem 1 and proof, pp. 19-20, equations 22/24 and A-D: unbiased weights treated as exact distribution equality, Θ(1) normalization and unsquared error-order problems
  • Fallo de Theorem 2: Theorem 2 and proof, pp. 19-20, equations 23/25 and A-C: feasible couplings may contain zeros and the derived gap is epsilon log(N-dagger M), not uniform O(epsilon)
  • Residuos de plantilla: Running headers Trovato et al. throughout and final line p. 20: Received 20 February 2007; revised 12 March 2009; accepted 5 June 2009
  • Ausencia de artefactos reproducibles: Complete PDF links plus targeted GitHub and Hugging Face searches inspected 15 Jul 2026: only generic model/training references; no paper-specific code, persona data or result repository found
  • Lectura y comprobación visual integral: All 20 pages rendered and inspected, including Figures 1-4, Tables 1-10, equations 1-25, prompts, privacy examples, limitations, proofs and references; checked 15 Jul 2026