Este preprint propone una cadena de tres etapas para construir personas destinadas a simulaciones sociales con LLM. Primero transforma publicaciones del Blog Authorship Corpus en perfiles narrativos y los filtra con dos LLM; después hace que un LLM responda cuestionarios psicométricos como cada persona y selecciona 5.000 perfiles mediante muestreo por importancia y transporte óptimo para aproximar una distribución humana de referencia; por último recupera y reescribe perfiles para grupos concretos de YRBSS y WVS. En las tablas publicadas, la variante Resample obtiene el menor error medio en IPIP Big Five (0,1715), en tres cuestionarios no usados para el ajuste (0,2085) y en el error entre matrices de correlaciones (0,3560); el recuperador entrenado obtiene 4,5329 en los cuatro escenarios de grupo. Estos resultados muestran que optimizar perfiles contra las mismas familias de respuestas reduce las distancias elegidas frente a los baselines evaluados. No prueban que las personas representen a la población mundial ni que una simulación prediga conducta social o decisiones de política pública. La auditoría integral detecta contradicciones materiales entre texto y tablas, incluidos el tamaño final del corpus, los promedios de Tables 2 y 3 y varios porcentajes, instrucciones regionales estereotipadas que anticipan las respuestas objetivo, ausencia de incertidumbre y artefactos reproducibles, cobertura de privacidad demasiado estrecha y fallos en las dos demostraciones teóricas. Por ello, el trabajo es una propuesta técnica prometedora de ajuste distribucional, pero su afirmación de representación poblacional y sus garantías formales no quedan establecidas por esta versión.
Pregunta de investigación
¿Puede construirse un conjunto de personas narrativas generadas desde huellas digitales humanas que, al condicionar varios LLM, reproduzca mejor distribuciones psicométricas globales y de grupos objetivo que los conjuntos públicos de personas existentes?