Scaling Law in LLM Simulated Personality: More Detailed and Realistic Persona Profile Is All You Need

Personas, identidad y agentes2025DOIRevisión editorial aprobada

Autores: Yuqi Bai, Tianyu Huang, Kun Sun, Yuting Chen

Palabras clave: Computers and Society, Artificial Intelligence, Computation and Language, Social experiments, Persona role-playing

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
18
Hallazgos
40
Limitaciones
18
Evidencias

Resumen editorial

Español

Bai y coautores preguntan si añadir detalle y aparente realismo a una persona textual hace que DeepSeek-chat produzca perfiles Big Five más repetibles, distinguibles y parecidos a curvas humanas por edad. El trabajo, que sigue siendo un preprint, propone un pipeline de SQLite: muestrea esqueletos demográficos del Adult Income Dataset de 1994, los amplía con el propio LLM, administra los 120 ítems IPIP-NEO en seis bloques y calcula OCEAN. Solo se usa un servicio llamado DeepSeek-chat versión 3.0 anterior a 3.1; la API se invoca mediante un alias mutable y el código liberado no fija el snapshot ni la temperatura que el texto sitúa en 0,7.

A escala individual, se eligen cinco personas y se comparan versiones muy recortadas con sus perfiles completos mediante 300 cuestionarios repetidos por condición. Tras descartar outliers por IQR quedan entre 275 y 298 respuestas. El coeficiente de variación de las distancias de Mahalanobis baja en los cinco casos: 0,2806→0,2384; 0,2818→0,2168; 0,3380→0,2451; 0,2787→0,2523; y 0,2811→0,2369. La separación por K-means también aumenta: el ARI conjunto pasa de 0,7349 a 0,9835 y el par 4–5 de 0,0795 a 0,9151. Sin embargo, tres pares ya estaban entre 0,9531 y 1 con perfiles pobres. Las distancias se calculan respecto de la media de la propia muestra, no de un prototipo ideal externo; K-means recibe de antemano el número correcto de personas y se evalúa sobre los mismos datos. Esto apoya que más texto puede restringir y diferenciar respuestas en este protocolo, pero no prueba una personalidad interna ni una identidad estable a lo largo de una interacción.

A escala de población se comparan cuatro condiciones declaradas de 600 casos: perfiles censales ampliados; los mismos perfiles con una instrucción anti-idealización durante el test; personas narrativas de al menos 2.000 palabras; y personajes literarios obtenidos a partir de Wikidata. Se ajusta un polinomio cúbico para cada rasgo en función de la edad y se miden seis puntos, de 20 a 70 años, frente a curvas humanas. La distancia conjunta desciende de 70,25 a 63,45, 51,21 y 23,75. Los apéndices muestran la misma ordenación con varias métricas distribucionales. Es un patrón descriptivo interesante, no una ley de escalado: no existe una variable cuantitativa de detalle, un exponente, niveles repetidos, validación fuera de muestra ni predicción extrapolable. Además, cada escalón cambia simultáneamente la fuente de población, el prompt, el contenido y el modo de construcción. El último grupo no es una versión más detallada de la misma población censal, sino una población distinta de personajes ficticios, y el propio LLM completa sus descripciones.

La auditoría del artefacto reduce aún más la fuerza de la conclusión. El repositorio publica código, prompts, census.csv y algunos resultados de CFA, pero los SQLite con las respuestas y resultados están en un enlace Baidu bloqueado por captcha y no pueden recomputarse desde GitHub. No hay manifiestos que unan cada figura con un commit, configuración y modelo. La importación humana liberada marca todos los ítems como no invertidos, mientras el scoring de respuestas LLM aplica la clave inversa de 55 ítems; sin el human.db no puede comprobarse si la referencia publicada quedó afectada, pero el pipeline disponible no demuestra equivalencia de scoring. La comparación de curvas usa polinomios cúbicos sin validación ni incertidumbre; el Sliced Wasserstein usa proyecciones aleatorias sin seed; y Average Marginal Wasserstein duplica exactamente el cálculo llamado Wasserstein Mean.

La aportación defendible es un banco de trabajo exploratorio para estudiar cómo el contexto de persona constriñe autoinformes sintéticos. Los resultados sugieren que perfiles ricos inducen mayor autoconsistencia y que ciertas poblaciones generadas se acercan más a cinco medias marginales humanas por edad bajo este setup. No demuestran una ley general, fidelidad psicológica, validez psicométrica, causalidad del detalle, ni que las personas sintéticas permitan sustituir participantes humanos. De hecho, el diseño puede confundir realismo con obediencia al prompt, circularidad entre el modelo que escribe la persona y el que responde, y reproducción de estereotipos demográficos. Las afirmaciones de que el LLM «posee» personalidad, que CFA y validez de constructo son irrelevantes o que más detalle es todo lo necesario exceden la evidencia presentada.

English

Bai and coauthors ask whether adding detail and apparent realism to a textual persona makes DeepSeek-chat produce Big Five profiles that are more repeatable, distinguishable, and similar to human age curves. The work remains a preprint. It proposes a SQLite pipeline that samples demographic skeletons from the 1994 Adult Income Dataset, expands them with the same LLM, administers the 120 IPIP-NEO items in six blocks, and computes OCEAN scores. Only one service is tested: DeepSeek-chat version 3.0 before 3.1. It is invoked through a mutable API alias, and the released code neither freezes the model snapshot nor sets the temperature reported as 0.7 in the paper.

At the individual level, five personas are selected and severely shortened versions are compared with their full profiles across 300 repeated questionnaire administrations per condition. After IQR outlier removal, 275–298 observations remain. The coefficient of variation of Mahalanobis distances decreases in all five cases: 0.2806→0.2384, 0.2818→0.2168, 0.3380→0.2451, 0.2787→0.2523, and 0.2811→0.2369. K-means separation also improves: pooled ARI rises from 0.7349 to 0.9835 and pair 4–5 from 0.0795 to 0.9151. Yet three pairs were already between 0.9531 and 1 with poor profiles. Distances are computed from the sample-derived mean, not an external ideal prototype; K-means is given the correct number of personas and evaluated on the same observations. The experiment therefore supports the narrower claim that additional text can constrain and differentiate questionnaire outputs under this protocol. It does not demonstrate an internal personality or an identity that persists through interaction.

At the population level, the paper compares four conditions, each reported as n=600: enriched census profiles; the same profiles with an anti-idealization instruction during testing; at-least-2,000-word narrative personas; and literary characters sourced through Wikidata. A cubic polynomial is fitted for each trait against age and evaluated at six points from ages 20 to 70 against human curves. Joint distance decreases from 70.25 to 63.45, 51.21, and 23.75. Appendix metrics reproduce the same ordering. This is an interesting descriptive pattern, not a scaling law: there is no measured quantity of detail, exponent, replicated levels, held-out prediction, or extrapolative validation. Each step simultaneously changes population source, prompt, content, and construction method. The final group is not a more detailed version of the census population but a different population of fictional characters, and the LLM itself fills gaps in their descriptions.

The artifact audit further limits the conclusion. GitHub contains code, prompts, census.csv, and some CFA outputs, but the SQLite files with responses and results are hosted behind a Baidu captcha and the figures cannot be recomputed from the repository. No run manifests bind each figure to a commit, configuration, and model snapshot. The released human-data importer marks every item as not reverse-scored, whereas the LLM scoring path applies the 55-item reverse key. Without human.db, whether the published reference was affected cannot be established, but the available pipeline does not demonstrate scoring equivalence. Curve comparison uses unvalidated cubic fits without uncertainty; Sliced Wasserstein uses unseeded random projections; and Average Marginal Wasserstein duplicates the calculation labeled Wasserstein Mean.

The defensible contribution is an exploratory workbench for studying how persona context constrains synthetic self-reports. The findings suggest that richer profiles induce greater response self-consistency and that some generated populations more closely match five human marginal age means in this setup. They do not establish a general law, psychological fidelity, psychometric validity, a causal effect of detail, or that synthetic personas can replace human participants. The design can instead confound realism with prompt obedience, circularity between the model writing the persona and the model answering the questionnaire, and reproduction of demographic stereotypes. Claims that the LLM “possesses” personality, that CFA and construct validity are irrelevant, or that more detail is all that is needed go beyond the presented evidence.

Pregunta de investigación

¿Cómo cambia la repetibilidad, identificabilidad y semejanza con curvas humanas de las respuestas IPIP-NEO de DeepSeek-chat cuando las personas textuales pasan de esqueletos demográficos o versiones recortadas a perfiles ampliados, narrativos o basados en personajes literarios?

Método

Preprint experimental exploratorio con un único endpoint LLM. El pipeline muestrea el Adult Income Dataset, genera personas, divide IPIP-NEO-120 en seis bloques de 20 ítems y calcula OCEAN. A nivel individual compara cinco perfiles pobres y completos mediante 300 administraciones, distancias de Mahalanobis, KDE, coeficiente de variación, curtosis, PCA, K-means y ARI. A nivel poblacional compara cuatro condiciones declaradas de 600 personas, ajusta polinomios cúbicos rasgo-edad y calcula distancias a una referencia humana en edades 20, 30, 40, 50, 60 y 70, más ocho métricas distribucionales. La auditoría editorial leyó las 31 páginas de Research Square y las 21 de arXiv, renderizó e inspeccionó figuras y apéndices, y revisó el tag v1.0.0, el commit actual, prompts, generación, parsing, scoring e implementación estadística.

Muestra: El análisis individual declara 300 cuestionarios por cada combinación de cinco personas y dos niveles de detalle; después del filtro IQR quedan 275–298 observaciones por celda. El análisis de identificación combina pares adyacentes y las cinco personas. El análisis poblacional declara 600 casos en cada una de cuatro condiciones y una referencia humana, pero el repositorio no incluye los SQLite ni documenta la selección exacta de los 600 humanos. Se evalúa un solo alias de modelo, en inglés, sin réplicas de proveedor o snapshot.

Hallazgos

  • El CV de la distancia de Mahalanobis baja con el perfil completo en las cinco personas: 0,2806→0,2384; 0,2818→0,2168; 0,3380→0,2451; 0,2787→0,2523; y 0,2811→0,2369.
  • Tras eliminación IQR quedan 275–298 de las 300 administraciones declaradas por condición; el efecto de las exclusiones no se prueba con análisis de sensibilidad.
  • El ARI conjunto de cinco personas sube de 0,7349 a 0,9835 y el par 4–5 de 0,0795 a 0,9151.
  • Los pares 1–2, 2–3, 3–4 y 5–1 ya obtienen ARI 0,9538, 1, 0,9531 y 0,9863 con perfiles pobres; el beneficio de detalle no es uniforme y presenta techo.
  • La distancia conjunta de las curvas OCEAN humanas y sintéticas baja en el orden standard 70,25, antialign 63,45, narrative 51,21 y wiki-fiction 23,75.
  • Por rasgo, la condición wiki-fiction obtiene distancias 4,85 en Neuroticism, 13,77 en Extraversion, 11,07 en Openness, 13,23 en Agreeableness y 7,28 en Conscientiousness.
  • Las métricas del apéndice conservan la ordenación: la similitud coseno aumenta de 0,8300 a 0,8422, 0,9260 y 0,9802; MMD disminuye de 0,6578 a 0,6141, 0,4864 y 0,2156.
  • Wasserstein Mean y Average Marginal Wasserstein tienen valores idénticos en todas las filas porque el código implementa el mismo promedio marginal; no son dos confirmaciones independientes.
  • La condición anti-alignment produce una mejora menor que narrativa o wiki-fiction, pero no aísla alignment: modifica instrucciones de respuesta sin controlar contenido, generación o población.
  • El artículo reconoce que la secuencia fue heurística y que el experimento de personajes literarios se diseñó después de observar la mejora narrativa.
  • El repositorio ejecuta K-means con k conocido, estandariza los datos combinados y evalúa ARI sobre la misma muestra, sin holdout ni intervalo de incertidumbre.
  • Las curvas se ajustan con np.polyfit cúbico y se comparan en solo seis edades; no hay validación cruzada, bootstrap, bandas de confianza ni ponderación por la distribución de edades.
  • El enlace de datos apunta a Baidu y exige captcha; GitHub no contiene los SQLite de respuestas, resultados intermedios ni artefactos suficientes para regenerar tablas y figuras.
  • El código de generación usa un alias DeepSeek-chat y no establece temperature, aunque el método declara 0,7; no queda congelado el modelo efectivamente servido.
  • El parser acepta cualquier objeto entre llaves y no valida unicidad, completitud, rango o exactamente 120 respuestas antes de guardar; el pipeline puede omitir casos fallidos posteriormente.
  • La ruta LLM aplica 55 claves inversas IPIP, pero el importador humano liberado fija reverse_scored=0 para todos los ítems; sin la base humana no puede probarse que ambos lados se puntuaran igual.
  • El ejemplo del apéndice atribuye empatía, fiabilidad y resiliencia a una mujer negra en un trabajo de servicios; muestra que la aparente coherencia puede proceder de inferencias estereotípicas.
  • La portada de Research Square presenta a Kun Sun primero, mientras el cuerpo, arXiv y las contribuciones presentan a Yuqi Bai primero; la discrepancia editorial no se explica.

Limitaciones

  • El estudio es un preprint no revisado por pares; Research Square lo advierte expresamente en la portada.
  • Solo prueba un endpoint DeepSeek y una época del servicio; no compara modelos, tamaños, familias ni snapshots.
  • La etiqueta de API es mutable y el repositorio no guarda respuesta de identificación del proveedor, hash de modelo o manifiesto de cada run.
  • La supuesta variable causal, detalle/realismo, no se cuantifica ni manipula de manera aislada.
  • Las cuatro condiciones poblacionales cambian a la vez población, fuente de datos, prompt, longitud, contenido y proceso generativo.
  • No se estima una función de escalado, exponente, intervalo, punto de saturación ni predicción fuera de los cuatro niveles nominales.
  • Los niveles standard, antialign, narrative y wiki-fiction son categorías ordenadas post hoc, no mediciones equiespaciadas de una misma variable.
  • Wiki-fiction representa otra población de personajes ficticios, no la misma población censal con más detalle; su edad, selección y composición no se documentan.
  • El prompt completa perfiles literarios escasos con contenido generado, por lo que no son puramente human-authored como afirma el texto.
  • El mismo tipo de modelo genera las personas y contesta el cuestionario, creando circularidad y posible auto-consistencia léxica.
  • El prompt narrativo pide explícitamente estados y rasgos psicológicos; después el test mide rasgos, lo que introduce target leakage.
  • Más detalle puede imponer respuestas más deterministas sin aumentar verdad, validez de constructo o fidelidad humana.
  • IPIP-NEO se divide en seis conversaciones/bloques con explicaciones obligatorias; orden, contexto y razonamiento pueden inducir consistencia artificial.
  • No se demuestra estructura factorial, invariancia, fiabilidad test–retest, validez convergente, discriminante o criterial en las respuestas del LLM.
  • La distancia de Mahalanobis individual usa la media y covarianza de la muestra como referencia, no un prototipo ideal de la persona.
  • El CV de distancias auto-normalizadas no es una medida directa de persistencia temporal o convergencia psicológica.
  • Las 300 administraciones son llamadas repetidas independientes, no una trayectoria conversacional longitudinal del mismo agente.
  • Se eliminan outliers mediante 1,5 IQR sin preregistro, justificación de mecanismo de fallo o resultados con y sin exclusión.
  • K-means conoce el número verdadero de personas y se evalúa in-sample; no hay clasificación de identidades nuevas, holdout o replicación.
  • Cinco personas seleccionadas sin seed ni criterio publicado son una muestra demasiado pequeña para generalizar identificabilidad.
  • La interpretación de curtosis es incorrecta o inconsistente: cero corresponde a normalidad, no uniformidad, y el perfil completo no siempre se acerca más a cero.
  • El Adult Income Dataset de 1994 es antiguo, selectivo y estadounidense; no representa poblaciones contemporáneas o globales.
  • No se publican tablas demográficas ni distribuciones de edad comparables para los cuatro grupos de 600.
  • La referencia humana se cita como [22], pero esa referencia trata invariancia entre grupos culturales; la fuente de datos parece corresponder a otras referencias y no queda trazada.
  • El importador del repositorio procesa las primeras 10.000 filas de un IPIP120.dat ausente, sin documentar el muestreo de 600 ni su seed.
  • La ruta de scoring humana liberada parece omitir la inversión de ítems que sí aplica la ruta LLM; sin human.db no se puede verificar la comparabilidad.
  • Ajustar cúbicas a puntos individuales puede producir curvas sensibles a composición y extremos; no se reportan bondad de ajuste o validación.
  • Comparar solo las medias marginales de cinco rasgos por edad no valida la distribución conjunta, subfacetas, conducta o coherencia individual.
  • Sliced Wasserstein usa 100 proyecciones Gaussianas sin seed y MMD usa un V-statistic sin test de permutación ni intervalo.
  • Las ocho métricas se presentan sin incertidumbre ni corrección y dos de ellas son matemáticamente duplicadas en la implementación.
  • La secuencia exploratoria fue adaptada tras ver resultados; no hay preregistro, hipótesis confirmatoria independiente ni conjunto de validación.
  • No hay participantes o jueces humanos que evalúen si cada persona es realista, fiel o reconocible.
  • Los SQLite de experimentos no están en GitHub; el enlace externo requiere captcha y bloquea una auditoría independiente de datos crudos.
  • No existe una suite automatizada de tests; varios archivos llamados test son scripts manuales que requieren API.
  • El repositorio actual y el tag usan configuraciones distintas y no hay snapshots por experimento; la configuración actual incluso selecciona un prompt que omite la persona.
  • El archivo notebook exportado de learn contiene sintaxis de shell y evita compilar el árbol completo, aunque los módulos centrales sí compilan.
  • Las explicaciones sobre alignment, pretraining, world models o probabilidades bayesianas son especulativas y carecen de ablaciones.
  • Inferir rasgos a partir de raza, sexo, ocupación o estado civil puede consolidar estereotipos y producir daño si se usa para decisiones reales.
  • No se describe revisión ética, consentimiento o gobernanza de la referencia humana más allá de citar fuentes previas.
  • La portada de Research Square y el manuscrito discrepan en el orden de autoría, lo que requiere cautela bibliográfica.

Qué no demuestra

  • No demuestra una ley de escalado matemática o generalizable.
  • No demuestra que más detalle sea suficiente ni necesario para una simulación humana fiel.
  • No demuestra que DeepSeek posea personalidad, un self o estados psicológicos internos.
  • No demuestra que respuestas IPIP repetibles sean verdaderas, humanas o psicométricamente válidas.
  • No demuestra persistencia de identidad durante conversaciones o a lo largo del tiempo.
  • No demuestra que los personajes generados correspondan fielmente a personas reales o literarias concretas.
  • No demuestra que la mejora proceda causalmente del detalle en vez del prompt, población, longitud o fuga del objetivo.
  • No demuestra que alignment cause el sesgo positivo observado ni que instrucciones anti-alignment lo eliminen.
  • No demuestra equivalencia entre las puntuaciones humanas y LLM ni que compartan estructura de medida.
  • No demuestra que curvas marginales similares impliquen distribuciones, conductas o decisiones similares.
  • No valida sustitución de participantes humanos por personas sintéticas en ciencias sociales.
  • No demuestra que CFA, invariancia o validez de constructo sean irrelevantes; el estudio no ofrece una validación alternativa equivalente.
  • No generaliza a otros modelos, proveedores, idiomas, culturas, cuestionarios o poblaciones.
  • No permite reproducir independientemente las cifras con los artefactos accesibles en GitHub.
  • No establece seguridad, ausencia de sesgo ni idoneidad para vigilancia, marketing, política o decisiones sobre personas.

Trazabilidad

Alcance: Texto completo

Versión: arXiv v1, 21 pages, submitted 10 October 2025; cross-checked in full against Research Square v1, 31-page covered manuscript posted 10 October 2025, DOI 10.21203/rs.3.rs-7777787/v1

Fuente consultada: https://arxiv.org/pdf/2510.11734

Revisión: Codex editorial review and methods/artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • DeepSeek-chat version 3.0 before the 3.1 upgrade, accessed through an OpenAI-compatible API alias

Instrumentos y métricas

  • IPIP-NEO-120, administered in six 20-item blocks
  • Big Five/OCEAN trait scoring
  • Mahalanobis-distance KDE, coefficient of variation and Fisher kurtosis
  • PCA, K-means and Adjusted Rand Index
  • Cubic personality-by-age curves and six-point Euclidean distance
  • Wasserstein, Sliced Wasserstein, Fréchet, Euclidean, cosine, MMD and marginal-distance metrics

Datos utilizados

  • 1994 UCI Adult Income Dataset for demographic skeletons
  • Five randomly selected generated personas and author-created poor variants
  • Four reported 600-person conditions: standard, anti-alignment, narrative and wiki-fiction
  • Human IPIP-NEO reference expected by the repository as IPIP120.dat
  • Wikidata-derived literary-character profiles expanded through prompts
  • SQLite experiment databases distributed through a Baidu link but absent from GitHub

Evidencia y localización

  • Estado de preprint, DOI, fecha y discrepancia de autoría: Research Square v1 cover and manuscript p. 1, posted 10 Oct 2025, DOI 10.21203/rs.3.rs-7777787/v1
  • Pregunta, pipeline y posicionamiento metodológico: Research Square v1 abstract and sections 1–3, manuscript pp. 1–9
  • Modelo, datos censales y setup: Research Square v1 sections 4.1–4.4, manuscript pp. 9–10
  • CV, curtosis y conteos tras outliers: Research Square v1 section 5.2.1, Figure 2 and Table 1, manuscript pp. 10–12
  • ARI por pares y conjunto: Research Square v1 section 5.2.2, Tables 2–3 and Figures 3–4, manuscript pp. 12–15
  • Cuatro experimentos de población y n=600: Research Square v1 sections 3 and 5.3, manuscript pp. 9 and 16–19
  • Distancias de curvas por condición y rasgo: Research Square v1 Figures 6–9 and Table 4, manuscript pp. 16–19
  • Afirmación de scaling law y exploración post hoc: Research Square v1 sections 6–7, manuscript pp. 20–21
  • Riesgos, datos, código y conclusiones: Research Square v1 Ethical Risks, Conclusion, Data availability and Code availability, manuscript pp. 21–22
  • Métricas distribucionales completas: Research Square v1 Appendix 4, Table 2 and Figure 9, manuscript pp. 29–30
  • Código, configuraciones y ausencia de bases: Official GitHub repository baiyuqi/agentic-society-neo, tag v1.0.0 commit d7ceecc6957fdccfc8e876ef9d4fcd791151d129 and current commit 25b92f69cefebee9aba859c3f3e1e7da2b7b2e1d, audited 15 Jul 2026
  • Alias de modelo y temperatura no fijada: Official repository asociety/generator/llm_engine.py and paper section 4.2, audited 15 Jul 2026
  • Parsing, completitud y scoring LLM: Official repository quiz service, quiz extractor and IPIP scoring modules, audited 15 Jul 2026
  • Posible diferencia de reverse scoring humano/LLM: Official repository tools/importers/import_human_data.py and IPIP-NEO-120 scoring path, audited 15 Jul 2026; human.db absent
  • Mahalanobis, K-means y ARI: Official repository single_density_panel.py and clustering analysis scripts, audited 15 Jul 2026
  • Cúbicas y métricas distribucionales: Official repository personality-curve and ocean_density_panel.py analysis scripts, audited 15 Jul 2026
  • Disponibilidad real de los datos: Paper Baidu data link checked 15 Jul 2026: extraction page reachable but download verification blocked by captcha; raw SQLite databases absent from GitHub
  • Integridad visual del texto completo: arXiv v1 PDF SHA-256 50036c94617485db1cf0c3eb49cfc10cbe4eaaed80727809269c6096cba320df and Research Square v1 PDF SHA-256 57216787d8f05a4186876125cde7839349d1fbf7244f0a7adc4998bc89ccbec4; all relevant pages, figures, tables and appendices rendered and inspected 15 Jul 2026