Bai y coautores preguntan si añadir detalle y aparente realismo a una persona textual hace que DeepSeek-chat produzca perfiles Big Five más repetibles, distinguibles y parecidos a curvas humanas por edad. El trabajo, que sigue siendo un preprint, propone un pipeline de SQLite: muestrea esqueletos demográficos del Adult Income Dataset de 1994, los amplía con el propio LLM, administra los 120 ítems IPIP-NEO en seis bloques y calcula OCEAN. Solo se usa un servicio llamado DeepSeek-chat versión 3.0 anterior a 3.1; la API se invoca mediante un alias mutable y el código liberado no fija el snapshot ni la temperatura que el texto sitúa en 0,7.
A escala individual, se eligen cinco personas y se comparan versiones muy recortadas con sus perfiles completos mediante 300 cuestionarios repetidos por condición. Tras descartar outliers por IQR quedan entre 275 y 298 respuestas. El coeficiente de variación de las distancias de Mahalanobis baja en los cinco casos: 0,2806→0,2384; 0,2818→0,2168; 0,3380→0,2451; 0,2787→0,2523; y 0,2811→0,2369. La separación por K-means también aumenta: el ARI conjunto pasa de 0,7349 a 0,9835 y el par 4–5 de 0,0795 a 0,9151. Sin embargo, tres pares ya estaban entre 0,9531 y 1 con perfiles pobres. Las distancias se calculan respecto de la media de la propia muestra, no de un prototipo ideal externo; K-means recibe de antemano el número correcto de personas y se evalúa sobre los mismos datos. Esto apoya que más texto puede restringir y diferenciar respuestas en este protocolo, pero no prueba una personalidad interna ni una identidad estable a lo largo de una interacción.
A escala de población se comparan cuatro condiciones declaradas de 600 casos: perfiles censales ampliados; los mismos perfiles con una instrucción anti-idealización durante el test; personas narrativas de al menos 2.000 palabras; y personajes literarios obtenidos a partir de Wikidata. Se ajusta un polinomio cúbico para cada rasgo en función de la edad y se miden seis puntos, de 20 a 70 años, frente a curvas humanas. La distancia conjunta desciende de 70,25 a 63,45, 51,21 y 23,75. Los apéndices muestran la misma ordenación con varias métricas distribucionales. Es un patrón descriptivo interesante, no una ley de escalado: no existe una variable cuantitativa de detalle, un exponente, niveles repetidos, validación fuera de muestra ni predicción extrapolable. Además, cada escalón cambia simultáneamente la fuente de población, el prompt, el contenido y el modo de construcción. El último grupo no es una versión más detallada de la misma población censal, sino una población distinta de personajes ficticios, y el propio LLM completa sus descripciones.
La auditoría del artefacto reduce aún más la fuerza de la conclusión. El repositorio publica código, prompts, census.csv y algunos resultados de CFA, pero los SQLite con las respuestas y resultados están en un enlace Baidu bloqueado por captcha y no pueden recomputarse desde GitHub. No hay manifiestos que unan cada figura con un commit, configuración y modelo. La importación humana liberada marca todos los ítems como no invertidos, mientras el scoring de respuestas LLM aplica la clave inversa de 55 ítems; sin el human.db no puede comprobarse si la referencia publicada quedó afectada, pero el pipeline disponible no demuestra equivalencia de scoring. La comparación de curvas usa polinomios cúbicos sin validación ni incertidumbre; el Sliced Wasserstein usa proyecciones aleatorias sin seed; y Average Marginal Wasserstein duplica exactamente el cálculo llamado Wasserstein Mean.
La aportación defendible es un banco de trabajo exploratorio para estudiar cómo el contexto de persona constriñe autoinformes sintéticos. Los resultados sugieren que perfiles ricos inducen mayor autoconsistencia y que ciertas poblaciones generadas se acercan más a cinco medias marginales humanas por edad bajo este setup. No demuestran una ley general, fidelidad psicológica, validez psicométrica, causalidad del detalle, ni que las personas sintéticas permitan sustituir participantes humanos. De hecho, el diseño puede confundir realismo con obediencia al prompt, circularidad entre el modelo que escribe la persona y el que responde, y reproducción de estereotipos demográficos. Las afirmaciones de que el LLM «posee» personalidad, que CFA y validez de constructo son irrelevantes o que más detalle es todo lo necesario exceden la evidencia presentada.