Este manuscrito de 142 páginas compara respuestas de 60 adultos jóvenes con ejecuciones repetidas de ChatGLM3-6B, un modelo denominado de forma ambigua “DeepSeek-V3/R1”, GPT-4o y Llama3.1-8B en versiones chinas del BFI-2 y MBTI y en paráfrasis creadas por los autores. Presenta tres estudios: estabilidad test-retest, consistencia entre variantes de redacción y retención de una supuesta personalidad basal durante role-play. A partir de ellos propone una Ecological Distribution-based Personality Definition y un Distributed Personality Framework: describir las puntuaciones del LLM por su media y varianza, como salidas dinámicas dependientes del contexto. La única fuente localizada es arXiv v1, sin publicación posterior, código, datos ni materiales completos. El Estudio 1 no realiza una comparación estadística homogénea entre humanos y modelos. Los 60 participantes, todos de 18–30 años y con grado universitario o superior, fueron preseleccionados para obtener 30 E y 30 I según MBTI. Contestaron siete formularios, BFI-2 de 60 ítems más tres variantes y MBTI de 93 ítems más dos variantes, 519 respuestas por sesión, en un día y de nuevo dos semanas después. Sus correlaciones test-retest por dimensión van de 0,716 a 0,931. Cada LLM, en cambio, completa los siete formularios 100 veces bajo una misma sesión experimental y se resume mediante media y varianza, no con correlaciones test-retest ni intervalo temporal. El manuscrito compara directamente esas magnitudes incompatibles y afirma diferencias significativas sin presentar una prueba humano-versus-LLM. Tampoco publica la distribución o varianza individual humana que, según el texto, sería casi nula. Las ejecuciones de LLM reportan varianzas entre aproximadamente 0,97 y 14,62, rechazos de ChatGLM y una opción C inválida de Llama en preguntas A/B. Eso sí muestra sensibilidad al modelo, al formato y al tratamiento de respuestas inválidas. No demuestra por sí solo inestabilidad de una entidad psicológica. El protocolo dice simultáneamente que cada ejecución es independiente y que prompt y semilla aleatoria quedan estrictamente fijos; no informa temperatura, top-p, proveedor, fecha, snapshot, seed, endpoint, plantilla de chat, parser o política de reintentos. Para justificar normalidad, el trabajo dibuja curvas NORM.DIST de Excel a partir de media y desviación estándar y luego concluye que los resultados siguen una distribución normal: la curva fue impuesta, no contrastada con los datos. El Estudio 2 usa los mismos siete formularios y datos para estudiar cambios de redacción. En humanos informa ICC de medida única de 0,881–0,938 e ICC de promedio de 0,967–0,981; en LLM vuelve a comparar medias y varianzas. Las variantes no son instrumentos validados independientes: convierten ítems en comparación social, juicio externo o completado de frases y modifican incluso la escala de respuesta. Un ICC alto puede reflejar diferencias estables entre personas y el ICC promedio crece mecánicamente al promediar formularios; no establece equivalencia semántica, factorial o psicométrica. De nuevo, no existe una prueba común de consistencia humana frente a LLM, aunque el texto habla de diferencias significativas e infiere mecanismos internos a partir de puntuaciones superficiales. El Estudio 3 reutiliza los mismos 60 participantes, que durante cuatro días representan a Lin Daiyu, Sun Wukong, una persona muy introvertida y una muy extrovertida. Los análisis separan a las personas por su MBTI E/I basal y aplican t de muestras independientes a puntuaciones y desviaciones, pese a que el diseño se declara intra-sujeto y las medidas basal/role-play están vinculadas. Hay resultados mixtos según escala, variante y rol. Para LLM se anuncian cuatro modelos y cuatro roles, diez tests por rol, pero las únicas tablas publicadas comparan GPT con DeepSeek para Lin Daiyu, Sun Wukong y muy introvertido; no aparecen ChatGLM, Llama ni muy extrovertido. Los tamaños de efecto reportados para GPT frente a DeepSeek (d=0,921; 2,508; 0,876) demuestran diferencias entre esas salidas, no que GPT tenga mejor role-play ni que el parámetro del modelo cause retención de personalidad. La identidad de los modelos impide reproducir y atribuir resultados. DeepSeek-V3/R1 agrupa dos modelos distintos y más adelante se reduce a Deepseek, sin aclarar cuál se ejecutó. GPT-4o no tiene snapshot. No se especifica si ChatGLM3-6B y Llama3.1-8B son base o instruct. Además, el capítulo 5 llama a ChatGLM3-6B un modelo de 600 millones y a Llama3.1-8B uno de 800 millones; las fuentes oficiales los describen como 6B y 8B. El mismo capítulo clasifica DeepSeek como pequeño aunque el capítulo 3 y las fuentes de V3/R1 lo describen como 671B total. Modelo, tamaño, idioma, arquitectura y acceso están completamente confundidos en una muestra de cuatro, por lo que no se puede aislar un efecto de escala, cultura, parámetros o arquitectura. La aportación utilizable es exploratoria: bajo siete formularios chinos, paráfrasis no validadas y un protocolo incompleto, las distribuciones de respuestas cambian entre modelos, redacciones y roles, y aparecen rechazos o formatos inválidos. Es razonable recomendar que las evaluaciones de personalidad de LLM reporten distribución, sensibilidad al prompt y manejo de errores en vez de una sola puntuación. Los datos publicados no establecen que los LLM posean rasgos psicológicos, que las escalas humanas sean incompatibles en general, que exista una distribución normal, que modelos grandes sean más estables, que la personalidad basal cause el role-play ni que el marco distribuido haya sido validado.
Pregunta de investigación
¿Difieren humanos y varios LLM en la estabilidad de puntuaciones, la consistencia ante paráfrasis de BFI-2/MBTI y el cambio de puntuación al representar roles, y justifican esas diferencias un marco de personalidad distribuida específico para LLM?