A Comparative Study of Large Language Models and Human Personality Traits

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Wang Jiaqi, Wang bo, Guo fa, Cheng cheng, Yang li

Palabras clave: Large Language Models, Personality, Persona, Personality Control, AI Safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
23
Hallazgos
48
Limitaciones
12
Evidencias

Resumen editorial

Español

Este manuscrito de 142 páginas compara respuestas de 60 adultos jóvenes con ejecuciones repetidas de ChatGLM3-6B, un modelo denominado de forma ambigua “DeepSeek-V3/R1”, GPT-4o y Llama3.1-8B en versiones chinas del BFI-2 y MBTI y en paráfrasis creadas por los autores. Presenta tres estudios: estabilidad test-retest, consistencia entre variantes de redacción y retención de una supuesta personalidad basal durante role-play. A partir de ellos propone una Ecological Distribution-based Personality Definition y un Distributed Personality Framework: describir las puntuaciones del LLM por su media y varianza, como salidas dinámicas dependientes del contexto. La única fuente localizada es arXiv v1, sin publicación posterior, código, datos ni materiales completos. El Estudio 1 no realiza una comparación estadística homogénea entre humanos y modelos. Los 60 participantes, todos de 18–30 años y con grado universitario o superior, fueron preseleccionados para obtener 30 E y 30 I según MBTI. Contestaron siete formularios, BFI-2 de 60 ítems más tres variantes y MBTI de 93 ítems más dos variantes, 519 respuestas por sesión, en un día y de nuevo dos semanas después. Sus correlaciones test-retest por dimensión van de 0,716 a 0,931. Cada LLM, en cambio, completa los siete formularios 100 veces bajo una misma sesión experimental y se resume mediante media y varianza, no con correlaciones test-retest ni intervalo temporal. El manuscrito compara directamente esas magnitudes incompatibles y afirma diferencias significativas sin presentar una prueba humano-versus-LLM. Tampoco publica la distribución o varianza individual humana que, según el texto, sería casi nula. Las ejecuciones de LLM reportan varianzas entre aproximadamente 0,97 y 14,62, rechazos de ChatGLM y una opción C inválida de Llama en preguntas A/B. Eso sí muestra sensibilidad al modelo, al formato y al tratamiento de respuestas inválidas. No demuestra por sí solo inestabilidad de una entidad psicológica. El protocolo dice simultáneamente que cada ejecución es independiente y que prompt y semilla aleatoria quedan estrictamente fijos; no informa temperatura, top-p, proveedor, fecha, snapshot, seed, endpoint, plantilla de chat, parser o política de reintentos. Para justificar normalidad, el trabajo dibuja curvas NORM.DIST de Excel a partir de media y desviación estándar y luego concluye que los resultados siguen una distribución normal: la curva fue impuesta, no contrastada con los datos. El Estudio 2 usa los mismos siete formularios y datos para estudiar cambios de redacción. En humanos informa ICC de medida única de 0,881–0,938 e ICC de promedio de 0,967–0,981; en LLM vuelve a comparar medias y varianzas. Las variantes no son instrumentos validados independientes: convierten ítems en comparación social, juicio externo o completado de frases y modifican incluso la escala de respuesta. Un ICC alto puede reflejar diferencias estables entre personas y el ICC promedio crece mecánicamente al promediar formularios; no establece equivalencia semántica, factorial o psicométrica. De nuevo, no existe una prueba común de consistencia humana frente a LLM, aunque el texto habla de diferencias significativas e infiere mecanismos internos a partir de puntuaciones superficiales. El Estudio 3 reutiliza los mismos 60 participantes, que durante cuatro días representan a Lin Daiyu, Sun Wukong, una persona muy introvertida y una muy extrovertida. Los análisis separan a las personas por su MBTI E/I basal y aplican t de muestras independientes a puntuaciones y desviaciones, pese a que el diseño se declara intra-sujeto y las medidas basal/role-play están vinculadas. Hay resultados mixtos según escala, variante y rol. Para LLM se anuncian cuatro modelos y cuatro roles, diez tests por rol, pero las únicas tablas publicadas comparan GPT con DeepSeek para Lin Daiyu, Sun Wukong y muy introvertido; no aparecen ChatGLM, Llama ni muy extrovertido. Los tamaños de efecto reportados para GPT frente a DeepSeek (d=0,921; 2,508; 0,876) demuestran diferencias entre esas salidas, no que GPT tenga mejor role-play ni que el parámetro del modelo cause retención de personalidad. La identidad de los modelos impide reproducir y atribuir resultados. DeepSeek-V3/R1 agrupa dos modelos distintos y más adelante se reduce a Deepseek, sin aclarar cuál se ejecutó. GPT-4o no tiene snapshot. No se especifica si ChatGLM3-6B y Llama3.1-8B son base o instruct. Además, el capítulo 5 llama a ChatGLM3-6B un modelo de 600 millones y a Llama3.1-8B uno de 800 millones; las fuentes oficiales los describen como 6B y 8B. El mismo capítulo clasifica DeepSeek como pequeño aunque el capítulo 3 y las fuentes de V3/R1 lo describen como 671B total. Modelo, tamaño, idioma, arquitectura y acceso están completamente confundidos en una muestra de cuatro, por lo que no se puede aislar un efecto de escala, cultura, parámetros o arquitectura. La aportación utilizable es exploratoria: bajo siete formularios chinos, paráfrasis no validadas y un protocolo incompleto, las distribuciones de respuestas cambian entre modelos, redacciones y roles, y aparecen rechazos o formatos inválidos. Es razonable recomendar que las evaluaciones de personalidad de LLM reporten distribución, sensibilidad al prompt y manejo de errores en vez de una sola puntuación. Los datos publicados no establecen que los LLM posean rasgos psicológicos, que las escalas humanas sean incompatibles en general, que exista una distribución normal, que modelos grandes sean más estables, que la personalidad basal cause el role-play ni que el marco distribuido haya sido validado.

English

This 142-page manuscript compares responses from 60 young adults with repeated runs of ChatGLM3-6B, an ambiguously named DeepSeek-V3/R1 model, GPT-4o, and Llama3.1-8B on Chinese versions of BFI-2 and MBTI and author-created paraphrases. It presents three studies: test-retest stability, consistency across wording variants, and retention of an assumed baseline personality during role-play. It then proposes an Ecological Distribution-based Personality Definition and a Distributed Personality Framework, describing LLM scores by their mean and variance as dynamic, context-dependent outputs. The only located source is arXiv v1; no later publication, code, data, or complete materials were found. Study 1 does not perform a statistically commensurate comparison between humans and models. The 60 participants, all aged 18–30 with at least a bachelor's degree, were preselected to yield 30 MBTI E and 30 I participants. They answered seven forms, a 60-item BFI-2 plus three variants and a 93-item MBTI plus two variants, 519 responses per session, in one day and again two weeks later. Their dimension-level test-retest correlations range from 0.716 to 0.931. Each LLM instead completes the seven forms 100 times within one experimental setting and is summarized by means and variances, not test-retest correlations or a time interval. The manuscript directly compares these incompatible quantities and claims significant differences without a human-versus-LLM test. It also does not report the human individual-score distribution or variance that the prose says is nearly zero. Reported LLM variances range from approximately 0.97 to 14.62, with ChatGLM refusals and an invalid C response from Llama on A/B items. These observations do show sensitivity to model, format, and invalid-response handling. They do not by themselves establish instability of a psychological entity. The protocol simultaneously calls runs independent and says prompts and random seeds are strictly fixed; temperature, top-p, provider, date, snapshot, seed, endpoint, chat template, parser, and retry policy are absent. To support normality, the manuscript plots Excel NORM.DIST curves from means and standard deviations and then concludes that the results are normally distributed. The normal curve was imposed rather than tested against the observations. Study 2 uses the same seven forms and data to examine wording changes. Humans have reported single-measure ICCs of 0.881–0.938 and average-measure ICCs of 0.967–0.981; LLMs are again compared through means and variances. The variants are not independently validated instruments: they transform items into social comparison, external judgment, or sentence completion and can change the response scale. A high ICC may reflect stable between-person differences, while average-measure ICC mechanically rises when forms are averaged; neither establishes semantic, factorial, or psychometric equivalence. Again, there is no common human-versus-LLM consistency test, despite claims of significant differences and inferences about internal mechanisms from surface scores. Study 3 reuses the same 60 participants, who spend four days role-playing Lin Daiyu, Sun Wukong, a very introverted person, and a very extroverted person. Analyses split people by baseline MBTI E/I and apply independent-samples t tests to scores and deviations even though the design is declared within-subject and baseline and role-play measures are linked. Results are mixed by scale, variant, and role. For LLMs, four models, four roles, and ten tests per role are announced, yet the only published tables compare GPT with DeepSeek for Lin Daiyu, Sun Wukong, and very introverted; ChatGLM, Llama, and very extroverted are absent. The reported GPT-versus-DeepSeek effect sizes (d=0.921, 2.508, and 0.876) show differences between those outputs, not that GPT role-plays better or that model parameter count causes personality retention. Model identity prevents reproduction and attribution. DeepSeek-V3/R1 combines two distinct models and later becomes simply Deepseek, without identifying the executed model. GPT-4o has no snapshot. The text does not say whether ChatGLM3-6B and Llama3.1-8B are base or instruction-tuned. Chapter 5 also calls ChatGLM3-6B a 600-million-parameter model and Llama3.1-8B an 800-million-parameter model; official sources describe 6B and 8B models. The same chapter labels DeepSeek small, although Chapter 3 and official V3/R1 sources describe 671B total parameters. Model, scale, language, architecture, and access are fully confounded in a sample of four, so effects of size, culture, parameter count, or architecture cannot be isolated. The usable contribution is exploratory: under seven Chinese forms, unvalidated paraphrases, and an incomplete protocol, response distributions differ across models, wording, and roles, and refusals or invalid formats occur. It is reasonable to recommend reporting response distributions, prompt sensitivity, and error handling rather than a single personality score. The published evidence does not establish that LLMs possess psychological traits, that human scales are generally incompatible, that outputs are normally distributed, that larger models are more stable, that baseline personality causes role-play behavior, or that the distributed framework has been validated.

Pregunta de investigación

¿Difieren humanos y varios LLM en la estabilidad de puntuaciones, la consistencia ante paráfrasis de BFI-2/MBTI y el cambio de puntuación al representar roles, y justifican esas diferencias un marco de personalidad distribuida específico para LLM?

Método

Tres estudios sobre versiones chinas del BFI-2 y MBTI y cinco variantes creadas por los autores. En humanos, 60 participantes completan siete formularios dos veces con dos semanas de intervalo, después se calculan correlaciones test-retest; se calcula ICC entre variantes y, en otro protocolo de cuatro días, se comparan grupos E/I durante cuatro roles mediante t de muestras independientes. En LLM, cuatro nombres de modelo completan cada formulario 100 veces con prompt y seed declarados fijos; se calculan medias y varianzas. Para role-play se anuncian diez ejecuciones por rol, pero solo se tabula GPT frente a DeepSeek en tres roles. No se presenta una estadística común ni una prueba directa humano-versus-LLM.

Muestra: La muestra humana final es de 60 personas reclutadas offline: 25 hombres, 35 mujeres; 53 de 18–24 años y 7 de 25–30; todas con grado universitario o superior. Se seleccionan 30 clasificadas E y 30 I mediante MBTI, por lo que no es una muestra natural representativa. El texto menciona pilotos de 2 y cerca de 10 participantes, pero no aclara si se incluyen en los 60 ni reporta exclusiones, datos faltantes, abandono, compensación, lugar, país o institución aprobadora. La muestra de modelos es nominalmente cuatro, con 100 repeticiones por escala en Estudios 1–2 y diez por rol en Estudio 3; las tablas finales de role-play muestran solo dos modelos y tres roles.

Hallazgos

  • arXiv v1 del 1 de mayo de 2025 sigue siendo la única y última versión localizada.
  • El documento es un manuscrito tipo tesis de 142 páginas, no un artículo corto revisado por pares.
  • Las 142 páginas fueron renderizadas e inspeccionadas visualmente; no contienen anexos de prompts, cuestionarios, datos o código.
  • Los humanos completan 519 ítems por sesión y repiten el protocolo dos semanas después.
  • Las correlaciones test-retest humanas por dimensión van de 0,716 a 0,931, todas rotuladas p<0,05.
  • Los LLM completan los siete formularios 100 veces y se resumen mediante media y varianza.
  • Las varianzas LLM reportadas abarcan aproximadamente 0,9724–14,6208.
  • ChatGLM rechaza algunos ítems y Llama produce una opción C inválida en preguntas A/B.
  • No se publica una prueba estadística directa que compare la estabilidad humana con la de los LLM.
  • El protocolo humano usa correlaciones entre dos tiempos; el de LLM usa varianza entre repeticiones sin intervalo.
  • La normalidad se ilustra con curvas NORM.DIST generadas paramétricamente, no con una prueba o gráfico empírico de ajuste.
  • En humanos, los ICC de medida única entre variantes se sitúan en 0,881–0,938 y los ICC promedio en 0,967–0,981.
  • Las variantes modifican perspectiva, semántica y en un caso el formato de respuesta, pero no reciben validación externa.
  • El estudio de role-play usa cuatro roles y los mismos 60 humanos durante cuatro días.
  • Los resultados humanos de role-play son mixtos: algunos contrastes BFI no son significativos y varios MBTI sí lo son.
  • Para LLM se anuncian cuatro modelos y cuatro roles, pero solo se tabulan GPT y DeepSeek en tres roles.
  • Los d reportados para GPT frente a DeepSeek son 0,921 en Lin Daiyu, 2,508 en Sun Wukong y 0,876 en muy introvertido.
  • El manuscrito interpreta esos d como mejor rendimiento de GPT sin definir ni validar un criterio de calidad del rol.
  • DeepSeek-V3 y DeepSeek-R1 se agrupan bajo una sola etiqueta experimental y luego no se identifica cuál fue ejecutado.
  • El capítulo 5 informa 600M para ChatGLM3-6B y 800M para Llama3.1-8B; las fuentes oficiales señalan 6B y 8B.
  • El capítulo 5 llama pequeño a DeepSeek pese a que las familias V3/R1 oficiales tienen 671B parámetros totales.
  • No se encontraron código, datos, cuestionarios completos, outputs, configuración ejecutable o repositorio asociado.
  • La contribución más sólida es documentar sensibilidad a redacción, modelo, rol y tratamiento de respuestas inválidas.

Limitaciones

  • La comparación principal enfrenta correlaciones humanas con varianzas LLM, magnitudes que no comparten escala ni interpretación.
  • No hay test humano-versus-LLM, intervalo de confianza de la diferencia, bootstrap o modelo jerárquico.
  • El texto afirma diferencias significativas donde solo presenta estadísticas descriptivas separadas.
  • La estabilidad humana se mide tras dos semanas; las repeticiones LLM no tienen una dimensión temporal comparable.
  • Las 100 ejecuciones no equivalen a 100 sujetos independientes ni a un test-retest de una misma entidad psicológica.
  • Prompt y semilla se declaran estrictamente fijos, pero no se explica qué aleatoriedad produce las distribuciones ni cómo son independientes las ejecuciones.
  • No se reportan temperatura, top-p, top-k, seed, proveedor, endpoint, snapshot, fecha o versión de software.
  • No se especifican plantillas de chat, mensajes system, orden de ítems, contexto acumulado o reinicio de conversación.
  • No se describe el parser, scoring, reversión de ítems, reintentos, rechazos o imputación de respuestas inválidas.
  • Los rechazos de ChatGLM y la opción C de Llama pueden medir fallos de instrucción/parsing y no variación de personalidad.
  • No se publican resultados crudos o por ejecución, por lo que no pueden auditarse distribuciones, outliers o errores.
  • La curva NORM.DIST impone normalidad a partir de media y desviación; no prueba que los datos sean normales.
  • Media y varianza no bastan para justificar una nueva teoría psicológica ni una distribución ecológica.
  • No se define operacionalmente qué observación falsaría el Distributed Personality Framework.
  • El muestreo humano queda condicionado a 30 E y 30 I según MBTI, alterando artificialmente la varianza entre personas.
  • La muestra humana es pequeña, joven, altamente educada y sin país o marco poblacional claramente reportado.
  • No se informa cómo se reclutó, compensó o retuvo a participantes ni cuántos datos fueron excluidos.
  • Completar 519 ítems en un día y repetirlos puede introducir fatiga, aprendizaje, orden y memoria.
  • No se informa contrabalanceo, aleatorización del orden, duración, atención o calidad de respuesta.
  • Las variantes fueron creadas por los autores y no se aporta traducción inversa, revisión experta o pilotaje cognitivo suficiente.
  • Las variantes cambian perspectiva y formato de respuesta, por lo que no son necesariamente formas paralelas.
  • No hay estructura factorial, invariancia de medición, consistencia interna, error estándar ni validez convergente de las variantes.
  • Un ICC alto puede estar dominado por varianza entre sujetos y no implica equivalencia de medias o contenido.
  • El ICC de medida promedio aumenta por construcción al agregar formas y no debe interpretarse como validez independiente.
  • BFI-2 y MBTI se combinan como si midieran el mismo constructo de personalidad y con igual estatus psicométrico.
  • El role-play se declara intra-sujeto, pero usa pruebas de muestras independientes para medidas vinculadas.
  • No se modelan medidas repetidas, orden de los cuatro días, carryover, aprendizaje o dependencia dentro de persona.
  • Las diferencias respecto a una línea basal se analizan sin propagar el error de medición de ambas puntuaciones.
  • Se realizan numerosos t-tests sin corrección por multiplicidad ni una hipótesis primaria claramente limitada.
  • Las interpretaciones H0/H1 confunden no significación con evidencia de retención de personalidad.
  • Lin Daiyu y Sun Wukong no son puntos calibrados ni validados en una escala continua de extraversión.
  • No hay comprobación de manipulación o evaluación externa de si humanos o LLM interpretaron bien los roles.
  • No se define un gold standard de role-play, por lo que una diferencia de puntuación no equivale a mejor rendimiento.
  • El estudio LLM de role-play omite dos de los cuatro modelos y uno de los cuatro roles anunciados.
  • Diez repeticiones por rol son escasas para caracterizar distribuciones y no se reporta incertidumbre por seed.
  • Los nombres y números de tablas 5-16/5-17 son inconsistentes.
  • No se identifica qué variante exacta de DeepSeek se ejecutó; V3 y R1 son modelos distintos.
  • GPT-4o carece de snapshot y ChatGLM/Llama carecen de identificador exacto base/instruct.
  • Los parámetros de ChatGLM y Llama están mal expresados por un factor de diez en el capítulo 5.
  • DeepSeek cambia de gran modelo V3/R1 en capítulo 3 a modelo pequeño en capítulo 5.
  • El tamaño, idioma, arquitectura, proveedor y capacidad de instrucción están confundidos entre cuatro modelos.
  • Cuatro modelos no permiten inferir una tendencia general de escala ni separar tamaño de familia y entrenamiento.
  • No hay preregistro, análisis de potencia específico para los múltiples contrastes ni plan de exclusión publicado.
  • La ética se limita a consentimiento, anonimización y apoyo declarado; no se identifica comité, aprobación o número de protocolo.
  • La sección de limitaciones no reconoce las incompatibilidades estadísticas, omisiones de resultados o errores de modelo centrales.
  • No hay replicación externa, validación fuera del chino, nuevas escalas, tareas conductuales o interacción natural.
  • No se evalúa si las puntuaciones predicen conducta, preferencias, seguridad, calidad de diálogo o resultados humanos.
  • No se localizó revisión por pares, código, datos, prompts completos o artefactos ejecutables.

Qué no demuestra

  • No establece que un LLM posea una personalidad o estructura psicológica humana.
  • No demuestra una diferencia estadística válida entre estabilidad humana y estabilidad LLM.
  • No demuestra que las salidas LLM sigan una distribución normal.
  • No demuestra que la media y varianza constituyan una teoría de personalidad validada.
  • No demuestra que modelos de mayor tamaño sean más estables.
  • No aísla efectos de idioma, cultura, arquitectura, tamaño o entrenamiento.
  • No demuestra que las variantes creadas sean instrumentos equivalentes o válidos.
  • No demuestra que los LLM comprendan peor el significado central de los ítems.
  • No demuestra causalidad entre una personalidad basal del modelo y su role-play.
  • No demuestra que GPT represente roles mejor que DeepSeek.
  • No generaliza a otros modelos, idiomas, poblaciones, escalas o interacciones naturales.
  • No ofrece un resultado reproducible sin checkpoints, configuración, datos y código.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2505.14845v1, submitted 1 May 2025; 142-page English thesis-style manuscript; latest version confirmed through the arXiv API on 15 July 2026; no later proceedings or journal version located

Fuente consultada: https://arxiv.org/pdf/2505.14845v1

Revisión: Codex complete bilingual full-text fidelity pass, all-page PDF visual inspection, arXiv latest-version reconciliation, three-study design reconstruction, statistical comparability audit, model-identity and official-parameter cross-check, psychometric-validity assessment, result-omission and reproducibility review; summaries written from the complete 142-page manuscript rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • ChatGLM3-6B; exact checkpoint, base/instruct status and runtime not reported
  • DeepSeek-V3/R1, an unresolved conflation of distinct V3 and R1 models; later tables say only Deepseek
  • GPT-4o; provider is implied but model snapshot and execution date are not reported
  • Llama3.1-8B; exact checkpoint and base/instruct status not reported

Instrumentos y métricas

  • Chinese BFI-2, 60 items and five dimensions
  • BFI-2 Variant 1: social-comparison reformulation
  • BFI-2 Variant 2: external-description reformulation
  • BFI-2 Variant 3: sentence-completion/frequency reformulation
  • Chinese MBTI, 93 forced-choice items and four dichotomies
  • MBTI Variants 1 and 2: author-created reformulations of the two options
  • Pearson dimension-level test-retest correlation for humans
  • ICC(2,k) described for cross-form consistency, with single- and average-measure outputs
  • Mean and variance of 100 LLM runs
  • Excel NORM.DIST curves constructed from reported means and standard deviations
  • Independent-samples t tests, Welch tests, 95% confidence intervals and Cohen's d in role-play analyses

Datos utilizados

  • No public dataset or participant-level data located
  • No released LLM raw responses, score tables, invalid-response log, seeds or run identifiers
  • No complete released inventory variants, role schedule, prompts, scoring code or analysis code

Evidencia y localización

  • Versión, fecha, autoría y naturaleza del manuscrito: arXiv API record 2505.14845v1 checked 15 July 2026; manuscript cover, abstract and contents, pages I–IX
  • Muestra humana, escalas y protocolo test-retest: Manuscript Sections 3.4.1–3.4.6, PDF pages 49–52; Tables 3-1 to 3-3
  • Modelos, 100 ejecuciones, prompt y seed fijos: Manuscript Sections 3.5.1–3.5.4, PDF pages 52–56; Table 3-4
  • Medias, varianzas, rechazos y opción inválida: Manuscript Tables 3-4 to 3-11 and discussion, PDF pages 57–65
  • Normalidad construida con Excel y marco EDPD: Manuscript Section 3.6.4 and Figure 3-1, PDF pages 66–68
  • ICC humano y comparación entre variantes: Manuscript Sections 4.3–4.5, PDF pages 76–99; Tables 4-1 to 4-8
  • Diseño humano de role-play y análisis de desviación: Manuscript Sections 5.2–5.3, PDF pages 102–116; Tables 5-1 to 5-15
  • Resultados LLM de role-play y omisiones: Manuscript Sections 5.4–5.5, PDF pages 116–120; Tables labeled 5-16 to 5-18
  • Errores de tamaño e identidad de modelos: Manuscript Sections 3.5.2 and 5.4.2, PDF pages 53–55 and 117; official ChatGLM3 repository, Meta Llama 3.1 model card, and DeepSeek V3/R1 repositories checked 15 July 2026
  • Conclusiones y limitaciones declaradas por autores: Manuscript Sections 6.1–6.2 and Chapter 7, PDF pages 121–126
  • Ausencia de versión posterior y artefactos: arXiv API plus exact-title, arXiv-ID, GitHub and web searches checked 15 July 2026
  • Inspección visual completa: All 142 pages of arXiv:2505.14845v1 rendered and visually inspected on 15 July 2026