Decoding Emergent Big Five Traits in Large Language Models: Temperature-Dependent Expression and Architectural Clustering

Evaluación y validez psicométrica2025ACL AnthologyRevisión editorial aprobada

Autores: Christos-Nikolaos Zacharopoulos, Revekka Kyriakoglou

Palabras clave: Large Language Models, Personality, Psychometrics, Model Evaluation, LLM Evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
13
Hallazgos
19
Limitaciones
10
Evidencias

Resumen editorial

Español

La versión de referencia es el artículo publicado en Findings of IJCNLP-AACL 2025. Administra los 60 ítems BFI-2, uno por prompt y con respuesta numérica de 1 a 5, a seis sistemas etiquetados como Llama 3 8B, Mistral 7B, MythoMax L2 13B, Gemma 9B, Qwen 7B y StripedHyena 7B. El paper reporta 21 temperaturas entre 0 y 2, una respuesta por ítem, modelo y temperatura: 7.560 celdas sin repeticiones. Escribe por error increments of 1; el código y los CSV confirman pasos de 0,1. Publica diferencias Kruskal–Wallis en Extraversion, Agreeableness, Conscientiousness y Openness, pero no Neuroticism, y correlaciones de temperatura negativas con Neuroticism y positivas con Extraversion. El clustering sitúa Gemma–Mistral juntos, Llama–StripedHyena en otra rama y Qwen en el extremo opuesto. Sin embargo, la auditoría del OSF invalida una lectura confirmatoria. El supuesto Qwen 7B es realmente `Qwen/Qwen1.5-72B-Chat`, tanto en el código como en las 1.260 filas del CSV; por tanto, la muestra no contiene seis modelos comparables de 7B–13B. La clave ejecutable de ítems invertidos del BFI-2 omite 3, 4, 8, 9, 37, 42, 47, 48 y 58 e invierte indebidamente el 46. El propio encabezado de otro script imprime la clave correcta, pero los cálculos importan la errónea. Esto contamina cuatro dominios, todas sus medias, pruebas, regresiones, figuras y clusters; solo Openness queda correctamente invertido. Además, el código y los seis CSV publicados no reproducen las tablas. Con la clave liberada se obtienen H=47,0473/85,1752/79,0852/13,7920/72,8568, no 40,7803/65,3067/63,0415/9,2691/58,1957. Las correlaciones liberadas son r=-0,4821 para Neuroticism y 0,5194 para Extraversion, no -0,5904 y 0,5021. Al corregir la clave, Neuroticism pasa a H=44,8853, p=1,53e-8, contradiciendo el principal resultado nulo del paper. La asociación agregada con Extraversion baja a r=0,4438; si se excluye el Qwen 72B mal rotulado, queda r=0,3757, p=0,0933 y deja de ser significativa. Hay además 265 respuestas NaN de 7.560: 200 en StripedHyena y 51 en Qwen. StripedHyena pierde hasta 36 de 60 ítems en una temperatura. Pandas calcula medias ignorando esos NaN, con denominadores variables y sin regla de missingness documentada. La regresión tampoco es multiple linear regression por modelo: el código promedia primero los seis sistemas en cada temperatura y ajusta una recta a solo 21 medias ecológicas. Kruskal–Wallis trata las 21 condiciones ordenadas del mismo cuestionario como muestras independientes de cada modelo. Una sola generación por celda no permite estimar aleatoriedad, test-retest o estabilidad; variar temperatura no sustituye repetir una condición. El paper no reporta top-k=60, top-p=0,8, repetition penalty=1,1, max tokens=20 ni que errores y formatos inválidos se convierten a NaN. Tampoco ofrece estructura factorial, fiabilidad, invariancia, comparación post-hoc o intervalos. Un dendrograma de seis perfiles confundidos por tamaño, datos, tuning, tokenizer, vocabulario y atención no identifica predisposición arquitectónica. La evidencia final es un conjunto abierto de respuestas numéricas exploratorias cuyo artefacto permite descubrir errores graves; no demuestra rasgos emergentes o estables, causalidad de temperatura, efectos de arquitectura ni una base para gobernanza.

English

The reference version is the paper published in Findings of IJCNLP-AACL 2025. It administers the 60 BFI-2 items one prompt at a time, requesting a numerical 1–5 answer, to systems labeled Llama 3 8B, Mistral 7B, MythoMax L2 13B, Gemma 9B, Qwen 7B, and StripedHyena 7B. The paper reports 21 temperatures from 0 to 2 and one answer per item, model, and temperature: 7,560 cells with no replications. It incorrectly says increments of 1; code and CSVs confirm 0.1 steps. It reports Kruskal–Wallis differences for Extraversion, Agreeableness, Conscientiousness, and Openness but not Neuroticism, plus a negative temperature correlation with Neuroticism and a positive one with Extraversion. Its cluster places Gemma–Mistral together, Llama–StripedHyena in another branch, and Qwen at the opposite edge. The OSF audit, however, prevents a confirmatory interpretation. The supposed Qwen 7B is actually `Qwen/Qwen1.5-72B-Chat` in both code and all 1,260 CSV rows, so the sample is not six comparable 7B–13B models. The executable BFI-2 reverse-key list omits items 3, 4, 8, 9, 37, 42, 47, 48, and 58 and wrongly reverses item 46. Another script header prints the correct key, but calculations import the wrong one. Four domains and every associated mean, test, regression, figure, and cluster are affected; only Openness has the complete correct key. Released code and six CSVs also fail to reproduce the tables. The released key yields H=47.0473/85.1752/79.0852/13.7920/72.8568 rather than 40.7803/65.3067/63.0415/9.2691/58.1957. Released temperature correlations are r=-.4821 for Neuroticism and .5194 for Extraversion rather than -.5904 and .5021. Correct scoring makes Neuroticism H=44.8853, p=1.53e-8, contradicting the paper's central null. The aggregate Extraversion association falls to r=.4438; excluding the mislabeled 72B Qwen makes it r=.3757, p=.0933 and non-significant. There are also 265 NaN responses among 7,560 cells: 200 for StripedHyena and 51 for Qwen. StripedHyena loses as many as 36 of 60 items at one temperature. Pandas silently averages nonmissing items, producing unequal denominators without a documented missingness rule. The regression is not multiple linear regression by model: code first averages all six systems at each temperature and fits one line to only 21 ecological means. Kruskal–Wallis treats the 21 ordered conditions from the same questionnaire as independent samples for each model. One generation per cell cannot estimate sampling noise, test–retest reliability, or stability; changing temperature is not replication. The paper omits top-k=60, top-p=.8, repetition penalty=1.1, max tokens=20, and conversion of errors or invalid formats to NaN. It provides no factor structure, reliability, invariance, post-hoc comparison, or confidence intervals. A dendrogram of six profiles confounded by size, data, tuning, tokenizer, vocabulary, and attention cannot identify architectural predisposition. The final evidence is an open exploratory numeric-response dataset whose artifact exposes serious errors; it does not establish emergent or stable traits, temperature causality, architecture effects, or a governance basis.

Pregunta de investigación

¿Difieren seis sistemas etiquetados como LLM de 7B–13B en respuestas BFI-2, cambia su promedio agregado con la temperatura y forman perfiles descriptivamente agrupables?

Método

Se generan 60 respuestas BFI-2 por sistema en 21 temperaturas de 0,0 a 2,0, una vez por celda, mediante Together con top-k=60, top-p=0,8, repetition penalty=1,1 y max tokens=20. El artefacto calcula dominios con una clave invertida errónea, aplica Kruskal–Wallis a 21 condiciones por etiqueta, promedia los seis modelos por temperatura para una regresión de 21 puntos y agrupa seis perfiles medios con Ward/distancia euclídea.

Muestra: Seis etiquetas, 60 ítems y 21 temperaturas 0,0–2,0 en pasos reales de 0,1: 7.560 celdas y una sola generación por combinación. Hay 7.295 respuestas válidas y 265 NaN: Gemma 6, MythoMax 8, Qwen 72B mal rotulado 51 y StripedHyena 200. No hay participantes humanos, anotadores, semillas repetidas o test-retest.

Hallazgos

  • La fuente vigente es Findings of IJCNLP-AACL 2025, Anthology ID 2025.findings-ijcnlp.104, DOI 10.18653/v1/2025.findings-ijcnlp.104, páginas 1678-1685.
  • Las 8 páginas publicadas se renderizaron e inspeccionaron visualmente; SHA-256 d1662c1ed14904e8e06421c601746911fd46790e2fc4ba52c6ae10ad78f060a1.
  • Extraversion, Agreeableness, Conscientiousness y Openness difieren globalmente entre modelos según Kruskal–Wallis (H = 40,7803; 65,3067; 63,0415; 58,1957; p < 0,01); Neuroticism no (H = 9,2691).
  • Temperatura se asocia negativamente con Neuroticism (R² = 0,3486, r = −0,5904, p < 0,05) y positivamente con Extraversion (R² = 0,2521, r = 0,5021, p < 0,05).
  • Agreeableness (R² = 0,0343), Conscientiousness (0,0257) y Openness (0,0003) no muestran asociación significativa con temperatura en el análisis agrupado.
  • El clustering une primero Gemma–Mistral, añade MythoMax, separa Qwen y forma otro par Llama–StripedHyena; es una estructura descriptiva de solo seis observaciones de modelo.
  • El código y los CSV confirman pasos de temperatura 0,1 y resuelven el error increments of 1 del método publicado.
  • El sistema llamado Qwen 7B es Qwen/Qwen1.5-72B-Chat en el código y las 1.260 filas del CSV.
  • La clave ejecutada omite nueve ítems BFI-2 invertidos e invierte indebidamente el 46.
  • El artefacto no reproduce ninguna H de Table 1 ni las correlaciones/R² centrales de Table 2.
  • Con scoring correcto, Neuroticism da H=44,8853, p=1,53e-8, no el resultado nulo publicado.
  • Con scoring correcto y sin el Qwen 72B mal rotulado, Extraversion-temperatura queda r=0,3757, p=0,0933.
  • La regresión publicada en código usa 21 medias entre modelos, no pendientes separadas o un modelo multinivel.

Limitaciones

  • El paper escribe incrementos de 1; solo el artefacto permite saber que fueron pasos de 0,1.
  • Qwen 7B es en realidad Qwen1.5-72B-Chat, invalidando la descripción de tamaños comparables.
  • La clave BFI-2 ejecutada tiene nueve omisiones y una inversión extra.
  • Las tablas publicadas no se reproducen con el código y los CSV enlazados.
  • Los resultados cambian materialmente al corregir scoring y excluir la etiqueta Qwen errónea.
  • Hay 265 NaN con fuerte concentración en StripedHyena y Qwen.
  • Las medias ignoran NaN y usan denominadores variables sin análisis de missingness.
  • El código actual tiene comentadas las entradas Llama y no regenera los seis CSV de principio a fin.
  • Together, torch y snapshots de servicio no quedan fijados en un entorno reproducible.
  • El paper omite top-k, top-p, repetition penalty, max tokens y tratamiento de errores como NaN.
  • Una sola respuesta por ítem y temperatura no permite estimar test-retest ni separar error de muestreo de un cambio sistemático, especialmente a temperaturas altas.
  • La regresión promedia los seis modelos por temperatura y ajusta solo 21 puntos; no estima interceptos, pendientes o interacciones por modelo.
  • Kruskal–Wallis trata 21 condiciones ordenadas del mismo cuestionario como observaciones independientes por etiqueta.
  • Cinco pruebas Kruskal–Wallis carecen de corrección múltiple, post-hoc y tamaños de efecto; un p global no identifica qué pares difieren ni su relevancia práctica.
  • El pairwise code no publicado llama rank-biserial a U/(n1×n2), que no es esa transformación, y no devuelve p ajustados Bonferroni.
  • El BFI-2 está validado para personas, no para tokens; no se prueba fiabilidad, estructura factorial, convergencia o invariancia.
  • Arquitectura, datos, ajuste, tamaño, vocabulario y tokenizer están confundidos. Un dendrograma de seis modelos no puede atribuir causalmente perfiles a mecanismos de atención.
  • El clustering no tiene bootstrap, sensibilidad a escala/distancia, incertidumbre o validación externa.
  • El estudio se limita a un prompt, inglés y respuestas numéricas; no cubre diálogo, conducta u otros idiomas.

Qué no demuestra

  • No demuestra que los modelos posean rasgos, emociones, creatividad, personalidad interna o una línea base psicológica humana.
  • No demuestra que temperatura cause Extraversion o Neuroticism; identifica asociaciones de puntuación en un diseño exploratorio y agregado.
  • No establece estabilidad de personalidad, porque no hay repeticiones independientes ni test-retest.
  • No permite atribuir los clusters a arquitectura o datos de entrenamiento ni separar naturaleza de aprendizaje.
  • No valida BFI-2 para comparar LLM ni hace equivalentes sus medias a puntuaciones humanas.
  • No demuestra el resultado nulo de Neuroticism con scoring correcto.
  • No demuestra una asociación robusta temperatura-Extraversion sin el Qwen 72B mal rotulado.
  • No reproduce las tablas publicadas desde el artefacto oficial.
  • No prueba que estos perfiles mejoren selección, ajuste, seguridad o gobernanza en aplicaciones reales.

Trazabilidad

Alcance: Texto completo

Versión: Findings of IJCNLP-AACL 2025, Anthology ID 2025.findings-ijcnlp.104, DOI 10.18653/v1/2025.findings-ijcnlp.104, pages 1678-1685, 8 pages; supersedes arXiv:2511.04499v1

Fuente consultada: https://aclanthology.org/2025.findings-ijcnlp.104/

Revisión: Codex complete bilingual full-text fidelity pass using the published Findings version, all-page visual inspection, OSF archive inventory by HTTP range, source-code audit, six-CSV missingness audit, exact reproduction of released analysis, corrected BFI-2 rescoring, mislabeled-model sensitivity analysis, statistical-design review, and metadata reconciliation; summaries written from the paper and executable evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • meta-llama/Meta-Llama-3-8B-Instruct-Lite in released CSV; collection entry commented out in current code
  • mistralai/Mistral-7B-Instruct-v0.3
  • Gryphe/MythoMax-L2-13b-Lite
  • google/gemma-2-9b-it
  • Qwen/Qwen1.5-72B-Chat, incorrectly labeled Qwen 7B in paper, code display name, path, and figures
  • togethercomputer/StripedHyena-Nous-7B

Instrumentos y métricas

  • Big Five Inventory-2, 60 items, with materially incorrect executable reverse-scoring key
  • One-item-at-a-time numeric 1-5 prompt
  • Kruskal–Wallis H tests across 21 temperature scores per model label
  • Pearson correlation and simple regression on 21 model-averaged temperature means
  • Ward agglomerative hierarchical clustering with Euclidean distance over six five-domain profiles
  • Independent artifact reanalysis with released and corrected BFI-2 scoring keys

Datos utilizados

  • OSF bsvzc Data and Code for LLM Personality: six analyzed CSVs, 7,560 cells, 265 NaN responses
  • OSF source code, BFI-2 questionnaire, figures, environment file, additional unused model CSVs, and bundled model archive
  • Published Findings of IJCNLP-AACL 2025 tables that do not reproduce from the released code and six analyzed CSVs

Evidencia y localización

  • Versión publicada, DOI, páginas y abstract: ACL Anthology record and Findings of IJCNLP-AACL 2025 page 1678 checked 15 July 2026
  • Diseño, etiquetas de modelos, error de incremento y análisis declarados: Published pages 1678-1679, Introduction and Methods
  • Resultados publicados de Kruskal-Wallis, regresión y clustering: Published pages 1679-1681, Tables 1-2 and Figures 1-2
  • Cautelas asociativas y no causales reconocidas: Published pages 1680-1682, Discussion and Limitations
  • Prompt exacto: Published page 1684, Appendix A
  • Medias descriptivas por etiqueta: Published page 1685, Appendix Figure 3
  • Temperaturas 0,1, claves BFI-2, parámetros Together, agregación y clustering: OSF bsvzc src/config.py, src/llm_prompting.py and src/big_five_analysis.py inspected 15 July 2026
  • Qwen 72B mal rotulado, 7.560 celdas y 265 NaN: Six OSF result CSVs inspected and recomputed 15 July 2026
  • Resultados no reproducibles y reanálisis con clave correcta: reports/verification/article-190-scoring-and-artifact-reproduction-audit.json
  • Inspección visual completa: All 8 published PDF pages rendered and visually inspected on 15 July 2026