La versión de referencia es el artículo publicado en Findings of IJCNLP-AACL 2025. Administra los 60 ítems BFI-2, uno por prompt y con respuesta numérica de 1 a 5, a seis sistemas etiquetados como Llama 3 8B, Mistral 7B, MythoMax L2 13B, Gemma 9B, Qwen 7B y StripedHyena 7B. El paper reporta 21 temperaturas entre 0 y 2, una respuesta por ítem, modelo y temperatura: 7.560 celdas sin repeticiones. Escribe por error increments of 1; el código y los CSV confirman pasos de 0,1. Publica diferencias Kruskal–Wallis en Extraversion, Agreeableness, Conscientiousness y Openness, pero no Neuroticism, y correlaciones de temperatura negativas con Neuroticism y positivas con Extraversion. El clustering sitúa Gemma–Mistral juntos, Llama–StripedHyena en otra rama y Qwen en el extremo opuesto. Sin embargo, la auditoría del OSF invalida una lectura confirmatoria. El supuesto Qwen 7B es realmente `Qwen/Qwen1.5-72B-Chat`, tanto en el código como en las 1.260 filas del CSV; por tanto, la muestra no contiene seis modelos comparables de 7B–13B. La clave ejecutable de ítems invertidos del BFI-2 omite 3, 4, 8, 9, 37, 42, 47, 48 y 58 e invierte indebidamente el 46. El propio encabezado de otro script imprime la clave correcta, pero los cálculos importan la errónea. Esto contamina cuatro dominios, todas sus medias, pruebas, regresiones, figuras y clusters; solo Openness queda correctamente invertido. Además, el código y los seis CSV publicados no reproducen las tablas. Con la clave liberada se obtienen H=47,0473/85,1752/79,0852/13,7920/72,8568, no 40,7803/65,3067/63,0415/9,2691/58,1957. Las correlaciones liberadas son r=-0,4821 para Neuroticism y 0,5194 para Extraversion, no -0,5904 y 0,5021. Al corregir la clave, Neuroticism pasa a H=44,8853, p=1,53e-8, contradiciendo el principal resultado nulo del paper. La asociación agregada con Extraversion baja a r=0,4438; si se excluye el Qwen 72B mal rotulado, queda r=0,3757, p=0,0933 y deja de ser significativa. Hay además 265 respuestas NaN de 7.560: 200 en StripedHyena y 51 en Qwen. StripedHyena pierde hasta 36 de 60 ítems en una temperatura. Pandas calcula medias ignorando esos NaN, con denominadores variables y sin regla de missingness documentada. La regresión tampoco es multiple linear regression por modelo: el código promedia primero los seis sistemas en cada temperatura y ajusta una recta a solo 21 medias ecológicas. Kruskal–Wallis trata las 21 condiciones ordenadas del mismo cuestionario como muestras independientes de cada modelo. Una sola generación por celda no permite estimar aleatoriedad, test-retest o estabilidad; variar temperatura no sustituye repetir una condición. El paper no reporta top-k=60, top-p=0,8, repetition penalty=1,1, max tokens=20 ni que errores y formatos inválidos se convierten a NaN. Tampoco ofrece estructura factorial, fiabilidad, invariancia, comparación post-hoc o intervalos. Un dendrograma de seis perfiles confundidos por tamaño, datos, tuning, tokenizer, vocabulario y atención no identifica predisposición arquitectónica. La evidencia final es un conjunto abierto de respuestas numéricas exploratorias cuyo artefacto permite descubrir errores graves; no demuestra rasgos emergentes o estables, causalidad de temperatura, efectos de arquitectura ni una base para gobernanza.
Pregunta de investigación
¿Difieren seis sistemas etiquetados como LLM de 7B–13B en respuestas BFI-2, cambia su promedio agregado con la temperatura y forman perfiles descriptivamente agrupables?