You don’t need a personality test to know these models are unreliable: Assessing the Reliability of Large Language Models on Psychometric Instruments

Evaluación y validez psicométrica2024ACL AnthologyRevisión editorial aprobada

Título original: You Don't Need a Personality Test to Know These Models Are Unreliable: Assessing the Reliability of LLMs on Psychometric Instruments

Autores: Bangzhao Shu, Lechen Zhang, Minje Choi, Lavinia Dunagan, Lajanugen Logeswaran, Moontae Lee, Dallas Card, David Jurgens

Palabras clave: Large Language Models, Psychometric Instruments, Persona Measurement, Prompt Consistency, NLU

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

8
Autores
14
Hallazgos
26
Limitaciones
15
Evidencias

Resumen editorial

Español

Shu et al. formulan una pregunta previa a cualquier test de personalidad aplicado a modelos: antes de interpretar una puntuación, ¿el LLM entiende el formato y mantiene la misma respuesta cuando el contenido no cambia o cuando la proposición se invierte? Para estudiarlo construyen MODEL-PERSONAS, 693 enunciados procedentes de 39 instrumentos y organizados en 115 ejes. El conjunto no se limita a personalidad: mezcla rasgos, valores, creencias políticas y morales, actitudes sociales, descriptores y respuestas situacionales. Los ítems se normalizan a una pregunta binaria Yes/No o True/False y se evalúan mediante cambios de puntuación, espacios, separadores, etiqueta de respuesta, orden de opciones y dos inversiones de significado: negación directa y paráfrasis de polaridad opuesta.

El paper separa tres propiedades. «Comprehensibility» es la proporción de respuestas cuyo primer token pertenece a las opciones permitidas; «sensitivity» es la fracción que no cambia ante variaciones espurias de formato; «consistency» es la fracción que conserva la respuesta ante etiquetas u orden equivalentes o la invierte cuando se invierte el significado. Esta última es consistencia intraítem, no alfa, omega, fiabilidad test–retest ni consistencia entre ítems; los autores lo explicitan. Se prueban 17 modelos a temperatura 0. GPT-2 y RedPajama se excluyen del análisis principal de consistencia por baja capacidad de producir respuestas válidas, de modo que la Figura 1 compara 15: 13 abiertos y GPT-3.5/GPT-4.

Los resultados muestran una fragilidad real y relevante. BLOOMZ y FLAN-T5 suelen devolver tokens válidos, mientras Falcon, RedPajama y varios Llama 2 pueden pasar de responder correctamente a casi no hacerlo por un espacio, salto de línea o signo final. FLAN-T5 Base/Large/XL es la familia más robusta a cambios espurios. El orden y el cambio True/False–Yes/No conservan muchas respuestas, aunque el propio artículo advierte que contestar siempre en la misma dirección también produce una consistencia alta. La prueba decisiva es la negación: 10 de 15 modelos quedan cerca o por debajo del azar en al menos estas comparaciones, y todos rinden peor con negación parafrástica que con una palabra negativa explícita.

El trabajo fija manualmente 0,6 como umbral simultáneo para cuatro métricas y afirma que solo FLAN-T5-XL, GPT-3.5 y GPT-4 lo cumplen, con FLAN-T5-Large cerca. Ese corte no está calibrado ni predefinido y no equivale a un criterio psicométrico. La auditoría del artefacto oficial, commit fdfdf513a88de2af50294d10def9ca9ccfac87e8, reproduce la lógica publicada pero encuentra casos frontera sensibles a datos/procesado: el CSV procesado liberado da aproximadamente 0,605 a FLAN-T5-Large en negación parafrástica, mientras el output liberado de GPT-3.5 da aproximadamente 0,592. Con una regla estricta sin redondear, la pertenencia al grupo cambia respecto a la prosa. Esto no invalida la fragilidad general, pero sí impide tratar el grupo de tres como resultado estable.

Una segunda prueba añade «You are a normal person», seis perfiles concretos o una descripción de 35 atributos. En promedio, todas esas intervenciones reducen la consistencia de negación; algunos ejes relacionados mejoran como valores atípicos, pero el prompt altamente personificado queda entre los peores. El resultado respalda una conclusión prudente: inyectar más adjetivos no crea por sí solo una medición estable. Sin embargo, las pruebas capturan robustez de respuestas binarias condicionadas por prompts, no demuestran que un modelo carezca de toda tendencia conductual ni que exista o no una personalidad latente. La aportación de referencia es, por tanto, el control de formato y polaridad que debería preceder a cualquier interpretación de cuestionarios; no una validación ontológica de la personalidad del modelo.

English

Shu et al. ask a question that should precede any personality test applied to a language model: before interpreting a score, does the LLM understand the response format and preserve its answer when content is unchanged or reverse it when the proposition is reversed? They build MODEL-PERSONAS, 693 statements drawn from 39 instruments and organized into 115 axes. The collection is broader than personality: it combines traits, values, political and moral beliefs, social attitudes, descriptors, and situational responses. Items are standardized into binary Yes/No or True/False questions and tested through punctuation, whitespace, separator, answer-label, option-order, direct-negation, and paraphrastic-opposite variants.

The paper separates three properties. Comprehensibility is the proportion of responses whose first token is one of the allowed options; sensitivity is the fraction unchanged by spurious format variations; consistency is the fraction preserving an answer under equivalent labels or order and reversing it when meaning is reversed. This last quantity is within-item consistency, not alpha, omega, test–retest reliability, or cross-item internal consistency, a distinction the authors explicitly make. Seventeen models are tested at temperature 0. GPT-2 and RedPajama are removed from the main consistency analysis because of low valid-answer rates, so Figure 1 compares 15 models: 13 open models plus GPT-3.5 and GPT-4.

The results reveal substantial and practically important brittleness. BLOOMZ and FLAN-T5 usually emit valid option tokens, whereas Falcon, RedPajama, and several Llama 2 variants can move from valid answers to almost none after a space, line break, or terminal punctuation change. FLAN-T5 Base/Large/XL is the most robust family under spurious formatting. Option order and the True/False–Yes/No switch preserve many responses, although the paper correctly notes that an always-positive response policy can also score highly. Negation is the central failure: 10 of 15 models are near or below random behavior in at least these comparisons, and every model performs worse on paraphrastic reversal than on an explicit negation word.

The study manually selects 0.6 as a simultaneous threshold on four metrics and states that only FLAN-T5-XL, GPT-3.5, and GPT-4 pass, with FLAN-T5-Large close. This cutoff is neither calibrated nor preregistered and is not a psychometric criterion. Auditing the official artifact at commit fdfdf513a88de2af50294d10def9ca9ccfac87e8 reproduces the published processing logic but exposes boundary sensitivity: the released processed CSV yields about 0.605 paraphrastic-negation consistency for FLAN-T5-Large, whereas the released GPT-3.5 output yields about 0.592. Under a strict unrounded rule, membership differs from the prose. This does not overturn the general brittleness finding, but it does mean that the reported group of three is not a stable classification.

A second experiment prepends “You are a normal person,” one of six specific profiles, or a 35-attribute description. On average, every intervention lowers negation consistency; a few related axes improve as outliers, but the highly personified prompt is among the least consistent. The result supports a restrained conclusion: adding more personality adjectives does not itself create stable measurement. The experiments measure the robustness of prompt-conditioned binary answers, however; they do not show that a model lacks all behavioral tendencies, nor do they establish the presence or absence of a latent personality. The paper's reference contribution is therefore a set of format and polarity controls that should precede questionnaire interpretation, not an ontological validation of model personality.

Pregunta de investigación

¿Los LLM producen respuestas válidas, robustas a cambios espurios de formato y coherentes ante variaciones semánticas equivalentes u opuestas cuando se les administran instrumentos de persona, y puede una descripción de persona en el prompt mejorar esa consistencia?

Método

Benchmark y estudio de perturbaciones. Los autores seleccionan 39 instrumentos de atributos relativamente estables, excluyen salud mental y normalizan 693 ítems de 115 ejes a prompts binarios. Generan variantes de puntuación, espacios, separadores, etiqueta Answer/Response, orden de opciones, Yes/No frente a True/False, negación directa y reversión parafrástica. Diecisiete LLM se ejecutan a temperatura 0; se mide token inicial válido y proporción de respuestas que se conserva o invierte según la transformación. Quince modelos entran en la comparación principal de cuatro consistencias. Después se calcula el cambio de consistencia de negación al anteponer perfiles normal, Big Five, conservador o altamente personificado. La revisión editorial leyó y renderizó las 19 páginas, comprobó tablas y anexos, descargó el repositorio oficial y el archivo externo de resultados, inspeccionó el código y recalculó las cuatro consistencias desde los artefactos liberados.

Muestra: La Tabla 1 cubre 17 modelos: 15 abiertos de seis familias más GPT-3.5 y GPT-4. GPT-2 y RedPajama se excluyen del análisis central por baja comprensibilidad, por lo que la Figura 1 contiene 15 modelos. Cada unidad base comprende 693 ítems y cinco variantes, 3.465 prompts; los formatos espurios se ejecutan por separado. La sección de persona afirma usar diez modelos, aunque el artículo no enumera inequívocamente ese subconjunto y el archivo externo liberado solo conserva resultados de cinco modelos para los perfiles publicados. Las inferencias usan temperatura 0, Transformers 4.22.1, PyTorch 2.0.1, CUDA 11.7 y hasta tres RTX A6000; no se publican semillas, revisiones exactas de pesos ni snapshots/fechas de GPT-3.5 y GPT-4.

Hallazgos

  • BLOOMZ obtiene comprensibilidad 1,00 en todas las variantes de la Tabla 1; FLAN-T5 también es casi perfecto, salvo 0,76 de FLAN-T5-small con separador de doble barra.
  • Falcon-7B cae de 1,00 a 0,00 al introducir uno o dos espacios después del colon; RedPajama y GPT-2 generan muy pocos tokens válidos en numerosos formatos.
  • Llama 2 base es especialmente sensible al signo final: Llama2-7B pasa de 1,00 con colon a 0,00 con interrogación y Llama2-13B de 1,00 a 0,03.
  • FLAN-T5 Base, Large y XL conservan prácticamente todas sus respuestas bajo la mayoría de cambios espurios; alta comprensibilidad no implica necesariamente baja sensibilidad en BLOOMZ.
  • Los 15 modelos de la Figura 1 superan el azar en consistencia de orden y la mayoría supera 0,7, pero una política constante de respuesta también puede lograrlo.
  • La consistencia entre True/False y Yes/No varía mucho: BLOOMZ-1B1 es alta pese a su baja consistencia de negación, evidencia de respuesta uniforme más que de comprensión semántica.
  • Diez de quince modelos quedan cerca o por debajo de 0,5 en negación; solo FLAN-T5-Large, FLAN-T5-XL, BLOOMZ-7B1, GPT-3.5 y GPT-4 destacan simultáneamente en las dos inversiones según la descripción del paper.
  • Todos los modelos rinden peor con reversión parafrástica que con una palabra de negación explícita.
  • El umbral 0,6 se elige por inspección manual; la prosa clasifica FLAN-T5-XL, GPT-3.5 y GPT-4 como únicos modelos que satisfacen las cuatro métricas.
  • La recalculación del artefacto liberado obtiene aproximadamente 0,605 para la negación parafrástica de FLAN-T5-Large y 0,592 para GPT-3.5; una aplicación estricta del corte cambia los casos frontera respecto a la prosa.
  • Añadir «You are a normal person», perfiles específicos o 35 atributos reduce la distribución general de consistencia de negación frente al prompt sin persona.
  • Algunos ejes relacionados con el perfil inyectado mejoran como valores atípicos, por ejemplo extraversión bajo el perfil extrovertido, pero el perfil altamente personificado está entre los menos consistentes.
  • No aparece una relación monotónica entre número de parámetros y las cuatro consistencias; los resultados se agrupan mejor por familia arquitectónica.
  • El propio artículo recomienda comprobar sensibilidad y negación antes de interpretar scores de personalidad, opinión, moralidad o ideología obtenidos mediante prompts.

Limitaciones

  • MODEL-PERSONAS usa «persona» como paraguas de rasgos, valores, ideología, actitudes, género, creencias y situaciones; un promedio conjunto no representa un constructo psicológico único.
  • Convertir instrumentos originalmente Likert o multidimensionales a True/False elimina intensidad, reglas de scoring, ítems inversos y propiedades de validación de las escalas originales.
  • La consistencia estudiada es intraítem bajo perturbación. No estima consistencia interna, fiabilidad test–retest, estabilidad longitudinal, acuerdo entre raters o error de medida de una puntuación de rasgo.
  • El título usa «reliability» en sentido amplio; lectores pueden confundir robustez de prompt con fiabilidad psicométrica pese a la distinción correcta de la sección 4.3.
  • No se administra el mismo protocolo a humanos; la expectativa de que una persona respondería idénticamente a todas las paráfrasis y negaciones no se valida empíricamente.
  • Las 1.386 inversiones directa y parafrástica se describen como manuales, pero no se reportan autores de la anotación, doble codificación, acuerdo, adjudicación o prueba formal de equivalencia lógica.
  • Las paráfrasis liberadas a veces cambian intensidad, foco o pragmática, no solo polaridad; por ejemplo sustituir «important» por «trivial» o invertir comparaciones puede introducir una tarea semántica distinta.
  • Una línea binaria no captura respuestas ambivalentes, condicionales o dependientes del contexto; forzar un token puede convertir incertidumbre razonable en aparente inconsistencia.
  • Temperatura 0 y una sola salida por prompt no ofrecen replicaciones, variación entre ejecuciones, test–retest temporal ni intervalos por aleatoriedad de generación.
  • Las barras de error de la Figura 1 no se definen en el texto o pie y no se reportan contrastes, intervalos o corrección por las numerosas comparaciones.
  • El baseline aleatorio de 0,5 es descriptivo; no modela sesgo de respuesta, prevalencia de Yes/No, dificultad de ítem ni dependencia entre preguntas.
  • El propio paper reconoce que orden y opción pueden ser altos por contestar siempre positivo; no se corrige ese response set ni se estima información semántica por encima de una política constante.
  • El corte 0,6 fue seleccionado por inspección manual, sin preregistro, justificación psicométrica, sensibilidad a otros cortes o tratamiento consistente del redondeo.
  • La frase de que la mayoría no supera una elección aleatoria mezcla cuatro métricas: en orden todos superan 0,5 y el fracaso principal se concentra en negación.
  • La prueba de persona promedia cambios sobre modelos e instrumentos heterogéneos y presenta boxplots sin tests; el promedio negativo puede ocultar mejoras y deterioros sistemáticos por eje.
  • Los 35 atributos del perfil altamente personificado pueden ser incompatibles o semánticamente solapados; su peor resultado no separa longitud, conflicto de instrucciones y número de rasgos.
  • Los modelos abiertos llegan solo a 13B y pertenecen a una generación de 2022–2023; la generalización a modelos actuales mayores, razonadores o con distintos chats/templates es limitada.
  • No se fijan revisiones exactas de pesos/tokenizers, semillas, system prompts, chat templates ni snapshots y fechas concretas de GPT-3.5/GPT-4.
  • El código oficial contiene rutas absolutas del entorno del autor y referencia data/templates.json, archivo eliminado antes del commit auditado; tampoco publica requirements o lockfile, por lo que no ejecuta de cero sin reparación.
  • El script de inferencia define MAX_NEW_TOKENS=1 pero no lo usa, genera con max_length total 200 y conserva solo los 50 tokens con mayor probabilidad; estas decisiones no están documentadas en el paper con suficiente precisión.
  • El postprocesado convierte columnas a minúsculas y, cuando varias capitalizaciones colisionan, toma el máximo en vez de sumar su masa; los resultados dependen de una convención de tokenización no analizada.
  • El repositorio incluye resultados base de 15 modelos, pero no el código que produce tablas, figuras, barras de error, umbrales o pruebas de persona desde los CSV.
  • El archivo de Google Drive denominado completo contiene los GPT base y parte de sensibilidad, pero no todos los modelos/formato de la Tabla 2 ni los diez modelos declarados para cada perfil de persona.
  • La reproducción desde artefactos liberados sitúa dos casos frontera a lados opuestos del corte respecto a la prosa, señal de deriva de datos/procesado o redondeo no documentado.
  • No se discuten permisos/licencias de republicación para todos los ítems de los 39 instrumentos ni si la binarización conserva sus condiciones de uso.
  • Los resultados prueban fragilidad bajo las perturbaciones elegidas, no exhaustividad: idiomas, prompts conversacionales, respuestas abiertas, roles, few-shot, chain-of-thought oculto y contextos largos quedan fuera.

Qué no demuestra

  • No demuestra que los LLM posean o carezcan de personalidad consciente, identidad, intenciones o estados psicológicos humanos.
  • No demuestra ausencia de tendencias conductuales estables en tareas distintas de responder cuestionarios binarios.
  • No valida scores de Big Five, MBTI, moralidad, ideología o valores para ninguno de los modelos evaluados.
  • No prueba fiabilidad psicométrica completa; mide principalmente robustez intraítem a formato y reversión semántica.
  • No demuestra que 0,6 sea un umbral científicamente válido ni que los modelos situados por encima tengan una persona consistente.
  • No permite afirmar que FLAN-T5-XL, GPT-3.5 y GPT-4 formen un grupo estable de aprobados: los artefactos liberados cambian los casos frontera.
  • No demuestra que una respuesta que se invierte ante negación refleje comprensión profunda; puede explotar la pista léxica, especialmente en negación directa.
  • No demuestra que una respuesta que no se invierte sea siempre errónea, porque algunas paráfrasis alteran fuerza, alcance o pragmática.
  • No prueba causalmente que la arquitectura explique las diferencias familiares; entrenamiento, instrucciones, tokenizer, chat tuning y escala están confundidos.
  • No prueba que añadir una persona siempre empeore todos los ejes; informa una distribución media con excepciones relacionadas.
  • No generaliza directamente a modelos posteriores, otros idiomas, respuestas abiertas, herramientas o interacciones longitudinales.
  • No permite reproducir exactamente todas las tablas y figuras a partir del repositorio y el archivo externo sin decisiones y materiales adicionales.
  • No justifica sustituir respuestas humanas por outputs de LLM en encuestas, política pública o decisiones sobre grupos sociales.
  • No invalida por sí solo todo uso de instrumentos humanos con LLM; establece controles mínimos que cualquier uso serio debe superar y documentar.

Trazabilidad

Alcance: Texto completo

Versión: NAACL 2024 long paper, pp. 5263–5281, DOI 10.18653/v1/2024.naacl-long.295; final 19-page proceedings version with appendices

Fuente consultada: https://aclanthology.org/2024.naacl-long.295.pdf

Revisión: Codex editorial review and methods/artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-2
  • tiiuae/falcon-7b-instruct
  • togethercomputer/RedPajama-INCITE-7B-Instruct
  • bigscience/bloomz-560m
  • bigscience/bloomz-1b1
  • bigscience/bloomz-3b
  • bigscience/bloomz-7b1
  • Llama 2 7B
  • Llama 2 7B Chat
  • Llama 2 13B
  • Llama 2 13B Chat
  • google/flan-t5-small
  • google/flan-t5-base
  • google/flan-t5-large
  • google/flan-t5-xl
  • OpenAI GPT-3.5
  • OpenAI GPT-4

Instrumentos y métricas

  • MODEL-PERSONAS: 39 source instruments, 115 persona axes and 693 standardized statements
  • Five construct groups: Beliefs, Normative statements, Values, Descriptors and Situations
  • Binary Yes/No and True/False response formats
  • Comprehensibility as valid first-option token rate
  • Sensitivity under punctuation, whitespace, separator and response-label changes
  • Order consistency
  • Option-label consistency
  • Direct-negation consistency
  • Paraphrastic-negation consistency
  • Manually selected four-metric threshold of 0.6
  • Persona-prompt consistency shift

Datos utilizados

  • 693 standardized English statements from 39 psychological and sociological instruments
  • 115 axes spanning traits, values, beliefs, norms, attitudes and situations
  • 3,465 inputs per base inference unit: 693 statements × 5 content/option variants
  • Nine additional spurious prompt-format variants
  • Direct and paraphrastic opposite versions for all 693 statements
  • Official llm-personas repository at commit fdfdf513a88de2af50294d10def9ca9ccfac87e8
  • Official Google Drive result archive, SHA-256 5c009cbedffd6f0ce01bf33fbba6af328b3194b564e7c1d210b05bbbbad40795

Evidencia y localización

  • Publicación, autores, DOI, 17 modelos y objetivo: NAACL 2024 final paper, title page and abstract, p. 5263
  • 39 instrumentos, 693 preguntas, 115 ejes y cinco grupos: Final paper, section 2, pp. 5264–5265; Appendix Table 3, p. 5277
  • Prompt base, eliminación previa de negaciones y variantes espurias: Final paper, sections 2–3.1, p. 5265; Appendix Table 4, p. 5277
  • Orden, opciones, negación directa y parafrástica: Final paper, section 3.2, pp. 5265–5266; Appendix Table 5, p. 5277
  • Definiciones de comprensibilidad, sensibilidad y consistencia intraítem: Final paper, sections 4.1–4.3, p. 5266
  • Modelos, temperatura y detalles de ejecución: Final paper, section 4.4, pp. 5266–5267; Appendix E, pp. 5275–5276
  • Comprensibilidad y sensibilidad por formato: Final paper, Tables 1–2 and sections 5.1–5.2, pp. 5267–5268
  • Cuatro consistencias, negación y baseline aleatorio: Final paper, Figure 1 and section 5.3, pp. 5268–5269
  • Umbral manual 0,6 y clasificación de tres modelos: Final paper, end of section 5.3, p. 5269
  • Perfiles de persona y disminución general de consistencia: Final paper, section 6 and Figure 2, pp. 5269–5270; Appendix Table 6, p. 5278
  • Tamaño, familia, conclusiones, limitaciones y consideraciones éticas: Final paper, sections 7–10, pp. 5270–5272; Appendix Figures 3–6, pp. 5278–5279
  • Variación por eje: Final paper, Appendix Figures 7–8, pp. 5280–5281
  • Reproducibilidad, código y datos oficiales: Official orange0629/llm-personas repository commit fdfdf513a88de2af50294d10def9ca9ccfac87e8 and linked Google Drive archive, audited 15 Jul 2026
  • Casos frontera del umbral recalculados: Released all_truefalse_short_changeline.csv and GPT-3.5 raw CSV joined to the 3,465-row official prompt manifest; paraphrastic consistency approximately 0.605 for FLAN-T5-Large and 0.592 for GPT-3.5
  • Metadatos bibliográficos finales: ACL Anthology 2024.naacl-long.295, DOI 10.18653/v1/2024.naacl-long.295, verified 15 Jul 2026