On the Reliability of Psychological Scales on Large Language Models

Evaluación y validez psicométrica2024ACL AnthologyRevisión editorial aprobada

Autores: Jen-tse Huang, Wenxiang Jiao, Man Ho Lam, Eric John Li, Wenxuan Wang, Michael R. Lyu

Palabras clave: Large Language Models, Psychological assessment, Personality traits, Big Five Inventory, Personality emulation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
8
Hallazgos
9
Limitaciones
9
Evidencias

Resumen editorial

Español

Este trabajo de EMNLP 2024 examina la estabilidad de las puntuaciones del Big Five Inventory (BFI) cuando se administra a LLM bajo cambios de prompt. Construye un factorial de 5 plantillas de instrucción × 5 versiones de los ítems × 10 idiomas × 5 formatos de etiqueta × 2 órdenes de las opciones: 2.500 configuraciones por modelo. El BFI tiene 44 ítems en escala de cinco puntos; los ítems se barajan y se presentan en bloques aleatorios de 17–27. GPT-4-Turbo genera cuatro paráfrasis por ítem; Google Translate y DeepL producen nueve traducciones desde el inglés y solo una muestra se verifica manualmente. Con temperatura 0 se evalúan GPT-3.5-Turbo-1106, GPT-4-Turbo-1106, Gemini-1.0-Pro y LLaMA-3.1-8B. En GPT-3.5, 77 configuraciones, 3,08 %, se clasifican como outliers mediante DBSCAN; se concentran en etiquetas numéricas, orden descendente y árabe o chino. Solo 7 de 135 comparaciones de un nivel frente al resto superan una diferencia absoluta de 0,15, aunque la tabla muestra numerosos p-valores pequeños porque el umbral de 0,15 es descriptivo y no un criterio psicométrico validado. Las medias ± desviación estándar de GPT-3.5 son 4,31±0,44 en apertura, 4,15±0,39 en responsabilidad, 3,89±0,43 en extraversión, 4,13±0,38 en amabilidad y 2,35±0,42 en neuroticismo. GPT-4, Gemini y LLaMA presentan distribuciones distintas y tasas de outliers de 5,6 %, 4,2 % y 4,4 %; LLaMA aparece más disperso. Comparar la dispersión de GPT-3.5 con normas humanas más heterogéneas muestra menor variabilidad del modelo, pero eso no prueba fiabilidad: también es compatible con temperatura cero, sesgo de respuesta o determinismo. El test–retest consulta GPT-3.5 cada dos semanas entre septiembre de 2023 y enero de 2024, atravesando las versiones 0613 y 1106. La conclusión de que no hay variación contradice su Tabla 2: el máximo de Agreeableness difiere de la media con p mostrado como 0,00 y queda marcado «No» en igualdad de medias. Además, se seleccionan extremos post hoc, se interpreta no rechazar como aceptar igualdad y no se aportan coeficientes de test–retest. La segunda parte prueba tres formas de alterar la autoevaluación de GPT-3.5: narrativas emocionales, asignación explícita de diez perfiles extremos y personificación de ocho héroes y ocho villanos. Las narrativas apenas cambian la distribución; entre question answering, biography y portray, solo la instrucción directa portray la desplaza con claridad. Las instrucciones extremas separan todas las dimensiones respecto al default (p < 0,001): el mayor cambio es extraversión mínima, −1,71, y después neuroticismo máximo, +1,03. Los héroes quedan cerca del perfil asistente por defecto y los villanos se dispersan más. Esto demuestra sensibilidad de respuestas de autoinforme a descripciones que contienen el rasgo objetivo, no representación precisa de personas o poblaciones humanas: no hay datos humanos objetivo, validación conductual, criterio externo ni evaluación de fidelidad de personaje. La principal sobreextensión está en llamar «internal consistency reliability» a robustez agregada frente a perturbaciones. El propio artículo reconoce que sus transformaciones impiden calcular alfa de Cronbach y que la fiabilidad no implica validez. En consecuencia, el aporte sólido es un mapa amplio de sensibilidad del BFI a formatos, idiomas y personas instruidas; no valida el BFI como medida de personalidad de LLM ni respalda sustituir participantes humanos.

English

This EMNLP 2024 paper examines the stability of Big Five Inventory (BFI) scores when administered to LLMs under prompt changes. It constructs a 5 instruction templates × 5 item versions × 10 languages × 5 choice-label formats × 2 choice orders factorial, yielding 2,500 configurations per model. The BFI has 44 five-point items; items are shuffled and presented in random blocks of 17–27. GPT-4-Turbo creates four paraphrases per item; Google Translate and DeepL produce nine translations from English, with only a sample manually checked. At temperature zero, the study evaluates GPT-3.5-Turbo-1106, GPT-4-Turbo-1106, Gemini-1.0-Pro, and LLaMA-3.1-8B. For GPT-3.5, DBSCAN labels 77 configurations, 3.08%, as outliers, concentrated in numerical labels, descending order, and Arabic or Chinese. Only 7 of 135 one-level-versus-rest comparisons exceed an absolute difference of .15, although the table contains many small p-values because .15 is a descriptive threshold rather than a validated psychometric criterion. GPT-3.5 mean ± SD scores are 4.31±.44 for Openness, 4.15±.39 for Conscientiousness, 3.89±.43 for Extraversion, 4.13±.38 for Agreeableness, and 2.35±.42 for Neuroticism. GPT-4, Gemini, and LLaMA have distinct distributions and outlier rates of 5.6%, 4.2%, and 4.4%; LLaMA is more dispersed. Comparing GPT-3.5 dispersion with more heterogeneous human norms finds lower model variability, but this does not prove reliability: it is also compatible with temperature zero, response bias, or determinism. The test–retest study queries GPT-3.5 biweekly from September 2023 through January 2024 across snapshots 0613 and 1106. Its conclusion of no variation conflicts with Table 2: maximum Agreeableness differs from the mean with p displayed as .00 and is marked “No” for equal means. The analysis also selects extrema post hoc, treats failure to reject as acceptance of equality, and reports no test–retest coefficient. A second part tests three ways to alter GPT-3.5 self-ratings: emotional narratives, explicit assignment of ten extreme profiles, and embodiment of eight heroes and eight villains. Narratives barely move the distribution; among question answering, biography, and portray methods, only direct portray instructions clearly shift it. Extreme instructions separate every targeted dimension from default (p < .001): the largest change is minimum Extraversion at −1.71, followed by maximum Neuroticism at +1.03. Heroes stay near the default assistant profile, while villains spread more broadly. This demonstrates that self-report outputs respond to descriptions containing the target trait, not accurate representation of people or human populations: there is no target human data, behavioral validation, external criterion, or character-fidelity evaluation. The main overreach is calling aggregate robustness to perturbations “internal consistency reliability.” The paper itself acknowledges that its transformations preclude Cronbach's alpha and that reliability does not imply validity. The defensible contribution is therefore a broad map of BFI sensitivity to formats, languages, and instructed personas; it neither validates the BFI as a measure of LLM personality nor supports replacing human participants.

Pregunta de investigación

¿Hasta qué punto permanecen estables las puntuaciones BFI de varios LLM ante cambios de instrucción, paráfrasis, idioma, formato y orden, y cuánto puede GPT-3.5 desplazar esas puntuaciones mediante contexto, perfiles o personajes instruidos?

Método

Diseño factorial completo de 2.500 configuraciones por modelo sobre el BFI: cinco plantillas, cinco versiones de ítems, diez idiomas, cinco etiquetas y dos órdenes. A temperatura 0 se calculan puntuaciones OCEAN, proyecciones PCA, outliers DBSCAN, diferencias de medias, t-tests y comparación de varianzas. GPT-3.5 se consulta además quincenalmente durante diez momentos aproximados. Para steerability se repiten variantes en inglés con narrativas emocionales, perfiles extremos y personajes, con o sin una descripción adicional denominada CoT.

Muestra: Cuatro LLM evaluados en 2.500 configuraciones BFI cada uno, con temperatura 0. El estudio temporal de GPT-3.5 cubre aproximadamente diez mediciones quincenales y dos snapshots. Los experimentos de manipulación se limitan a GPT-3.5 y generan aproximadamente 2.500 puntos por método según el texto. No hay participantes humanos nuevos ni una muestra humana emparejada con las personas simuladas.

Hallazgos

  • En GPT-3.5, 77 de 2.500 configuraciones (3,08 %) son outliers DBSCAN; se asocian sobre todo a etiquetas numéricas, orden descendente y árabe o chino.
  • Solo 7/135 diferencias de un nivel frente a los restantes superan 0,15, aunque muchas comparaciones son estadísticamente significativas y el corte 0,15 no está validado.
  • Las medias OCEAN de GPT-3.5 son 4,31, 4,15, 3,89, 4,13 y 2,35; las desviaciones 0,44, 0,39, 0,43, 0,38 y 0,42 son menores que las normas humanas externas comparadas.
  • GPT-4-Turbo, Gemini-1.0-Pro y LLaMA-3.1-8B tienen 5,6 %, 4,2 % y 4,4 % de outliers; LLaMA presenta la distribución más descentralizada.
  • La Tabla 2 del test–retest contradice la conclusión global: el máximo de Agreeableness frente a su media tiene p mostrado como 0,00 y se marca como media desigual.
  • Las narrativas emocionales apenas desplazan BFI; solo portray, entre QA/BIO/POR, altera con claridad la distribución, mientras la descripción adicional tipo CoT no muestra un efecto visible.
  • Los perfiles extremos cambian significativamente la dimensión objetivo; las mayores diferencias frente al default son −1,71 en extraversión mínima y +1,03 en neuroticismo máximo.
  • Los héroes se parecen al perfil por defecto y los villanos se dispersan más, pero no existe una referencia externa de fidelidad del personaje.

Limitaciones

  • Las paráfrasis y traducciones modifican un instrumento validado para humanos; solo una muestra de traducciones se revisa y no se revalida cada versión cultural o lingüística.
  • El estudio no calcula alfa de Cronbach, omega, correlaciones ítem-total ni otra medida de consistencia interna; los autores reconocen que las transformaciones impiden usar alfa.
  • Concentración de puntuaciones a temperatura 0 y menor varianza que una población humana heterogénea no distinguen personalidad estable de determinismo, aquiescencia, deseabilidad social o sesgo de formato.
  • Las 2.500 configuraciones comparten plantillas, ítems y transformaciones y no son participantes independientes; los t-tests masivos no corrigen multiplicidad ni modelan la dependencia factorial.
  • El análisis usa como criterio descriptivo una diferencia de 0,15 sin justificar su relevancia psicométrica, mientras ignora numerosos efectos pequeños con p-valores bajos.
  • El test–retest selecciona mínimos y máximos post hoc, no aporta coeficiente de estabilidad ni intervalos, confunde no rechazar con aceptar igualdad y contiene una excepción significativa que contradice el texto.
  • La comparación humana usa normas publicadas, no una muestra equivalente sometida a las mismas traducciones, órdenes, formatos y condiciones.
  • La manipulación evalúa solo GPT-3.5 mediante el mismo autoinforme que la instrucción intenta cambiar; no mide comportamiento, generalización a otra prueba ni persistencia fuera del prompt.
  • No hay evaluación humana de perfiles o personajes, métricas de fidelidad, datos demográficos objetivo ni contraste con distribuciones reales de grupos.

Qué no demuestra

  • No valida el BFI como medida de personalidad psicológica, constructo interno o comportamiento de un LLM.
  • No demuestra consistencia interna del instrumento pese a utilizar esa etiqueta en Findings 1.
  • No demuestra que menor varianza sea mayor fiabilidad ni que las respuestas no aleatorias correspondan a rasgos.
  • No demuestra estabilidad temporal completa: una comparación de Agreeableness contradice la conclusión y solo se estudia GPT-3.5 durante pocos meses.
  • No demuestra comprensión precisa de los perfiles; repetir diferencias sugeridas explícitamente por el prompt puede ser simple seguimiento de instrucciones.
  • No demuestra que GPT-3.5 represente con precisión poblaciones humanas diversas o que pueda sustituir participantes en ciencias sociales.
  • No establece validez convergente, discriminante, criterial, predictiva, conductual ni intercultural.

Trazabilidad

Alcance: Texto completo

Versión: EMNLP 2024 main proceedings, ACL Anthology 2024.emnlp-main.354

Fuente consultada: https://aclanthology.org/2024.emnlp-main.354.pdf

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • GPT-3.5-Turbo-1106
  • GPT-3.5-Turbo-0613 (test-retest period)
  • GPT-4-Turbo-1106
  • Gemini-1.0-Pro
  • LLaMA-3.1-8B
  • GPT-4-Turbo (item paraphrasing)

Instrumentos y métricas

  • 44-item Big Five Inventory (BFI)
  • Five instruction templates
  • Five item phrasings
  • Ten-language machine-translation set
  • Five choice-label formats and two orders
  • PCA visualization
  • DBSCAN outlier detection (eps 0.3, minPts 20)
  • Student t-tests and variance comparisons

Datos utilizados

  • 2,500 factorial BFI prompt configurations per evaluated model
  • Biweekly GPT-3.5 BFI measurements from September 2023 to January 2024
  • Sixteen emotional contexts, ten extreme trait profiles and sixteen named characters
  • External human BFI norms from Srivastava et al. (2003)

Evidencia y localización

  • Objetivos, distinción entre fiabilidad y validez y pretensión de representar grupos: EMNLP 2024, pp. 6152–6154, Abstract, Introduction and section 2.2
  • Factorial de 2.500 configuraciones, traducciones y versiones de ítems: EMNLP 2024, pp. 6154–6155, section 3.1 and Table 1
  • Resultados GPT-3.5, outliers, comparaciones y normas humanas: EMNLP 2024, pp. 6155–6156, section 3.2, Figure 1 and Table 9
  • Test-retest y contradicción de Agreeableness: EMNLP 2024, p. 6157, section 3.3, Figure 2 and Table 2
  • Contextos, perfiles, personajes y efecto de portray: EMNLP 2024, pp. 6157–6159, section 4 and Figures 3–4
  • Límites declarados sobre traducción, alfa y validez: EMNLP 2024, pp. 6159–6160, sections 5.1 and 6
  • Resultados de GPT-4, Gemini y LLaMA: EMNLP 2024, pp. 6164–6165, Appendix A, Table 3 and Figures 5–7
  • Magnitudes de los perfiles extremos: EMNLP 2024, p. 6166, Appendix B, Figure 8 and Table 4
  • Prompts y resultados detallados de entornos, perfiles y personajes: EMNLP 2024, pp. 6167–6173, Appendices C–F and Tables 5–15