Challenging the Validity of Personality Tests for Large Language Models

Evaluación y validez psicométrica2025research-collection.ethz.chRevisión editorial aprobada

Autores: Tom Sühr, Florian E. Dorner, Samira Samadi, Augustin Kelava

Palabras clave: Computation and Language, Artificial Intelligence, Machine Learning, Personality assessment

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
9
Hallazgos
14
Limitaciones
12
Evidencias

Resumen editorial

Español

Este trabajo formula una objeción psicométrica fundamental a la práctica de administrar cuestionarios humanos a modelos de lenguaje y leer sus puntuaciones como rasgos equivalentes. Evalúa GPT-3.5, GPT-4, Llama 2 70B Chat y Llama 3.1 70B Instruct en dos estudios. El primero compara el sesgo de aquiescencia en los 50 ítems IPIP Big Five Markers con una distribución de más de un millón de respuestas humanas. El segundo genera cuestionarios BFI-2 bajo personas, contexto acumulado y respuestas iniciales sembradas, explora sus componentes mediante PCA con rotación varimax y contrasta modelos factoriales con CFA. Su aportación más importante es separar consistencia interna de validez: un alfa de Cronbach o un omega alto no permite interpretar una escala si el modelo estructural que da sentido a esos coeficientes ajusta mal.

Los cuatro modelos muestran más tendencia a asentir a ítems de clave positiva y negativa que la media humana, con valores aproximados de 0,6 para GPT-4, 0,8 para Llama 3.1 y 1,5 para GPT-3.5 y Llama 2. Solo estos dos últimos se sitúan fuera de la distribución humana con p < 0,005; GPT-4 y Llama 3.1 no alcanzan significación, aunque GPT-4 supera al 89 % de la muestra humana. El contraste trata cada modelo como un único perfil de respuesta, no como una muestra de personas o ejecuciones, por lo que cuantifica lo inusual de esa salida respecto de humanos sin estimar incertidumbre entre ejecuciones del modelo.

En el BFI-2, Llama 3.1 bajo contexto acumulado y personas produce el patrón exploratorio más parecido a cinco bloques, con signos opuestos para ítems directos e inversos. Esa apariencia no se confirma: todos los modelos y configuraciones quedan lejos de los umbrales declarados de CFI/TLI ≥ 0,95 y RMSEA ≤ 0,06. En el modelo BFI-2, por ejemplo, GPT-4 alcanza CFI 0,88/0,78, TLI 0,81/0,65 y RMSEA 0,15/0,17; Llama 3.1, pese a alfa y omega de 0,98/0,93, obtiene CFI 0,74/0,66, TLI 0,65/0,57 y RMSEA 0,38/0,41. Las soluciones convergen con advertencias de lavaan, incluidas varianzas negativas o nulas. La evidencia es fuerte para rechazar una interpretación humana del BFI-2 en estos modelos y protocolos, aunque no constituye una prueba formal completa de invariancia multigrupo: el fallo ocurre ya en la condición previa de que el modelo configural humano ajuste adecuadamente a cada conjunto de respuestas.

La población artificial también limita la inferencia. Las 100 descripciones de PersonaChat no fueron diseñadas para cubrir de forma equilibrada el espacio Big Five, y la estructura factorial observada depende del rango y las correlaciones de los rasgos inducidos por esos prompts. Un mal ajuste puede reflejar la transferencia inadecuada del instrumento, la distribución de personas, el mecanismo determinista de respuesta o una combinación de ellos; no prueba la ausencia de toda forma de personalidad o regularidad conductual en un LLM. La auditoría del repositorio encuentra una reproducción parcial y manual: faltan README, licencia, entorno bloqueado y datos humanos crudos; los scripts R fijan una ruta local y sobrescriben repetidamente entradas; y el artefacto, publicado antes de la versión EAAMO, no contiene Llama 3.1. Además, OpenAI se convierte a respuestas one-hot a partir de un token, mientras Llama usa el valor esperado de probabilidades normalizadas sobre cinco tokens, una asimetría que puede afectar la varianza y la estructura estimada. La conclusión defendible no es que los LLM «no tengan personalidad», sino que estas puntuaciones BFI-2 no deben tratarse como rasgos humanos sin validar primero el constructo, el protocolo y su relación con conducta externa.

English

This paper raises a foundational psychometric objection to administering human questionnaires to language models and interpreting their scores as equivalent traits. It evaluates GPT-3.5, GPT-4, Llama 2 70B Chat, and Llama 3.1 70B Instruct in two studies. The first compares acquiescence bias on the 50-item IPIP Big Five Markers with a distribution of more than one million human responses. The second generates BFI-2 questionnaires under persona, cumulative-context, and seeded-first-answer conditions, explores their components with varimax-rotated PCA, and tests factor models with CFA. Its most important contribution is the separation of internal consistency from validity: a high Cronbach's alpha or omega cannot support interpretation when the structural model that gives those coefficients meaning fits poorly.

All four models agree with both positively and negatively keyed items more than the human mean, at approximately 0.6 for GPT-4, 0.8 for Llama 3.1, and 1.5 for GPT-3.5 and Llama 2. Only the latter two lie outside the empirical human distribution at p < .005; GPT-4 and Llama 3.1 are not statistically significant, although GPT-4 exceeds 89% of human agree-bias values. The comparison treats each model as one response profile rather than a sample of people or model runs, so it measures how unusual that output is relative to humans without estimating between-run model uncertainty.

For the BFI-2, Llama 3.1 under cumulative context and persona prompts produces the most human-looking exploratory pattern: five clearer blocks with opposite signs for direct and reverse-keyed items. That appearance is not confirmed. Every model and prompt setting remains far from the stated CFI/TLI ≥ .95 and RMSEA ≤ .06 thresholds. In the BFI-2 model, for example, GPT-4 reaches CFI .88/.78, TLI .81/.65, and RMSEA .15/.17; Llama 3.1, despite alpha and omega of .98/.93, reaches CFI .74/.66, TLI .65/.57, and RMSEA .38/.41. The solutions converge with lavaan warnings, including negative or zero estimated variances. The evidence strongly rejects a human-equivalent interpretation of BFI-2 scores for these models and protocols, although it is not a full formal multigroup invariance sequence: failure occurs at the prior requirement that the human configural model fit each response set adequately.

The induced population also constrains the inference. The 100 PersonaChat descriptions were not designed to span the Big Five space in a balanced way, and the recovered covariance structure depends on the range and correlations of traits induced by those prompts. Poor fit may reflect invalid instrument transfer, persona distribution, deterministic response mechanics, or a combination; it does not prove the absence of every form of personality or behavioral regularity in an LLM. Repository auditing finds only partial, manual reproducibility: there is no README, license, locked environment, or raw human dataset; the R scripts hard-code a local working directory and repeatedly overwrite their input objects; and the artifact predates the EAAMO version and contains no Llama 3.1 results. OpenAI outputs are also converted to one-hot answers from a returned token, whereas Llama uses an expected score over normalized probabilities for five option tokens, an asymmetry that can affect variance and estimated factor structure. The defensible conclusion is not that LLMs “have no personality,” but that these BFI-2 scores should not be treated as human traits until the construct, administration protocol, and relationship to external behavior have been validated.

Pregunta de investigación

¿Conservan el IPIP-50 y el BFI-2 sus propiedades e interpretación psicométrica al aplicarse a LLM, o el sesgo de aquiescencia y una estructura factorial distinta impiden equiparar sus puntuaciones con rasgos humanos?

Método

El estudio 1 administra una vez los 50 IPIP Big Five Markers sin persona ni repetición a cuatro modelos y calcula, tras invertir la escala de los ítems de clave negativa, la diferencia entre la media de ítems positivos y negativos. Cada valor se sitúa en la distribución empírica de 1.015.342 participantes humanos. El estudio 2 administra los 60 ítems BFI-2 y recoge 100 cuestionarios por modelo y configuración: personas PersonaChat con cada ítem en un contexto nuevo, las mismas personas con los 60 ítems acumulados en un contexto, o contexto acumulado sin persona sembrando la primera respuesta entre 1 y 5. Las condiciones sin persona ni semilla carecen de varianza suficiente. Se realiza PCA estandarizada con cinco componentes y rotación varimax; después, CFA por dominio para un componente, tres facetas y el modelo jerárquico BFI-2, informando alfa, omega jerárquico, CFI, TLI y RMSEA. La revisión contrastó el preprint completo, la publicación EAAMO 2025, apéndices, tablas, figuras y el repositorio público.

Muestra: El análisis IPIP compara un único perfil de 50 respuestas por LLM con 1.015.342 cuestionarios humanos, no múltiples ejecuciones de cada modelo. Para BFI-2 se recogen n = 100 cuestionarios completos por modelo y configuración analizable. Las configuraciones con personas reutilizan 100 descripciones de PersonaChat; la configuración sembrada fija la primera respuesta en uno de cinco valores y continúa los 59 ítems en el mismo contexto. Las condiciones sin persona ni semilla no alcanzan varianza suficiente incluso al aumentar la temperatura. La publicación incluye cuatro modelos, pero el repositorio de marzo de 2024 solo contiene artefactos para GPT-3.5, GPT-4 y Llama 2.

Hallazgos

  • El sesgo de aquiescencia es aproximadamente 0,6 para GPT-4, 0,8 para Llama 3.1 y 1,5 para GPT-3.5 y Llama 2; solo GPT-3.5 y Llama 2 difieren de la distribución humana con p < 0,005.
  • GPT-4 supera el sesgo de aquiescencia del 89 % de los humanos, pero ni GPT-4 ni Llama 3.1 alcanzan significación estadística en el contraste publicado.
  • Sin persona ni respuesta inicial sembrada, la mayoría de los ítems apenas varía, incluso con temperaturas superiores, lo que impide estimar PCA y CFA útiles.
  • En contexto con personas, Llama 3.1 muestra en PCA la separación exploratoria más clara entre cinco grupos y entre ítems directos e inversos; GPT-4 muestra separación limitada y GPT-3.5/Llama 2 no la reproducen.
  • La estructura prometedora de Llama 3.1 no supera la CFA. Ninguno de los cuatro modelos alcanza simultáneamente CFI/TLI ≥ 0,95 y RMSEA ≤ 0,06 bajo el modelo BFI-2.
  • Todos los alfa y omega medios están por encima de 0,70, Llama 3.1 llega a 0,98/0,93, pero su interpretación como fiabilidad no es válida cuando el modelo factorial subyacente ajusta mal.
  • Las soluciones CFA convergen con advertencias de lavaan, incluidas varianzas negativas o nulas, señal de soluciones impropias o inestables que obligan a interpretar con cautela parámetros e índices.
  • El resultado más sólido es una prueba de carga: quienes apliquen una escala humana a LLM deben demostrar su validez para ese constructo, modelo y protocolo, en vez de asumirla a partir de puntuaciones plausibles.
  • Los dos experimentos emplean instrumentos distintos, IPIP-50 para aquiescencia y BFI-2 para estructura, por lo que sus resultados son complementarios, no una única prueba integrada de invariancia.

Limitaciones

  • El contraste de aquiescencia usa una sola salida determinista por modelo; la distribución de referencia es humana y no cuantifica variabilidad entre semillas, sesiones, fechas o ejecuciones del LLM.
  • La significación se obtiene solo para GPT-3.5 y Llama 2. Describir los cuatro modelos como estadísticamente no humanos ampliaría indebidamente el resultado.
  • Las 100 personas de PersonaChat no se muestrean ni balancean para producir una distribución conocida del Big Five. La identificación de factores depende del rango, la covarianza y la representatividad de esas manipulaciones.
  • El estudio no ejecuta una secuencia formal de invariancia multigrupo configural, métrica, escalar y residual; demuestra antes que el modelo humano ni siquiera ofrece ajuste configural suficiente en los conjuntos LLM.
  • PCA con varimax impone componentes ortogonales, mientras los dominios Big Five no tienen por qué ser perfectamente independientes; otras rotaciones o modelos podrían cambiar la representación exploratoria.
  • La tabla promedia índices CFA sobre cinco dominios o modelos por faceta y no expone en el cuerpo principal incertidumbre ni todos los resultados individuales, lo que puede ocultar heterogeneidad entre rasgos.
  • Varianzas negativas o nulas indican soluciones impropias. Aunque son coherentes con inestabilidad y mal ajuste, también limitan la precisión con la que pueden interpretarse los propios parámetros estimados.
  • No se evalúan validez convergente o predictiva frente a conducta externa, estabilidad test-retest, cambios entre versiones, tareas reales, idiomas o robustez a paráfrasis y formatos.
  • Los modelos son snapshots de 2023 junto con Llama 2 y Llama 3.1; el resultado no se transfiere automáticamente a sistemas posteriores ni a otras modalidades de respuesta.
  • Usar un LLM como individuo en el análisis de aquiescencia y como población condicionada por personas en el factorial son elecciones metodológicas diferentes y no resuelven qué unidad ontológica debería medir una personalidad sintética.
  • El artículo reutiliza la muestra IPIP de OpenPsychometrics, pero el repositorio no incluye respuestas humanas crudas ni una canalización completa y documentada de limpieza y control de calidad.
  • El repositorio carece de README, licencia y dependencias fijadas; los scripts R contienen una ruta local absoluta, sobrescriben objetos con distintas fuentes y requieren activar manualmente bloques y rutas.
  • El código público precede la versión EAAMO y no reproduce Llama 3.1. También usa representaciones distintas por proveedor: una respuesta one-hot para OpenAI y una media probabilística para Llama, potencialmente relevante para la varianza factorial.
  • El preprint declara temperatura cero para OpenAI, mientras varias llamadas públicas usan 1,0; dado que la versión condensada de actas no detalla todos los parámetros, esto se documenta como discrepancia entre preprint y artefacto, no como contradicción inequívoca del método final.

Qué no demuestra

  • No demuestra que los LLM carezcan de cualquier personalidad, disposición, estilo o regularidad conductual útil; invalida una interpretación humana concreta del BFI-2 bajo los protocolos probados.
  • No demuestra que todos los cuestionarios psicológicos fallen siempre en todos los modelos; cada instrumento, constructo, modelo y protocolo necesita evidencia propia.
  • No demuestra ausencia de cinco dimensiones en todo comportamiento del modelo, sino falta de ajuste del modelo factorial humano en las respuestas inducidas y observadas aquí.
  • No permite atribuir el sesgo de aquiescencia a RLHF, entrenamiento, arquitectura o preferencias de anotadores; esas explicaciones se proponen, pero no se manipulan experimentalmente.
  • No convierte una puntuación de cuestionario en prueba de experiencia subjetiva, identidad, intención, autoconocimiento o estados psicológicos internos.
  • No establece que alfa u omega sean inútiles en general; muestra que no pueden interpretarse como fiabilidad cuando fallan los supuestos estructurales que requieren.
  • No ofrece todavía un instrumento alternativo validado para personalidad específica de LLM; presenta criterios y un programa de construcción que requiere validación externa.
  • No prueba que Llama 3.1 posea una estructura Big Five porque su PCA sea visualmente más ordenada; la CFA posterior rechaza el ajuste suficiente al modelo humano.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2311.05297v2 (5 Jun 2024); EAAMO 2025 proceedings, DOI 10.1145/3757887.3763016, also reviewed (published PDF SHA-256 d291dc59941901d1a99671a9a586a06595116cddbf690c70d371b28ec26e147f); public code commit 7ab6bfccd183ab1bf19857064d84388a282338d2 audited

Fuente consultada: https://arxiv.org/pdf/2311.05297

Revisión: Codex editorial review and methods/code audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI gpt-3.5-turbo-0613
  • OpenAI gpt-4-0613
  • Meta Llama-2-70b-chat
  • Meta Llama-3.1-70B-Instruct

Instrumentos y métricas

  • 50-item IPIP Big Five Markers
  • Big Five Inventory-2 (BFI-2, 60 items and 15 facets)
  • Agree-bias statistic from true-key versus false-key items
  • Principal component analysis with varimax rotation
  • Confirmatory factor analysis with lavaan
  • Cronbach's alpha
  • McDonald's hierarchical omega
  • CFI, TLI and RMSEA model-fit indices

Datos utilizados

  • OpenPsychometrics IPIP Big Five human responses (n = 1,015,342)
  • PersonaChat subset of 100 persona descriptions
  • BFI-2 human component loadings from Soto and John (2017)
  • Online and student human BFI-2 samples reported by Soto and John (2017)
  • Released LLM questionnaire responses and preprocessed PCA/CFA tables for GPT-3.5, GPT-4 and Llama 2

Evidencia y localización

  • Publicación definitiva, autoría, DOI, licencia y paginación: EAAMO 2025 proceedings paper, pp. 74–81; DOI 10.1145/3757887.3763016; ETH Research Collection 10.3929/ethz-c-000789617
  • Definición y resultados del sesgo de aquiescencia: EAAMO 2025 paper, section 4.3 and Figure 1, pp. 76–77
  • Modelos, configuraciones BFI-2, n = 100 y ausencia de varianza sin persona o semilla: EAAMO 2025 paper, section 4.4, p. 77; Appendix D in arXiv:2311.05297v2
  • PCA con varimax y comparación de cargas con muestras humanas: EAAMO 2025 paper, section 4.4 and Figure 2, pp. 77–78
  • Dependencia interpretativa de alfa y omega respecto del modelo factorial: EAAMO 2025 paper, section 4.5, pp. 78–79
  • Valores de alfa, omega, CFI, TLI y RMSEA para cuatro modelos: EAAMO 2025 paper, Table 1, p. 80
  • Advertencias de lavaan y conclusión sobre ajuste e invariancia: EAAMO 2025 paper, section 4.6, p. 79
  • Alcance, limitaciones y propuesta de instrumentos específicos para LLM: EAAMO 2025 paper, sections 5–7, pp. 79–80
  • Tamaños y procedencia de muestras, prompts y parámetros del preprint: arXiv:2311.05297v2, Appendix A–D and Tables 1–2
  • Reproducibilidad parcial, datos ausentes, rutas locales y flujo manual: GitHub tsuehr/LLMpersonality commit 7ab6bfccd183ab1bf19857064d84388a282338d2; analysis/cfa.R, analysis/pca.R and analysis/final_analysis_and_plots.ipynb
  • Diferencias de temperatura y representación de respuestas entre proveedores: GitHub commit 7ab6bfccd183ab1bf19857064d84388a282338d2; experiment_general.py, experiment_incontext.py, experiment_incontext_seeded.py and Utils.py
  • Ausencia de Llama 3.1 en el artefacto público anterior a la publicación: GitHub commit 7ab6bfccd183ab1bf19857064d84388a282338d2 dated 5 Mar 2024; repository file tree and released result tables