Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Jana Jung, Marlene Lutz, Indira Sen, Markus Strohmaier

Palabras clave: Large Language Models, Personality, Psychometrics, Personality Control, AI Safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
9
Hallazgos
30
Limitaciones
9
Evidencias

Resumen editorial

Español

Este trabajo pregunta si tres cuestionarios humanos, Ambivalent Sexism Inventory (ASI, 22 ítems), Symbolic Racism 2000 Scale (SR2K, 8) y Moral Foundations Questionnaire (MFQ, 30), producen en LLM puntuaciones fiables y válidas. Evalúa 17 snapshots: Centaur; cuatro Gemma 3; Llama 3.1 8B y 70B y Llama 3.3 70B; Mistral 7B y Mistral Large; cinco Qwen 2.5/3; y Gemini 2.5 Flash/Pro. Cada ítem se presenta por separado con respuesta cerrada y se repite con cinco semillas usando la temperatura predeterminada de cada modelo. La fiabilidad no significa alfa, estructura factorial ni estabilidad temporal: es el porcentaje de respuestas exactamente iguales entre el original y tres perturbaciones, una forma alternativa generada por GPT-5 y revisada por dos autores, el orden invertido de opciones y el cambio de dos puntos por interrogación al final del prompt. Como referencia solo para la forma alternativa, 150 participantes estadounidenses de Prolific contestan original y paráfrasis en la misma sesión; se excluyen seis por atención y quedan 144. La puntuación suele ser estable ante puntuación y forma alternativa, pero varios modelos cambian mucho al invertir opciones. La tabla de orden invertido llega a 0,00 en SR2K para Gemma 3 1B, 0,19 en ASI para Qwen 2.5 7B y aproximadamente 0,27–0,28 para Llama 3.1 8B en ASI/SR2K. Llamar al conjunto “fiabilidad moderada” es razonable solo para estas perturbaciones concretas. La validez convergente usa tres correlaciones de Spearman entre medias por modelo y obtiene las direcciones teóricas seleccionadas: racismo–sexismo rho=0,47, fairness–sexismo hostil rho=−0,37 y authority–sexismo benevolente rho=0,43. Son asociaciones moderadas de 17 puntos, sin p, intervalos, corrección múltiple, red nomológica completa ni prueba discriminante; por tanto apoyan coherencia relativa entre tres escalas, no confirman por sí solas los constructos. La contribución más importante es la validez ecológica: compara el ranking del test con siete proxies de conducta. Sexismo usa cartas de recomendación para 24 perfiles masculinos y 24 femeninos y promedia cinco odds ratios de vocabulario; racismo usa recomendaciones de vivienda para perfiles Black/white en diez ciudades y la diferencia del índice de oportunidad; moralidad usa 227 dilemas y mide si el consejo coincide con una acción alineada con authority, care, fairness, ingroup o purity, clasificada por GPT-4o. Centaur no sigue las instrucciones downstream y se excluye, de modo que las correlaciones ecológicas usan 16 modelos: sexismo −0,24; racismo −0,62; authority −0,13; care −0,10; fairness 0,21; ingroup −0,12; purity 0,21. Ninguna muestra la asociación positiva clara que haría falta para interpretar la puntuación del cuestionario como predictor de ese proxy; cinco son negativas y dos débilmente positivas. El resultado más fuerte es el contrasentido en racismo: los modelos que parecen menos racistas en SR2K tienden a producir recomendaciones de vivienda más desiguales. Esto sí respalda la advertencia de no usar directamente puntuaciones humanas como propiedades conductualmente validadas de un LLM. El título, sin embargo, es más amplio que el diseño. Las tareas downstream siguen siendo proxies construidos y distintos entre sí, no conducta general ni outcomes de despliegue. La unidad estadística es un conjunto pequeño de 16 modelos relacionados por familia, no ejecuciones independientes; no se muestran p, intervalos ni ajuste para siete comparaciones. El juicio moral depende de GPT-4o: dos autores anotan 100 respuestas y el juez coincide en 88%, sin kappa, error por clase o propagación de esa incertidumbre. Hay no-respuestas relevantes que la puntuación omite al promediar disponibles: en los datos públicos del SR2K original faltan 15 de 40 respuestas para Llama 3.1 8B, 11/40 para Gemini Flash y 16/40 para Gemini Pro, sin que las figuras muestren el denominador efectivo. La reproducibilidad es sustancial pero incompleta. El repositorio aporta ítems, prompts, salidas, notebooks y utilidades, pero la tabla asigna por error a Llama 3.1 70B el ID de 8B; los JSON solo conservan el nombre de archivo, no el model_id real, así que no resuelven qué checkpoint produjo esas salidas. Además, validity_eval.py requiere rel_reversed.json y housing_per_model.csv ausentes, y no aparece el código que construye el agregado de vivienda. La conclusión fiel es acotada: en estos tres tests, estos snapshots y estos proxies, la estabilidad ante formato es desigual y el orden relativo de los modelos en cuestionarios no predice el orden en conducta. El estudio no prueba que todo test psicométrico sea inútil para todo LLM, no mide personalidad persistente y no convierte sus proxies en verdad de terreno; demuestra que una puntuación no debe interpretarse sin validar fiabilidad, manejo de no-respuestas y correspondencia conductual para el uso concreto.

English

This study asks whether three human questionnaires, the 22-item Ambivalent Sexism Inventory (ASI), 8-item Symbolic Racism 2000 Scale (SR2K), and 30-item Moral Foundations Questionnaire (MFQ), yield reliable and valid LLM scores. It evaluates 17 snapshots: Centaur; four Gemma 3 sizes; Llama 3.1 8B and 70B and Llama 3.3 70B; Mistral 7B and Mistral Large; five Qwen 2.5/3 variants; and Gemini 2.5 Flash/Pro. Each item is administered separately in a constrained-answer prompt and repeated under five seeds at each model's default temperature. Reliability here is not alpha, factor reliability, or temporal stability. It is the proportion of exactly unchanged item answers between the original and three perturbations: a GPT-5-generated alternate form reviewed by two authors, reversed answer-option order, and changing the prompt terminator from a colon to a question mark. As a baseline only for alternate forms, 150 U.S. Prolific participants answer originals and paraphrases in the same session; six fail attention checks, leaving 144. Answers are often stable under punctuation and alternate wording, but several models change sharply when options are reversed. The reversed-order table reaches 0.00 on SR2K for Gemma 3 1B, 0.19 on ASI for Qwen 2.5 7B, and about 0.27–0.28 on ASI/SR2K for Llama 3.1 8B. Describing the overall pattern as moderate reliability is defensible only for these specific perturbations. Convergent validity uses three model-level Spearman correlations and obtains the selected theoretical directions: racism–sexism rho=0.47, fairness–hostile sexism rho=−0.37, and authority–benevolent sexism rho=0.43. These are moderate associations from 17 points, without reported p-values, intervals, multiplicity correction, a full nomological network, or discriminant-validity analysis. They support relative coherence among three selected scale relations, not confirmation of the constructs. The paper's most important contribution is ecological validity, comparing questionnaire ranks with seven behavioral proxies. Sexism uses recommendation letters for 24 male and 24 female profiles and averages five dictionary-based odds ratios. Racism uses housing recommendations for paired Black/white profiles in ten cities and the difference in neighborhood opportunity index. Morality uses 227 dilemmas and measures whether advice matches an authority, care, fairness, ingroup, or purity-aligned action as classified by GPT-4o. Centaur fails downstream instructions and is excluded, so ecological correlations use 16 models: sexism −0.24; racism −0.62; authority −0.13; care −0.10; fairness 0.21; ingroup −0.12; purity 0.21. None shows the clear positive association needed to treat a questionnaire score as a predictor of its corresponding proxy; five are negative and two weakly positive. The strongest result is the racism reversal: models appearing less racist on SR2K tend to produce more unequal housing recommendations. This supports the warning against treating human questionnaire scores as behaviorally validated LLM properties. The title is broader than the design, however. Downstream tasks remain heterogeneous constructed proxies, not general behavior or deployment outcomes. The statistical unit is a small set of 16 family-related models rather than independent draws; no p-values, intervals, or adjustment across seven comparisons are shown. Moral behavior is itself judged by GPT-4o. Two authors annotate 100 answers and the judge agrees 88%, without kappa, classwise error, or uncertainty propagation. Missing responses also matter because test scores average available answers. Public original SR2K diagnostics contain 15 missing of 40 trials for Llama 3.1 8B, 11/40 for Gemini Flash, and 16/40 for Gemini Pro, while figures do not disclose effective denominators. Reproducibility is substantial but incomplete. The repository releases items, prompts, outputs, notebooks, and core utilities, but Table 5 mistakenly maps Llama 3.1 70B to the 8B model ID; JSON outputs preserve only a filename label, not the actual model_id, so they cannot resolve which checkpoint ran. In addition, validity_eval.py requires absent rel_reversed.json and housing_per_model.csv files, and the housing aggregation code is not supplied. The faithful conclusion is bounded: for these three tests, model snapshots, and proxies, format stability is uneven and questionnaire model rankings do not predict behavioral rankings. The study does not prove every psychometric test useless for every LLM, does not measure persistent personality, and does not make its proxies ground truth. It shows that a score should not be interpreted without use-specific validation of reliability, missing-response handling, and behavioral correspondence.

Pregunta de investigación

¿Son fiables ante variaciones de ítem y prompt, coherentes entre escalas y ecológicamente válidas respecto a tareas conductuales las puntuaciones ASI, SR2K y MFQ obtenidas de 17 LLM?

Método

Se administran individualmente 22 ítems ASI, 8 SR2K y 30 MFQ a 17 modelos, con cinco semillas, forma original, paráfrasis, orden de opciones invertido y final de prompt cambiado. Se mide acuerdo exacto de respuesta; 144 participantes estadounidenses sirven de referencia para original frente a forma alternativa. La validez convergente usa tres correlaciones de Spearman entre tests. La ecológica correlaciona rankings de test y siete proxies downstream de cartas, vivienda y consejo moral en 16 modelos, tras excluir Centaur.

Muestra: Diecisiete LLM con cinco semillas por condición. La validez ecológica usa 16 porque Centaur no siguió suficientemente las instrucciones downstream. El benchmark humano recluta 150 adultos de EE. UU. en Prolific con cuotas de edad y educación; se excluyen seis por controles de atención y se analizan 144, que contestan original y forma alternativa en la misma sesión.

Hallazgos

  • La fuente vigente es arXiv:2510.11254v2, revisada el 27 de enero de 2026, con 31 páginas y aceptación EACL Main 2026 declarada en el repositorio.
  • Las 31 páginas se renderizaron e inspeccionaron visualmente; el PDF vigente coincide byte a byte con la caché y tiene SHA-256 c3a71f464a8cdc5223a9dcb237a79021cbbb46af63678fbd1dda1121513ed38e.
  • La consistencia suele ser mayor al cambiar solo puntuación y menor al invertir el orden de opciones.
  • Correlaciones convergentes reportadas: 0,47 racismo–sexismo, −0,37 fairness–sexismo hostil y 0,43 authority–sexismo benevolente.
  • Correlaciones ecológicas: −0,24 sexismo, −0,62 racismo, −0,13 authority, −0,10 care, 0,21 fairness, −0,12 ingroup y 0,21 purity.
  • Cinco de siete asociaciones ecológicas tienen dirección negativa y las dos positivas son débiles.
  • La asociación de racismo es una inversión moderada-fuerte: mejor ranking SR2K coincide con peor proxy de vivienda.
  • Los datos públicos contienen no-respuestas sustanciales en SR2K para varios modelos, omitidas al promediar puntuaciones disponibles.
  • El repositorio publica gran parte de las entradas, salidas y análisis, pero no ejecuta la validez de extremo a extremo con los archivos versionados.

Limitaciones

  • Solo se estudian tres cuestionarios, tres dominios normativos, prompts en inglés y una selección de modelos de 2025.
  • La fiabilidad se operacionaliza como acuerdo exacto ante tres perturbaciones, no como consistencia interna, estructura factorial, invariancia o test-retest temporal.
  • Las formas alternativas son generadas por GPT-5 y revisadas por dos autores, no validadas psicométricamente con un estudio humano independiente.
  • El benchmark humano cubre original frente a forma alternativa, no orden invertido ni puntuación.
  • Original y forma alternativa se administran en la misma sesión humana, con posible recuerdo.
  • Solo se prueban tres correlaciones convergentes elegidas por teoría; no hay matriz completa, discriminante o análisis factorial.
  • Las conclusiones de convergencia se basan en 17 medias por modelo.
  • Las correlaciones ecológicas se basan en 16 rankings por modelo tras excluir Centaur.
  • Varios puntos proceden de tamaños de la misma familia y no son observaciones independientes de una población de LLM.
  • No se reportan p-values, intervalos de confianza, potencia ni corrección por las siete pruebas ecológicas.
  • Promediar cinco semillas antes de correlacionar oculta incertidumbre dentro de modelo.
  • Las temperaturas predeterminadas difieren entre modelos, de modo que modelo y política de muestreo quedan parcialmente confundidos.
  • La tarea de cartas mide diccionarios de palabras, no decisiones reales de contratación ni todos los modos de sesgo de género.
  • La tarea de vivienda restringe al modelo a conjuntos construidos de 20 barrios y un índice compuesto, no resultados reales de vivienda.
  • Sexo se limita a categorías binarias y racismo a perfiles Black/white en ciudades de EE. UU.
  • Las cinco dimensiones morales no usan una fuente homogénea: tres vienen de DailyDilemmas y dos de Reddit.
  • GPT-4o juzga la conducta moral de otros LLM, introduciendo error y posible sesgo compartido.
  • El 88% de acuerdo del juez con 100 anotaciones humanas no incluye kappa, sensibilidad por clase ni intervalo.
  • Los tests directos pueden activar guardrails distintos de los prompts downstream; el estudio lo propone como explicación pero no lo identifica causalmente.
  • Las no-respuestas se omiten de las medias y no se muestran denominadores efectivos por puntuación.
  • En SR2K original faltan 15/40 respuestas para Llama 3.1 8B, 11/40 para Gemini Flash y 16/40 para Gemini Pro en el artefacto público.
  • La tabla de IDs asigna a Llama 3.1 70B el checkpoint meta-llama/Llama-3.1-8B-Instruct.
  • Los JSON nombrados 70B no guardan model_id ni revisión y no resuelven si el error está solo en la tabla o también en la ejecución.
  • No se fijan revisiones inmutables de Hugging Face ni versiones exactas de Gemini.
  • El repositorio no tiene release o tag inmutable para el paper.
  • validity_eval.py depende de results/rel_reversed.json y housing_per_model.csv, ausentes en el commit auditado.
  • No se localiza el código que deriva los agregados de vivienda desde las salidas publicadas.
  • El entorno es una exportación Conda extensa y específica de Linux, no un lockfile mínimo reproducible.
  • No hay CI ni prueba automatizada de reproducción de tablas y figuras.
  • El trabajo no replica resultados en otros idiomas, culturas, versiones de modelos o familias de tests.

Qué no demuestra

  • No establece que todos los tests psicométricos humanos fallen para todos los LLM.
  • No establece que ASI, SR2K o MFQ carezcan de utilidad descriptiva en cualquier diseño.
  • No demuestra rasgos psicológicos persistentes o equivalentes a los humanos en los modelos.
  • No convierte cartas, vivienda o consejo moral en medidas completas o de verdad de terreno del constructo.
  • No demuestra causalmente que guardrails o formato expliquen las discrepancias.
  • No demuestra significación o estabilidad poblacional de cada correlación ecológica.
  • No generaliza a modelos, idiomas, prompts, tests o tareas fuera de la muestra.
  • No permite verificar sin ambigüedad el checkpoint nominal Llama 3.1 70B.
  • No justifica interpretar una puntuación individual sin validación conductual específica.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2510.11254v2, revised 27 January 2026, 31 pages; accepted to EACL Main 2026 according to the authors' repository

Fuente consultada: https://arxiv.org/abs/2510.11254

Revisión: Codex complete bilingual full-text fidelity pass, current arXiv v2 and byte-level PDF verification, all-page visual inspection, table and figure extraction, reliability-construct audit, ecological-proxy audit, public output missingness audit, model-identity reconciliation, and end-to-end repository reproducibility check; summaries written from the complete paper and released artifacts rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • marcelbinz/Llama-3.1-Centaur-70B
  • Gemma 3 1B, 4B, 12B and 27B instruction-tuned
  • Llama 3.1 8B and nominal 70B Instruct, plus Llama 3.3 70B Instruct
  • Mistral 7B Instruct v0.3 and Mistral Large 123B
  • Qwen 2.5 7B, 14B, 32B and 72B Instruct; Qwen 3 4B Instruct 2507
  • Gemini 2.5 Flash and Gemini 2.5 Pro
  • GPT-5 for alternate-item generation
  • GPT-4o as morality downstream-task judge

Instrumentos y métricas

  • Ambivalent Sexism Inventory, 22 items with hostile and benevolent sexism subscales
  • Symbolic Racism 2000 Scale, 8 items
  • Moral Foundations Questionnaire, 30 items across care, fairness, ingroup, authority, and purity
  • Exact-answer consistency under alternate form, reversed answer order, and changed prompt terminator
  • Spearman rank correlation for selected convergent and ecological relations
  • Dictionary-based gendered-language odds ratios
  • Neighborhood opportunity-index difference
  • GPT-4o classification of foundation-aligned advice

Datos utilizados

  • Original and GPT-5-generated alternate ASI, SR2K, and MFQ items
  • Five seeded runs per model, test, variation, and downstream task
  • 48 reference-letter profiles: 24 male and 24 female across age and occupation
  • Housing recommendation prompts for paired Black/white profiles across ten U.S. cities
  • 123 selected DailyDilemmas for care, fairness, and ingroup
  • 104 Reddit-derived dilemmas for authority and purity
  • Public authors' repository at commit 883bfe528b7ceb51c758015f4ac160ff404a9c22

Evidencia y localización

  • Versión, autores, abstract y fecha de revisión: arXiv:2510.11254v2 metadata and pages 1–2 checked 15 July 2026
  • Diseño, modelos, tests y métricas: Sections 3–4, pages 3–6
  • Resultados principales de fiabilidad y validez ecológica: Sections 5–6 and Figures 2–3, pages 6–9
  • Muestra humana y tablas detalladas: Appendices C–G, pages 19–25
  • Correlaciones convergentes y puntuaciones downstream: Figure 12 and Table 10, page 24; Figure 13, page 25
  • Ítems y formas alternativas: Appendix H, pages 26–31
  • Disponibilidad, no-respuestas, identidad de modelo y ejecución: Authors' GitHub repository commit 883bfe528b7ceb51c758015f4ac160ff404a9c22 audited 15 July 2026
  • Auditoría metodológica y de reproducibilidad: reports/verification/article-185-validity-and-reproducibility-audit.json
  • Inspección visual completa: All 31 PDF pages rendered and visually inspected on 15 July 2026