Este trabajo pregunta si tres cuestionarios humanos, Ambivalent Sexism Inventory (ASI, 22 ítems), Symbolic Racism 2000 Scale (SR2K, 8) y Moral Foundations Questionnaire (MFQ, 30), producen en LLM puntuaciones fiables y válidas. Evalúa 17 snapshots: Centaur; cuatro Gemma 3; Llama 3.1 8B y 70B y Llama 3.3 70B; Mistral 7B y Mistral Large; cinco Qwen 2.5/3; y Gemini 2.5 Flash/Pro. Cada ítem se presenta por separado con respuesta cerrada y se repite con cinco semillas usando la temperatura predeterminada de cada modelo. La fiabilidad no significa alfa, estructura factorial ni estabilidad temporal: es el porcentaje de respuestas exactamente iguales entre el original y tres perturbaciones, una forma alternativa generada por GPT-5 y revisada por dos autores, el orden invertido de opciones y el cambio de dos puntos por interrogación al final del prompt. Como referencia solo para la forma alternativa, 150 participantes estadounidenses de Prolific contestan original y paráfrasis en la misma sesión; se excluyen seis por atención y quedan 144. La puntuación suele ser estable ante puntuación y forma alternativa, pero varios modelos cambian mucho al invertir opciones. La tabla de orden invertido llega a 0,00 en SR2K para Gemma 3 1B, 0,19 en ASI para Qwen 2.5 7B y aproximadamente 0,27–0,28 para Llama 3.1 8B en ASI/SR2K. Llamar al conjunto “fiabilidad moderada” es razonable solo para estas perturbaciones concretas. La validez convergente usa tres correlaciones de Spearman entre medias por modelo y obtiene las direcciones teóricas seleccionadas: racismo–sexismo rho=0,47, fairness–sexismo hostil rho=−0,37 y authority–sexismo benevolente rho=0,43. Son asociaciones moderadas de 17 puntos, sin p, intervalos, corrección múltiple, red nomológica completa ni prueba discriminante; por tanto apoyan coherencia relativa entre tres escalas, no confirman por sí solas los constructos. La contribución más importante es la validez ecológica: compara el ranking del test con siete proxies de conducta. Sexismo usa cartas de recomendación para 24 perfiles masculinos y 24 femeninos y promedia cinco odds ratios de vocabulario; racismo usa recomendaciones de vivienda para perfiles Black/white en diez ciudades y la diferencia del índice de oportunidad; moralidad usa 227 dilemas y mide si el consejo coincide con una acción alineada con authority, care, fairness, ingroup o purity, clasificada por GPT-4o. Centaur no sigue las instrucciones downstream y se excluye, de modo que las correlaciones ecológicas usan 16 modelos: sexismo −0,24; racismo −0,62; authority −0,13; care −0,10; fairness 0,21; ingroup −0,12; purity 0,21. Ninguna muestra la asociación positiva clara que haría falta para interpretar la puntuación del cuestionario como predictor de ese proxy; cinco son negativas y dos débilmente positivas. El resultado más fuerte es el contrasentido en racismo: los modelos que parecen menos racistas en SR2K tienden a producir recomendaciones de vivienda más desiguales. Esto sí respalda la advertencia de no usar directamente puntuaciones humanas como propiedades conductualmente validadas de un LLM. El título, sin embargo, es más amplio que el diseño. Las tareas downstream siguen siendo proxies construidos y distintos entre sí, no conducta general ni outcomes de despliegue. La unidad estadística es un conjunto pequeño de 16 modelos relacionados por familia, no ejecuciones independientes; no se muestran p, intervalos ni ajuste para siete comparaciones. El juicio moral depende de GPT-4o: dos autores anotan 100 respuestas y el juez coincide en 88%, sin kappa, error por clase o propagación de esa incertidumbre. Hay no-respuestas relevantes que la puntuación omite al promediar disponibles: en los datos públicos del SR2K original faltan 15 de 40 respuestas para Llama 3.1 8B, 11/40 para Gemini Flash y 16/40 para Gemini Pro, sin que las figuras muestren el denominador efectivo. La reproducibilidad es sustancial pero incompleta. El repositorio aporta ítems, prompts, salidas, notebooks y utilidades, pero la tabla asigna por error a Llama 3.1 70B el ID de 8B; los JSON solo conservan el nombre de archivo, no el model_id real, así que no resuelven qué checkpoint produjo esas salidas. Además, validity_eval.py requiere rel_reversed.json y housing_per_model.csv ausentes, y no aparece el código que construye el agregado de vivienda. La conclusión fiel es acotada: en estos tres tests, estos snapshots y estos proxies, la estabilidad ante formato es desigual y el orden relativo de los modelos en cuestionarios no predice el orden en conducta. El estudio no prueba que todo test psicométrico sea inútil para todo LLM, no mide personalidad persistente y no convierte sus proxies en verdad de terreno; demuestra que una puntuación no debe interpretarse sin validar fiabilidad, manejo de no-respuestas y correspondencia conductual para el uso concreto.
Pregunta de investigación
¿Son fiables ante variaciones de ítem y prompt, coherentes entre escalas y ecológicamente válidas respecto a tareas conductuales las puntuaciones ASI, SR2K y MFQ obtenidas de 17 LLM?