AI Psychometrics: Assessing the Psychological Profiles of Large Language Models Through Psychometric Inventories - PMC

Evaluación y validez psicométrica2024PubMed CentralRevisión editorial aprobada

Título original: AI Psychometrics: Assessing the Psychological Profiles of Large Language Models Through Psychometric Inventories

Autores: Max Pellert, Clemens M Lechner, Claudia Wagner, Beatrice Rammstedt, Markus Strohmaier

Palabras clave: Artificial intelligence, Psychometrics, Natural language processing, Personality, Values, Moral foundations, Gender diversity beliefs

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
6
Hallazgos
6
Limitaciones
7
Evidencias

Resumen editorial

Español

Este artículo de perspectiva define «psicometría de IA» como el uso crítico de inventarios psicológicos para diagnosticar rasgos no cognitivos que los modelos expresan o imitan, y acompaña la propuesta con demostraciones en modelos abiertos de inferencia de lenguaje natural. En vez de pedir texto libre a modelos generativos, presenta cada ítem como premisa y cada opción verbal de respuesta como hipótesis; registra la probabilidad de entailment, elige la opción de máxima probabilidad y agrega los ítems según las reglas originales. Se estudian siete modelos únicos de las familias RoBERTa, DeBERTa, BERT y BART, seis en inglés y tres configuraciones en alemán. Los instrumentos cubren Big Five, tétrada oscura, valores de Schwartz, fundamentos morales y creencias sobre diversidad de género y sexo. Los perfiles Big Five ingleses resultan bastante homogéneos: alta Agreeableness y Extraversion y bajo Neuroticism, con más diferencias en Openness y Conscientiousness; las versiones alemanas divergen más. Las puntuaciones de la tétrada oscura se sitúan generalmente entre 2 y 3 sobre 5, sin perfiles extremos. En el PVQ-RR algunos modelos diferencian poco los diez valores y aparece una diferencia por pronombre especialmente visible en Achievement para DeBERTa. Frente a una referencia de estadounidenses políticamente moderados, los modelos ponderan más Authority, In-group Loyalty y Purity. En la escala GSDB todos enfatizan Uniformity y muestran poca Affirmation de identidades diversas. Estos son resultados descriptivos del método y las instantáneas elegidas, no pruebas de que los sistemas posean rasgos psicológicos ni de que las escalas sean válidas para máquinas. Los autores subrayan como agenda pendiente la fiabilidad, validez, estabilidad temporal, comparación entre idiomas, relación con conducta posterior, robustez adversarial y seguimiento de nuevas versiones. También advierten que la analogía con humanos es metafórica: los modelos son sistemas predictivos cuyos patrones lingüísticos pueden tener consecuencias reales al desplegarse, pero no comparten la vida mental, fisiología o contexto humano.

English

This perspective article defines “AI psychometrics” as the critical reuse of psychological inventories to diagnose noncognitive characteristics that language models express or mimic, and supports the proposal with demonstrations on open natural-language-inference models. Rather than eliciting free text from generative systems, it treats each inventory item as a premise and each verbal response option as a hypothesis, records entailment probabilities, selects the maximum-probability option, and aggregates items with the inventory's original scoring rules. Seven unique RoBERTa-, DeBERTa-, BERT-, and BART-family models are involved, with six English configurations and three German configurations. The instruments cover the Big Five, Dark Tetrad, Schwartz values, moral foundations, and beliefs about gender and sex diversity. English Big Five profiles are fairly homogeneous: high Agreeableness and Extraversion and low Neuroticism, with more variation in Openness and Conscientiousness; German profiles diverge more. Dark Tetrad scores generally fall between 2 and 3 on the five-point scale rather than at pathological extremes. On the PVQ-RR, some models barely differentiate the ten values, and DeBERTa shows the clearest pronoun-linked gap for Achievement. Relative to a published reference for politically moderate Americans, models place more weight on Authority, In-group Loyalty, and Purity. On the GSDB, all emphasize Uniformity and show weak Affirmation of gender-diverse identities. These are descriptive outputs of one method and set of snapshots, not evidence that models possess psychological traits or that human inventories are valid for machines. The authors identify reliability, validity, temporal stability, cross-language comparison, downstream behavior, adversarial robustness, and longitudinal monitoring as unresolved research needs. They also explicitly frame the human analogy as metaphorical: model language patterns can have real deployment consequences, but predictive systems do not share human mental life, physiology, or embodied context.

Pregunta de investigación

¿Cómo pueden reutilizarse inventarios psicométricos de rasgos no cognitivos como herramientas diagnósticas de LLM, qué revelan unas demostraciones mediante clasificación zero-shot y qué problemas conceptuales y de validez debe resolver la psicometría de IA?

Método

Artículo de perspectiva con demostraciones descriptivas. Cada ítem del inventario se introduce como premisa en modelos ajustados para inferencia de lenguaje natural; cada etiqueta verbal de la escala se prueba como hipótesis y se selecciona por argmax de la probabilidad de entailment. Las respuestas se puntúan con las reglas originales. Se comparan seis configuraciones en inglés y tres en alemán de siete modelos únicos, sin muestreo estocástico, participantes humanos ni pruebas inferenciales de validez o fiabilidad.

Muestra: Siete modelos únicos disponibles en Hugging Face; seis se evalúan en inglés y XLM-RoBERTa, multilingual DeBERTa y GBERT en alemán. Cada modelo responde una vez por probabilidad de entailment a todos los ítems aplicables; no hay personas participantes, repeticiones generativas ni muestra probabilística de modelos.

Hallazgos

  • Los seis perfiles Big Five en inglés son similares: Agreeableness y Extraversion altas, Neuroticism bajo y diferencias más visibles en Openness y Conscientiousness; los tres perfiles alemanes presentan mayor variación.
  • La mayoría de las puntuaciones de Machiavellianism, Narcissism, Psychopathy y Sadism quedan aproximadamente entre 2 y 3 sobre 5; DistilRoBERTa y BART destacan por Narcissism más alto, sin que el estudio encuentre perfiles extremos.
  • En el PVQ-RR, multilingual DeBERTa y BART diferencian poco los valores; DeBERTa asigna Achievement alto y muestra la mayor diferencia observada entre la versión con pronombres masculinos y femeninos.
  • Los modelos ponen más énfasis que la referencia moderada estadounidense en Authority-respect, In-group Loyalty y Purity-sanctity, fundamentos asociados en la literatura citada a orientaciones conservadoras.
  • En GSDB, todos los modelos enfatizan la uniformidad de personas del mismo género o sexo y muestran poca afirmación de la diversidad, incluido desacuerdo con varios enunciados de identidades no binarias.
  • El método evita la variación estocástica y el orden de ejemplos propio de algunos prompts generativos, pero los resultados se limitan a probabilidades de entailment de modelos NLI.

Limitaciones

  • El artículo es principalmente programático y las demostraciones son descriptivas: no calcula consistencia interna, test-retest, validez convergente, discriminante, factorial ni predictiva para las escalas aplicadas a modelos.
  • La selección está restringida a modelos encoder/NLI abiertos y excluye GPT-3, GPT-4 y ChatGPT; por tanto, no representa el funcionamiento de asistentes generativos ni de modelos autoregresivos en texto libre.
  • El argmax reduce cada distribución a una opción y no estudia incertidumbre, sensibilidad a formulación, contradicción entre instrumentos, variación por prompt o estabilidad entre ejecuciones y versiones.
  • Las comparaciones inglesa y alemana mezclan idioma, traducción, corpus y modelo; no permiten atribuir diferencias a cultura ni demostrar invariancia de medida.
  • Algunas comparaciones humanas usan referencias publicadas de grupos concretos, no una muestra humana recogida bajo el mismo protocolo, y las escalas se eligieron de forma ilustrativa.
  • No se comprueba si los perfiles predicen decisiones, generación de texto, uso de herramientas o daños en una aplicación real.

Qué no demuestra

  • No demuestra que los modelos tengan personalidad, valores, moralidad, creencias, motivaciones o experiencia subjetiva; los términos se usan de forma metafórica para patrones de salida.
  • No valida psicométricamente BFI, SD4, PVQ-RR, MFQ o GSDB para LLM ni hace equivalentes sus puntuaciones a las de personas.
  • No demuestra que un modelo sea políticamente conservador, transfóbico o dañino en general; identifica respuestas de estas configuraciones a instrumentos específicos.
  • No permite inferir que las diferencias entre versiones lingüísticas sean diferencias culturales ni que procedan de un componente concreto de los datos de entrenamiento.
  • No establece que modificar una puntuación psicométrica vaya a modificar de forma causal y segura la conducta posterior del modelo.

Modelos evaluados

  • XLM-RoBERTa large XNLI
  • DistilRoBERTa base MNLI
  • DeBERTa base MNLI
  • multilingual DeBERTa v3 base MNLI/XNLI
  • GBERT German zero-shot
  • BART large MNLI
  • DistilBART MNLI 12-1

Instrumentos y métricas

  • Big Five Inventory, 44-item English and 45-item German versions
  • Short Dark Tetrad, 28 items
  • Revised Portrait Values Questionnaire, 57 items and male/female pronoun versions
  • Moral Foundations Questionnaire
  • Gender/Sex Diversity Beliefs Scale
  • Zero-shot natural-language-inference entailment scoring

Datos utilizados

  • SNLI, MultiNLI and XNLI fine-tuning corpora underlying the selected models
  • Published human reference scores for selected inventories

Evidencia y localización

  • Tesis, definición metafórica y alcance de psicometría de IA: Paper, pp. 808–811, Abstract through Opportunities for Psychometric Assessment
  • Método zero-shot NLI y modelos incluidos: Paper, pp. 811–812 and 819–822, Figure 1, Appendix Methods and Table A1
  • Resultados Big Five y tétrada oscura: Paper, pp. 811–813 and 821, Figures 2 and A1
  • Valores, pronombres y fundamentos morales: Paper, pp. 813–815, Figures 3–4
  • Creencias sobre diversidad de género y sexo: Paper, pp. 816–817, Figure 5
  • Problemas abiertos de fiabilidad, estabilidad y conducta posterior: Paper, pp. 817–819, Open Challenges and Conclusions
  • Cautela contra antropomorfización y límites de la analogía: Paper, pp. 818–819, Conclusions