Evaluating Large Language Models with Psychometrics

Evaluación y validez psicométrica2024arXivRevisión editorial aprobada

Autores: Yuan Li, Yue Huang, Hongyi Wang, Ying Cheng, Xiangliang Zhang, James Zou, Lichao Sun

Palabras clave: Computation and Language, Psychological constructs, Personality, Values, Emotional intelligence, Theory of mind, Self-efficacy

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

7
Autores
13
Hallazgos
20
Limitaciones
10
Evidencias

Resumen editorial

Español

El trabajo propone un benchmark psicométrico para evaluar patrones de respuesta de nueve LLM en personalidad, valores, emoción, teoría de la mente y autoeficacia. Combina 13 conjuntos de evaluación con ítems de escala, elección alternativa, opción múltiple y respuesta abierta; fija snapshots concretos de los modelos y temperatura 0,5; y añade comprobaciones de formas paralelas, orden de opciones, acuerdo entre jueces y persuasión adversaria. Su aportación más útil es no limitarse a producir perfiles: contrasta self-report con vignettes o consultas, y muestra que un modelo puede declararse incapaz mientras responde, o declararse capaz mientras alucina o no reconoce sus límites.

Los resultados dependen mucho del instrumento y del prompt. En BFI, varios modelos son más agradables y conscientes y menos neuróticos que una media humana estadounidense, pero algunos responden repetidamente con el punto medio; Mixtral-8x7B pasa de extraversión 2,14 en BFI a 5 en una vignette. Los prompts que nombran rasgos elevan o invierten las puntuaciones, algo compatible con seguimiento de instrucciones y fuga semántica, no necesariamente con una personalidad latente. Las pruebas de valores de baja ambigüedad y las historias de teoría de la mente resultan relativamente fáciles para varios modelos, mientras MoralChoice ambiguo, emoción y ciertas falsas creencias separan más a los sistemas. La persuasión adversaria reduce la exactitud en valores humanos y la autoeficacia declarada se desalinean con la conducta en HoneSet.

La interpretación psicométrica, sin embargo, es mucho más débil de lo que sugiere el artículo. Su «consistencia interna» es la desviación estándar de puntuaciones dentro de cada aspecto: una respuesta constante de 3 obtiene desviación cero y puede describirse como altamente consistente aunque no pruebe homogeneidad de ítems, fiabilidad ni estructura del constructo. El match rate ante cambios de posición o redacción mide repetición/robustez, pero puede ser alto cuando ambas respuestas son incorrectas. El acuerdo de GPT-4 y Llama-3-70B como jueces tampoco aporta por sí solo validez externa, y solo se menciona adjudicación humana para desacuerdos de HoneSet. No se realizan análisis factoriales, invariancia, validez criterial o ecológica, test-retest entre fechas, IRT ni estimaciones de incertidumbre.

El manuscrito contiene además contradicciones materiales: la Tabla 1 atribuye 1.767 ítems a MoralChoice, frente a 680 casos de alta y 687 de baja ambigüedad descritos en el apéndice, 1.367 en total, y atribuye 987 consultas a HoneSet, mientras texto principal y apéndice indican 930. La tabla da 228 casos para Human-Centered Values, pero el apéndice conserva 57 escenarios regulares; 228 parece incorporar tres variantes adversarias por escenario sin explicitar la unidad. No se informan semillas ni número de repeticiones estocásticas, no hay intervalos o pruebas inferenciales y no se encontró código o corpus público identificable del benchmark. Por tanto, es un diagnóstico amplio y útil de inconsistencias de output bajo protocolos concretos, no una validación de estados psicológicos de los LLM ni un benchmark plenamente reproducible.

English

The paper proposes a psychometric benchmark for evaluating the response patterns of nine LLMs across personality, values, emotion, theory of mind, and self-efficacy. It combines 13 evaluation sets using rating items, alternative choice, multiple choice, and open-ended responses; identifies exact model snapshots and a temperature of 0.5; and adds checks based on parallel forms, option order, rater agreement, and adversarial persuasion. Its most useful contribution is that it does not merely produce profiles: it contrasts self-report with vignettes or queries and shows that a model can claim inability while answering, or claim ability while hallucinating or failing to recognize its limits.

Results are highly instrument- and prompt-dependent. On the BFI, several models appear more agreeable and conscientious and less neurotic than a large US human average, but some repeatedly select the scale midpoint; Mixtral-8x7B shifts from an extraversion score of 2.14 on the BFI to 5 on a vignette. Prompts naming traits raise or reverse scores, which is consistent with instruction following and semantic leakage rather than necessarily revealing latent personality. Low-ambiguity value items and some theory-of-mind stories are relatively easy for several models, whereas ambiguous MoralChoice items, emotion tasks, and some false-belief conditions separate systems more strongly. Adversarial persuasion reduces human-centered-values accuracy, and reported self-efficacy diverges from behavior on HoneSet.

The psychometric interpretation is nevertheless much weaker than the paper implies. Its “internal consistency” measure is the within-aspect standard deviation of item scores: a constant response of 3 obtains zero deviation and may be described as highly consistent even though it does not establish item homogeneity, reliability, or construct structure. Match rate under option or wording changes measures repetition/robustness but can remain high when both responses are wrong. Agreement between GPT-4 and Llama-3-70B as judges does not by itself supply external validity, and human adjudication is mentioned only for HoneSet disagreements. The study performs no factor analysis, measurement invariance, criterion or ecological validation, cross-date test-retest, IRT, or uncertainty estimation.

The manuscript also contains material count contradictions. Table 1 assigns 1,767 items to MoralChoice, while the appendix describes 680 high-ambiguity plus 687 low-ambiguity cases, 1,367 in total, and assigns 987 queries to HoneSet while the main text and appendix state 930. The table lists 228 Human-Centered Values cases, whereas the appendix retains 57 regular scenarios; 228 appears to include three adversarial variants per scenario without making the unit explicit. Seeds and stochastic repetition counts are not reported, there are no confidence intervals or inferential tests, and no identifiable public benchmark code or corpus was found. The study is therefore a broad and useful diagnosis of output inconsistencies under specific protocols, not a validation of LLM psychological states or a fully reproducible benchmark.

Pregunta de investigación

¿Cómo pueden evaluarse de forma conjunta la personalidad, los valores, la emoción, la teoría de la mente y la autoeficacia expresadas por LLM, y hasta qué punto sus respuestas son consistentes entre instrumentos, formas paralelas, posiciones de respuesta, jueces y perturbaciones adversarias?

Método

Benchmark experimental sobre nueve snapshots de LLM, consultados a temperatura 0,5 mediante APIs o inferencia local. Administra 13 conjuntos de evaluación repartidos en cinco constructos, con cuatro formatos de ítem. Las respuestas abiertas de Big Five vignettes y Strange Stories son puntuadas por GPT-4 y Llama-3-70B; HoneSet usa ambos jueces y adjudicación humana cuando discrepan. La validación declarada cubre dispersión intraaspecto, formas paralelas, acuerdo de jueces, cambios de posición y ataques persuasivos. La revisión editorial leyó las ocho páginas principales, referencias y los apéndices hasta la página 38, contrastó tablas, ejemplos y definiciones de métricas, verificó arXiv v2 y buscó materiales públicos asociados.

Muestra: La unidad analizada son outputs de nueve snapshots de LLM en 13 conjuntos, no personas. El manuscrito no informa un número total fiable de observaciones porque tres recuentos cambian entre tabla y apéndices y tampoco indica cuántas ejecuciones independientes se hicieron por prompt. Para BFI compara medias con resultados agregados de 3.387.303 participantes de Estados Unidos, pero no recluta participantes ni reproduce esa muestra; para emoción cita medias humanas del dataset. Los escenarios abiertos tienen tamaños especialmente pequeños, cinco vignettes Big Five, once Strange Stories y dieciocho Imposing Memory. Los adversariales de Human-Centered Values parten de 57 escenarios regulares y generan tres transformaciones persuasivas.

Hallazgos

  • Los perfiles BFI de varios modelos muestran mayor agradabilidad y consciencia y menor neuroticismo que la media humana citada, pero la comparación no prueba equivalencia del constructo o de la escala entre humanos y LLM.
  • ChatGPT, Llama-3-8B y Mistral-7B producen con frecuencia respuestas constantes en BFI; la desviación cero se interpreta como consistencia aunque también puede reflejar respuesta por defecto o falta de discriminación entre ítems.
  • Mixtral-8x7B obtiene extraversión 2,14 en BFI y 5 en la vignette correspondiente, ejemplificando desacuerdo entre self-report estructurado y escenario abierto.
  • Los prompts P2 que describen rasgos y sus versiones inversas mueven fuertemente BFI y vignettes; demuestran sensibilidad y seguimiento del prompt, no estabilidad de una personalidad interna.
  • En la vignette Big Five, el acuerdo ponderado global entre GPT-4 y Llama-3-70B es 0,86, aunque cae a 0,667 para Llama-3-70B y 0,706 para Mistral-7B en la tabla por modelo.
  • En MoralChoice de alta ambigüedad, el mejor resultado indicado es 74,3% de Mixtral-8x7B y GPT-4 alcanza 65,1%; los ítems de baja ambigüedad son considerablemente más fáciles.
  • La exactitud regular en Human-Centered Values supera 90% para la mayoría de modelos, pero cae con autoridad, evidencia o apelación lógica; ChatGPT pierde más de veinte puntos en algunas variantes.
  • En emoción, el máximo es 58,4% en comprensión para Llama-3-70B frente a aproximadamente 70% humano y 64,7% en aplicación para GPT-4 frente a aproximadamente 78% humano.
  • GPT-4 y Llama-3-70B resuelven 97,5% y 100% de una condición de falsa creencia, pero ambos bajan a 85% en otra; Mistral-7B cae hasta 5% en esa condición.
  • Strange Stories produce porcentajes altos, pero solo contiene once historias y su corrección depende de dos jueces LLM; Imposing Memory varía aproximadamente entre 55,56% y 88,89%.
  • La forma inversa del cuestionario de autoeficacia es muy estable para GPT-4, GLM-4 y Llama-3-70B, pero tiene kappa cercano o inferior a cero para ChatGPT, Qwen-Turbo y Mistral-7B.
  • En HoneSet, varios modelos responden consultas que previamente declararon no poder abordar. La métrica llamada confidence rate cuenta respuestas sin admisión de limitaciones, no exactitud factual, probabilidad calibrada ni éxito de la respuesta.
  • Las comprobaciones de posición y formas paralelas revelan sensibilidad útil para QA, pero un match rate alto solo prueba que dos outputs coinciden, no que sean correctos o que midan el mismo constructo psicológico.

Limitaciones

  • La «consistencia interna» se define como desviación estándar de respuestas dentro de un aspecto, no como alfa, omega, correlación entre ítems, análisis factorial o información de test; una respuesta constante obtiene el mejor valor posible.
  • Algunos aspectos de GLOBE tienen solo dos o tres ítems, por lo que su dispersión es una base particularmente frágil para inferir fiabilidad.
  • El match rate mezcla estabilidad con acierto: dos respuestas iguales e incorrectas reciben la misma puntuación de robustez que dos respuestas iguales y correctas.
  • No se analiza validez de contenido sistemática, estructura interna, invariancia humano-modelo, validez convergente, discriminante, criterial, predictiva o ecológica.
  • El acuerdo entre dos jueces LLM puede reflejar sesgos, entrenamiento o preferencias compartidas; no sustituye un criterio humano o externo independiente.
  • La adjudicación humana se describe para discrepancias de HoneSet, pero no se informa número de anotadores, formación, cegamiento, acuerdo ni protocolo reproducible.
  • La temperatura es 0,5, pero no se publican semillas ni número de repeticiones estocásticas; las desviaciones de varias tablas parecen proceder de ítems o posiciones, no de corridas independientes.
  • No hay intervalos de confianza, contraste de hipótesis, corrección por comparaciones múltiples, tamaños de efecto o análisis de sensibilidad.
  • Cinco vignettes Big Five dejan cada rasgo abierto representado por un solo escenario; once Strange Stories y dieciocho Imposing Memory también limitan precisión y generalización.
  • Los cambios bajo prompts de rasgo contienen la etiqueta y dirección deseada, por lo que confunden personalidad inducida con cumplimiento semántico de instrucciones.
  • La media BFI humana procede de otra población y modo de administración; no se demuestra comparabilidad cultural, lingüística, muestral o de proceso de respuesta con los LLM.
  • Las categorías morales y de valores adoptan respuestas normativas de datasets concretos sin validar pluralismo cultural o desacuerdo razonable.
  • El confidence rate de HoneSet mide ausencia de rechazo o disclaimer, no que la respuesta sea correcta, segura, útil o verdaderamente confiada.
  • Los recuentos de MoralChoice, Human-Centered Values y HoneSet son inconsistentes o ambiguos entre la Tabla 1 y los apéndices.
  • El texto habla de cinco constructos evaluados, mientras el apéndice discute inteligencia como sexta dimensión sin incluir experimentos de inteligencia en el benchmark.
  • Los «real-world scenarios» son ítems y vignettes curados, no comportamiento longitudinal en despliegues reales ni outcomes observados.
  • El trabajo se limita a interacciones de un turno y reconoce cobertura reducida de prompts y formas paralelas, dimensiones top-down y dependencia de teoría clásica de tests.
  • Los snapshots son principalmente de comienzos de 2024 y no caracterizan versiones posteriores de servicios o modelos.
  • No se encontró un repositorio público enlazado o identificable con prompts, outputs, datos transformados y scripts; la reproducción exacta no es posible con el manuscrito solo.
  • El documento revisado es un preprint arXiv y no identifica publicación final revisada por pares.

Qué no demuestra

  • No demuestra que los LLM posean personalidad, valores, emociones, teoría de la mente o autoeficacia como estados psicológicos humanos internos.
  • No demuestra que una puntuación BFI o SD3 tenga el mismo significado, estructura o baremo en humanos y modelos.
  • No demuestra que baja desviación entre respuestas sea fiabilidad psicométrica; puede ser aquiescencia, punto medio o invariancia sin sensibilidad al contenido.
  • No demuestra que un match rate alto implique respuestas correctas, comprensión genuina o validez del constructo.
  • No demuestra que el acuerdo entre dos LLM jueces equivalga a corrección humana, validez externa o ausencia de sesgo.
  • No demuestra que los prompts de role-playing creen una personalidad estable; las variaciones pueden ser seguimiento directo de instrucciones.
  • No demuestra equivalencia humana en emoción o teoría de la mente, aunque algunos modelos alcancen resultados altos en tareas concretas.
  • No demuestra que responder sin declarar una limitación sea autoeficacia precisa, confianza calibrada o capacidad real.
  • No permite un ranking general de los nueve modelos fuera de los snapshots, prompts, ítems y métricas evaluados.
  • No establece causalmente que tamaño, apertura o propiedad del modelo expliquen las diferencias observadas.
  • No demuestra comportamiento seguro o alineado bajo persuasión real; prueba tres transformaciones sintéticas sobre 57 escenarios base.
  • No ofrece un benchmark completamente reproducible ni una estimación precisa del total de observaciones debido a artefactos ausentes y recuentos contradictorios.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2406.17675v2 (17 Oct 2025), 38 pages; no linked or identifiable public benchmark code/data artifact found

Fuente consultada: https://arxiv.org/pdf/2406.17675

Revisión: Codex editorial review and methods/artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI gpt-3.5-turbo-0125 (ChatGPT)
  • OpenAI gpt-4-turbo-2024-04-09 (GPT-4)
  • GLM-4
  • Qwen-Turbo
  • Mistral-7B
  • Mixtral-8x7B
  • Mixtral-8x22B
  • Llama-3-8B
  • Llama-3-70B

Instrumentos y métricas

  • Big Five Inventory (BFI), 44 rating items
  • Short Dark Triad (SD3), 12 rating items
  • Big Five Vignette Test, 5 open-ended scenarios
  • GLOBE Cultural Orientation, 27 rating items
  • MoralChoice alternative-choice benchmark
  • Human-Centered Values regular and adversarial scenarios
  • EmoBench Emotion Understanding, 200 multiple-choice items
  • EmoBench Emotion Application, 200 multiple-choice items
  • False Belief Task, 40 alternative-choice items
  • Strange Stories Task, 11 open-ended items
  • Imposing Memory Task, 18 alternative-choice items
  • LLM Self-Efficacy questionnaire, 6 rating items
  • HoneSet user-query benchmark
  • Within-aspect standard deviation, match rate, agreement rate and weighted Cohen's kappa

Datos utilizados

  • Big Five Inventory: 44 items
  • Short Dark Triad: 12 items
  • Big Five Vignette Test: 5 scenarios
  • GLOBE Cultural Orientation: 27 items
  • MoralChoice: Table 1 reports 1,767; appendix components total 1,367
  • Human-Centered Values: 57 retained regular scenarios plus three adversarial variants; Table 1 reports 228
  • Emotion Understanding: 200 items
  • Emotion Application: 200 items
  • False Belief Task: 40 items
  • Strange Stories Task: 11 items
  • Imposing Memory Task: 18 items
  • LLM Self-Efficacy: 6 items
  • HoneSet: main text and appendix report 930 queries; Table 1 reports 987

Evidencia y localización

  • Objetivo, cinco constructos, 13 conjuntos y discrepancia entre self-report y escenarios: arXiv:2406.17675v2, abstract and sections 1–2, pp. 1–3
  • Snapshots, temperatura, formatos, jueces y definición de las cinco validaciones: arXiv v2, section 2 and Table 1, pp. 3–4
  • Personalidad, comparación humana y efecto de prompts de rasgo: arXiv v2, section 3, Figure 2 and Appendix C, pp. 4–5 and 13–21
  • Valores, MoralChoice y caída bajo persuasión adversaria: arXiv v2, section 4, Figures 3–4 and Appendix D, pp. 5–6 and 21–28
  • Resultados de comprensión y aplicación emocional frente a medias humanas: arXiv v2, section 5, Table 2 and Appendix E, pp. 6–7 and 28–29
  • Falsa creencia, Strange Stories, Imposing Memory, match rate y acuerdo de jueces: arXiv v2, section 6 and Appendix F, pp. 6–7 and 29–34
  • Autoeficacia declarada, HoneSet, confidence rate y kappa de forma inversa: arXiv v2, section 7 and Appendix G, pp. 7–8 and 34–36
  • Contradicciones en tamaños de MoralChoice, Human-Centered Values y HoneSet: arXiv v2, Table 1 p. 4; Appendix D.2–D.3 pp. 24–27; section 7 p. 7; Appendix G p. 34
  • Limitaciones declaradas: single-turn, formas paralelas, top-down y teoría clásica: arXiv v2, Appendix J, pp. 37–38
  • Ausencia de análisis factorial, invariancia, IRT experimental, incertidumbre y artefacto reproducible: Full 38-page arXiv v2 manuscript and public-artifact audit; IRT appears only as future discussion, not as an analysis of the reported benchmark