Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement

Revisiones, teoría y gobernanza2025arXivRevisión editorial aprobada

Autores: Haoran Ye, Jing Jin, Yuhang Xie, Xin Zhang, Guojie Song

Palabras clave: LLM Psychometrics, Systematic Review, Evaluation, Validation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
12
Hallazgos
15
Limitaciones
13
Evidencias

Resumen editorial

Español

Esta revisión construye un marco amplio para lo que denomina «psicometría de LLM»: aplicar instrumentos, teorías y principios de medición psicológica a los propios modelos para evaluar, interpretar y modificar sus patrones de conducta. Su precaución ontológica es esencial: personalidad, valores, moralidad o inteligencia se usan para describir manifestaciones sintéticas observables, no para afirmar experiencia subjetiva, conciencia o estados psicológicos humanos. El marco organiza la evaluación mediante tres preguntas, qué constructo medir, cómo medirlo y con qué validez, y añade una cuarta: cómo utilizar esa medición para mejorar el sistema.

El mapa cubre constructos no cognitivos, rasgos de personalidad, valores, moral y actitudes, y cognitivos, heurísticos, teoría de la mente, inteligencia emocional y social, psicolingüística, aprendizaje y razonamiento. Distingue tests estructurados, conversaciones abiertas y simulaciones de agentes; inventarios establecidos, ítems curados y datos sintéticos; prompting de personas, ayudas al rendimiento y perturbaciones adversarias; y puntuación cerrada, probabilística, léxica, humana o mediante otro modelo. En vez de asumir que una puntuación plausible es interpretable, dedica un bloque central a fiabilidad, validez de contenido, equivalencia de constructo, sesgos de respuesta, deseabilidad social, validez criterial y ecológica, estandarización y baremación.

La síntesis presenta evidencia heterogénea y a menudo contradictoria. Algunos modelos muestran alta consistencia interna o perfiles prosociales en cuestionarios, pero esos perfiles cambian con prompts, orden de opciones, idioma, formato, contexto y versión. Las respuestas directas pueden divergir de decisiones o conversaciones abiertas; los tests humanos pueden no recuperar la misma estructura factorial; y un acierto puede proceder de memorización o atajos en lugar del proceso cognitivo que el ítem pretende medir. La revisión recomienda instrumentos específicos para IA, estímulos no contaminados, variantes paralelas, documentación exacta de inferencia, análisis factorial e IRT, criterios externos y tareas ecológicas. También muestra cómo escalas o constructos se usan para steering, fine-tuning, recompensas de alignment y mejora social o cognitiva, aunque la eficacia general de esas intervenciones no se estima.

El documento es una referencia conceptual excepcionalmente extensa, 57 páginas y 412 entradas bibliográficas, pero su etiqueta de «systematic review» no queda respaldada por un método de revisión reproducible. No publica bases consultadas, consulta, fechas de búsqueda, criterios operativos completos, número de registros, deduplicación, cribado, extracción, diagrama PRISMA, evaluación de calidad o riesgo de sesgo. La Tabla 2 asigna modelos «supporting» o «contradicting» a conclusiones narrativas sin ponderar diseño, tamaño, dependencia, incertidumbre o calidad psicométrica. El repositorio aporta una lista útil, pero no un corpus estructurado ni el historial de inclusión; carece de licencia y su PDF embebido es una versión antigua de mayo de 2025, mientras el texto revisado es v3 de marzo de 2026. Por ello, la obra sirve como tratado y taxonomía crítica de alto valor, no como prueba exhaustiva, metaanálisis ni estimación imparcial del consenso del campo.

English

This review builds a broad framework for what it calls “LLM Psychometrics”: applying psychometric instruments, theories, and measurement principles to models themselves in order to evaluate, interpret, and modify their behavioral patterns. Its ontological caution is essential. Personality, values, morality, or intelligence describe observable synthetic manifestations, not claims of subjective experience, consciousness, or human psychological states. The framework organizes evaluation around three questions, what construct to measure, how to measure it, and how well the result is validated, and adds a fourth: how measurement can inform system improvement.

The map covers non-cognitive constructs, personality traits, values, morality, and attitudes, and cognitive constructs, heuristics, theory of mind, emotional and social intelligence, psycholinguistics, learning, and reasoning. It distinguishes structured tests, open-ended conversations, and agentic simulations; established inventories, curated items, and synthetic data; persona prompts, performance-enhancing prompts, and adversarial perturbations; and closed, probabilistic, lexical, human, or model-based scoring. Rather than assuming that a plausible score is interpretable, a central section addresses reliability, content validity, construct equivalence, response sets, social desirability, criterion and ecological validity, standardization, and norming.

The synthesis reports heterogeneous and often contradictory evidence. Some models show high internal consistency or prosocial profiles on questionnaires, but those profiles shift with prompts, option order, language, format, context, and model version. Direct self-reports can diverge from decisions or open conversations; human instruments may not recover the same factor structure; and correct answers may arise from memorization or shortcuts rather than the cognitive process an item is intended to measure. The review recommends AI-specific instruments, uncontaminated stimuli, parallel forms, exact inference reporting, factor analysis and IRT, external criteria, and ecological tasks. It also maps how scales or constructs are used for steering, fine-tuning, alignment rewards, and social or cognitive enhancement, although it does not estimate the general effectiveness of those interventions.

The document is an exceptionally extensive conceptual reference, 57 pages and 412 bibliography entries, but its “systematic review” label is not supported by a reproducible review method. It reports no searched databases, query, search dates, complete operational criteria, record counts, deduplication, screening, extraction process, PRISMA flow, quality appraisal, or risk-of-bias assessment. Table 2 assigns “supporting” or “contradicting” models to narrative findings without weighting design, sample size, dependence, uncertainty, or psychometric quality. The repository provides a useful reading list but not a structured corpus or inclusion history; it has no license, and its embedded PDF is an older May 2025 version while the reviewed text is v3 from March 2026. The work is therefore a valuable critical treatise and taxonomy, not an exhaustive evidence base, meta-analysis, or unbiased estimate of field consensus.

Pregunta de investigación

¿Cómo pueden los instrumentos y principios psicométricos reorganizar la evaluación de LLM, desde constructos psicológicos y metodología hasta validación, y cómo pueden esas mediciones orientar el control, el alignment y la mejora de los modelos?

Método

Síntesis narrativa de literatura agrupada en: diferencias entre psicometría y benchmarking; constructos de personalidad y cognición; formatos, datos, prompts, outputs y scoring; fiabilidad y validez; enhancement; tendencias y ética. El alcance declarado incluye trabajos que tratan al LLM como sujeto y emplean instrumentos o principios psicométricos, incluso los que solo administran escalas y reportan puntuaciones; excluye el uso del LLM como herramienta para medir personas y benchmarks puramente escalares. No se documenta cómo se buscó, seleccionó, extrajo o valoró la literatura. La revisión editorial leyó las 35 páginas de contenido, comprobó las 22 páginas de referencias, el sitio oficial, la versión arXiv v3 y el repositorio curado.

Muestra: No hay muestra de modelos ni participantes analizada directamente. La bibliografía enumera 412 referencias y el texto sintetiza familias de estudios publicadas principalmente hasta 2025, pero esas 412 entradas incluyen fundamentos, instrumentos, blogs, surveys y trabajos empíricos; no equivalen a 412 estudios incluidos. El manuscrito no informa el tamaño del corpus de revisión, registros identificados o excluidos, idiomas, bases, ventana temporal ni distribución por constructo. La lista pública contiene cientos de enlaces y duplicados entre etiquetas, pero no ofrece IDs, metadatos normalizados o decisiones de inclusión.

Hallazgos

  • La psicometría busca definir y validar constructos latentes, calidad de ítems, fiabilidad y poder predictivo; el benchmarking de IA suele priorizar amplitud, dificultad, ranking y métricas agregadas de tarea.
  • La unidad legítima de interpretación propuesta es la manifestación conductual sintética en outputs, no una atribución de conciencia, experiencia subjetiva o psicología humana interna.
  • El campo cubre personalidad, valores, moral y opiniones, junto con sesgos, cognición social, lenguaje, aprendizaje y razonamiento; cada constructo produce resultados dependientes del modelo y protocolo.
  • Los tests estructurados son escalables y estandarizables pero sufren contaminación, sesgos de respuesta y baja ecología; conversaciones y simulaciones ganan realismo a costa de scoring, control y reproducibilidad.
  • El mismo LLM puede tratarse como individuo, como población inducida mediante perfiles o mediante un enfoque híbrido de variaciones del mismo test; cada elección mide un objeto distinto y exige validación distinta.
  • Alta consistencia interna no basta: la fiabilidad varía entre repetición, formas paralelas, idiomas, orden de opciones, jueces, ataques y formatos, y la validez del modelo factorial puede fallar.
  • La equivalencia humano–LLM no puede asumirse. Big Five, HEXACO y sistemas humanos de valores pueden no recuperar las mismas dimensiones; surgen propuestas AI-native, pero tampoco convergen aún en una estructura única.
  • Aquiescencia, posición de opciones, extremos de escala y deseabilidad social pueden generar perfiles aparentemente coherentes sin que el contenido del ítem determine la respuesta.
  • Puntuaciones de self-report divergen con frecuencia de conversaciones, decisiones o tareas downstream, lo que hace insuficiente la validez de criterio y ecológica de gran parte de la literatura.
  • IRT, factor analysis, generación procedimental de ítems, formas paralelas, estímulos nuevos y normas explícitas ofrecen vías para medir mejor dificultad, discriminación, contaminación, robustez y comparabilidad.
  • La psicometría se usa para controlar rasgos, diseñar señales de reward, orientar alignment y mejorar empatía o razonamiento, pero esas líneas siguen tempranas y no existe una estimación general de beneficio o coste.
  • Estandarización y baremación permanecen abiertas: no hay población de referencia estable para modelos que cambian rápidamente y cuyos perfiles dependen del prompt.

Limitaciones

  • El manuscrito se denomina revisión sistemática, pero no informa bases de datos, cadenas de búsqueda, fechas, criterios completos, registros, duplicados, revisores, extracción, PRISMA ni protocolo preregistrado.
  • No hay evaluación de calidad, certeza, riesgo de sesgo o estado de peer review; estudios exploratorios, preprints, benchmarks y trabajos con validación rigurosa se sintetizan en el mismo nivel narrativo.
  • Las 412 referencias no constituyen un corpus identificable de estudios incluidos: mezclan literatura empírica, teoría psicométrica, instrumentos, surveys, comentarios, páginas web y trabajos de contexto.
  • La Tabla 2 usa listas de modelos supporting/contradicting como sustituto de síntesis de evidencia, sin distinguir estudios independientes, múltiples mediciones del mismo trabajo, tamaño, versión, prompt, inferencia o incertidumbre.
  • No hay metaanálisis, tamaños de efecto, intervalos, sensibilidad, análisis de heterogeneidad o sesgo de publicación; «evidencia convergente» y «consistentemente» son juicios editoriales no cuantificados.
  • Comparar modelos por familia o tamaño confunde fecha, datos de entrenamiento, post-training, políticas de producto, parámetros de inferencia y selección del instrumento. No permite atribuir causalmente perfiles más prosociales o mayor alignment al escalado.
  • Expresiones como «desirable human values» requieren una posición normativa y población de referencia; el review reconoce pluralismo cultural, pero algunas síntesis reducen esa diversidad a una dirección deseable única.
  • La sección de personalidad afirma validez psicométrica para modelos avanzados apoyándose en estudios concretos, mientras otros trabajos reseñados encuentran estructuras factoriales inválidas; el alcance de la afirmación debería quedar limitado a protocolos específicos.
  • El marco agrupa constructos, capacidades y fenómenos diferentes bajo psicometría de LLM. La relación entre un patrón estadístico de output, un mecanismo interno y una utilidad downstream continúa sin resolver.
  • El scoring por otro LLM puede compartir sesgos, errores o preferencias con el sistema evaluado; acuerdo entre jueces-modelo no equivale automáticamente a validez humana o externa.
  • Los resultados humanos usados como normas pueden no ser comparables por idioma, cultura, modo de administración y consentimiento; la propia revisión reconoce contaminación, copyright y reutilización secundaria de datos.
  • La actualización rápida de modelos vuelve caducas muchas conclusiones. La versión v3 es de marzo de 2026, pero la bibliografía llega principalmente a 2025 y no define una fecha de corte.
  • La lista pública no incluye un archivo bibliográfico estructurado, trazabilidad de búsquedas, decisions de inclusión, hashes o QA de enlaces; contiene entradas repetidas entre categorías y carece de licencia.
  • El PDF incluido en el repositorio se creó en mayo de 2025 y no coincide con la versión arXiv v3 revisada; el último commit auditado es de noviembre de 2025.
  • El documento revisado es un preprint arXiv; el manuscrito y el sitio no identifican una publicación final revisada por pares.

Qué no demuestra

  • No demuestra que los LLM posean personalidad, valores, moral, inteligencia o teoría de la mente como estados psicológicos humanos internos.
  • No demuestra que los constructos humanos sean equivalentes en máquinas; precisamente identifica la equivalencia como hipótesis que debe probarse.
  • No demuestra que una puntuación alta, un alfa alto o una respuesta correcta sean válidos sin estructura, proceso, robustez y criterio externo adecuados.
  • No establece un perfil psicológico universal de los LLM: los resultados dependen de familia, snapshot, prompt, formato, idioma, muestreo y contexto.
  • No prueba que modelos mayores o más recientes sean intrínsecamente más morales, seguros o representativos; las comparaciones observacionales están confundidas.
  • No demuestra que el role-playing genere una población humana válida ni que variación inducida por prompts equivalga a diferencias individuales reales.
  • No prueba que los sistemas AI-native propuestos midan una ontología definitiva; diferentes métodos descubren estructuras distintas y dependientes de las tareas.
  • No demuestra que intervenciones psicométricas mejoren causalmente seguridad, alineación o cognición de forma general ni que carezcan de trade-offs.
  • No permite rankear modelos entre estudios heterogéneos ni aplicar normas humanas a puntuaciones de LLM sin una validación de equivalencia.
  • No constituye una búsqueda exhaustiva o reproducible de toda la literatura pese a su etiqueta de revisión sistemática.
  • No establece consenso científico sobre sentiencia, comprensión, cognición o humanidad de los modelos.
  • No demuestra que la psicometría por sí sola resuelva la evaluación de sistemas multimodales, agentes o interacciones reales de alto riesgo.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2505.08245v3 (11 Mar 2026), 57 pages; official project website reviewed; public collection commit e06a725d195ac6d655fff8d25580b49004b61d15 audited

Fuente consultada: https://arxiv.org/pdf/2505.08245

Revisión: Codex editorial review and methods/artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • No model is evaluated directly by the review
  • OpenAI GPT-2, GPT-3, GPT-3.5, GPT-4, GPT-4o, o1 and o3 families across cited studies
  • Meta Llama and Llama 2/3/3.1/3.3 families across cited studies
  • Anthropic Claude families across cited studies
  • Google PaLM, Gemini, Gemma and Bard families across cited studies
  • Mistral and Mixtral families across cited studies
  • Qwen, Yi, DeepSeek, Baichuan, ChatGLM, Falcon, Phi and other open model families
  • Multimodal, agentic and multi-agent systems covered conceptually

Instrumentos y métricas

  • Big Five inventories: NEO-PI-R, BFI and BFI-2
  • HEXACO-60 and HEXACO-100
  • Dark Triad Dirty Dozen and MBTI
  • Schwartz Value Survey, Portrait Values Questionnaire and World Values Survey
  • Hofstede VSM, GLOBE and Social Value Orientation
  • Moral Foundations Questionnaire, Moral Foundations Vignettes and Defining Issues Test
  • ANES, ATP, GLES, Political Compass and other opinion surveys
  • Cognitive Reflection Test, false-belief tasks, WAIS-IV, Raven matrices and ARC
  • Emotional and social intelligence scales and situational judgment tests
  • Cronbach's alpha, hierarchical omega, test-retest, parallel forms and inter-rater reliability
  • Factor analysis, structural equation modeling, measurement invariance and Item Response Theory
  • Content, procedural, construct, criterion, ecological and cross-lingual validity

Datos utilizados

  • No primary experimental dataset (literature review)
  • Bibliography containing 412 numbered references
  • Official Awesome-LLM-Psychometrics curated reading list
  • Established human psychometric inventories and normative datasets surveyed
  • Custom-curated and LLM-generated psychometric item sets surveyed
  • Open-ended dialogue, behavioral and agentic simulation benchmarks surveyed

Evidencia y localización

  • Versión, autoría, alcance y definición conductual de LLM Psychometrics: arXiv:2505.08245v3, abstract and section 1, pp. 1 and 4–6
  • Diferencias entre psicometría y benchmarking e integración de ECD, factor analysis e IRT: arXiv v3, sections 2–3, pp. 6–10
  • Taxonomía de constructos y síntesis de resultados por modelos: arXiv v3, section 4, Figures 1–2 and Tables 2–3, pp. 10–21
  • Rasgos, valores, moral y actitudes, con límites de estabilidad y self-report: arXiv v3, sections 4.1.1–4.1.4, pp. 15–17
  • Sesgos, cognición social, psicología del lenguaje y capacidades: arXiv v3, sections 4.2.1–4.2.4, pp. 18–21
  • Formatos, fuentes, prompting, scoring e inferencia: arXiv v3, section 5, Figures 3 and Tables 4–5, pp. 21–26
  • Fiabilidad, entidad frente a población y resultados contradictorios: arXiv v3, section 6.1 and Figure 4, pp. 26–28
  • Contenido, proceso, equivalencia, response sets, deseabilidad y validez ecológica: arXiv v3, sections 6.2–6.3, pp. 28–30
  • Trait manipulation, safety/alignment and cognitive enhancement: arXiv v3, section 7, pp. 30–31
  • Constructos AI-native, antropomorfización, IRT, estandarización y norming: arXiv v3, section 8, pp. 31–34
  • Consentimiento, copyright, sesgo y atribución antropomórfica: arXiv v3, section 9, p. 34
  • Bibliografía total y ausencia de sección de método de revisión sistemática: Full arXiv v3 manuscript: 412 numbered references; contents and sections 1–10 contain no search, screening or quality-appraisal protocol
  • Colección pública, falta de estructura/licencia y desalineación de versiones: GitHub valuebyte-ai/Awesome-LLM-Psychometrics commit e06a725d195ac6d655fff8d25580b49004b61d15; readme.md and assets/llm_psychometrics_review.pdf