Is Machine Psychology here? On Requirements for Using Human Psychological Tests on Large Language Models

Revisiones, teoría y gobernanza2024ACL AnthologyRevisión editorial aprobada

Título original: Is Machine Psychology Here? On the Requirements for Using Human Psychological Tests on LLMs

Autores: Lea Löhn, Niklas Kiehne, Alexander Ljapunov, Wolf-Tilo Balke

Palabras clave: Large Language Models, Psychological Assessment, Machine Psychology, Test Reliability, Construct Validity

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
13
Hallazgos
19
Limitaciones
15
Evidencias

Resumen editorial

Español

Löhn, Kiehne, Ljapunov y Balke no ejecutan un nuevo test de personalidad sobre modelos: construyen un marco normativo para juzgar si es legítimo trasladar tests psicológicos humanos a LLM. A partir de los Standards for Educational and Psychological Testing y las International Guidelines for Test Use formulan siete requisitos: fiabilidad para el uso previsto (R1), validez para ese uso (R2), adecuación al tipo de examinado (R3), no divulgación o contaminación del material (R4), validez en cada modelo comparado (R5a), validez de las traducciones (R5b) y uso transparente y reproducible del test (R5c). El mérito central es separar obtener una respuesta repetible de justificar la interpretación del score: un sistema puede contestar siempre igual y aun así no medir el constructo humano que se le atribuye.

Para mostrar la utilidad del marco, revisan 25 trabajos localizados mediante búsquedas por palabras clave en Google Scholar, Scopus y DBLP hasta octubre de 2023, ampliadas siguiendo redes de citas. El conjunto cubre 12 constructos y 34 tests o evaluaciones; 20 estudios incluyen GPT-3 o una versión posterior y 17 de esos 20 no estudian otra familia. Los cuatro autores califican conjuntamente cada paper con una escala ordinal: no aplicable, no abordado, discutido, esfuerzo o estudio sin evidencia de cumplimiento, y cualquier evidencia de cumplimiento. La propia regla es deliberadamente benévola: la categoría superior reconoce alguna evidencia de una forma de fiabilidad o validez, no una validación completa, y no valora si esa evidencia es suficiente.

La tabla revela una brecha amplia. Para R1, solo 6 de 25 estudios aportan alguna evidencia de fiabilidad; para R2, 3 aportan alguna evidencia de validez. R3 parece mejor atendido, pero los 13 casos superiores se benefician de una definición débil que considera adecuado un formato textual compatible. Solo 1 estudio alcanza la categoría superior en R4. De los 10 trabajos comparativos a los que se aplica R5a, solo Serapio-García et al. presenta evidencia; R5b se aplica a dos trabajos y solo Pellert et al. utiliza traducciones ya validadas. Únicamente 2 de 25 cumplen plenamente el criterio de transparencia R5c. Nueve estudios modifican o reformulan tests para reducir contaminación, pero solo Coda-Forno et al. aporta evidencia de que la modificación conserva resultados. Ningún trabajo aporta evidencia para todos sus requisitos aplicables.

El diagnóstico es valioso como lista de control y como advertencia contra antropomorfizar scores sin una cadena de validación. No es, sin embargo, una revisión sistemática reproducible ni un estándar validado. No se publican cadenas de búsqueda, flujo de selección, criterios de exclusión, hoja de codificación, extractos de evidencia, acuerdo entre evaluadores o artefactos; la clasificación se decide en reuniones conjuntas. Tampoco hay umbrales operativos para decidir cuánta evidencia basta. Algunas exigencias son demasiado absolutas o estrechas: demostrar ausencia de contaminación suele ser imposible en modelos propietarios, la «adecuación» no se reduce a aceptar texto y la sección de fairness omite sesgo entre grupos, accesibilidad y daño. El artículo establece que la literatura temprana revisada documentaba insuficientemente sus inferencias bajo este marco; no prueba que todas sus conclusiones fueran falsas ni que los constructos humanos no puedan adaptarse mediante validación específica.

English

Löhn, Kiehne, Ljapunov, and Balke do not run a new personality test on models. They construct a normative framework for deciding whether human psychological tests can legitimately be transferred to LLMs. Drawing on the Standards for Educational and Psychological Testing and the International Guidelines for Test Use, they formulate seven requirements: reliability for the intended use (R1), validity for that use (R2), suitability for the test taker (R3), non-disclosure or contamination control for test materials (R4), validity for every model being compared (R5a), validity of translations (R5b), and transparent, reproducible test use (R5c). The central contribution is to separate repeatable responding from justified score interpretation: a system may always return the same answer while still failing to measure the human construct attributed to it.

To illustrate the framework, the authors review 25 studies found through keyword searches in Google Scholar, Scopus, and DBLP up to October 2023, followed by citation-network tracing. The sample covers 12 constructs and 34 tests or assessments. Twenty studies include GPT-3 or a later version, and 17 of those 20 examine no other model family. All four authors jointly rate each paper on an ordinal scale: not applicable, not addressed, discussed, an appropriate effort or study without supporting evidence, and any evidence of fulfillment. The rule is intentionally lenient: the top category recognizes some evidence for one form of reliability or validity rather than complete validation, and evidence sufficiency is not judged.

The table shows a substantial evidence gap. For R1, only 6 of 25 studies provide any reliability evidence; for R2, only 3 provide any validity evidence. R3 appears better covered, but its 13 top-rated cases benefit from a weak operational rule that treats a compatible text format as suitable. Only one study reaches the top category for R4. Among the ten comparative studies to which R5a applies, only Serapio-García et al. provides evidence. R5b applies to two studies, and only Pellert et al. uses already validated translations. Just 2 of 25 fully meet R5c. Nine studies modify or rephrase tests to reduce contamination, but only Coda-Forno et al. supplies evidence that the modification preserves results. No study provides evidence for every applicable requirement.

The diagnosis is useful as a checklist and as a warning against anthropomorphizing scores without a validation chain. It is not, however, a reproducible systematic review or a validated standard. The paper releases no search strings, selection flow, exclusion criteria, coding sheet, evidence excerpts, coder agreement, or artifact; ratings are decided in joint meetings. It also supplies no operational threshold for how much evidence is enough. Some requirements are overly absolute or narrow: proving absence of contamination is often impossible for proprietary models, suitability is not equivalent to accepting text, and the fairness section omits subgroup bias, accessibility, and harm. The paper establishes that the reviewed early literature incompletely documented its inferences under this framework. It does not establish that every substantive conclusion was false or that human constructs can never be adapted through model-specific validation.

Pregunta de investigación

¿Qué requisitos derivados de la teoría y las normas de evaluación psicológica deberían cumplirse al aplicar tests humanos a LLM, y en qué medida los satisface una muestra de 25 estudios tempranos de machine psychology?

Método

Trabajo conceptual con revisión narrativa de demostración. Los autores derivan R1–R5c de dos cuerpos normativos de evaluación y test use, buscan literatura mediante keywords en Google Scholar, Scopus y DBLP hasta octubre de 2023, amplían el conjunto siguiendo citas y retienen 25 papers. Los cuatro autores valoran conjuntamente cada requisito aplicable en reuniones y publican una matriz ordinal por estudio. La auditoría editorial leyó y renderizó las 13 páginas, reconstruyó los conteos de la Tabla 1, verificó las Tablas 2–3 y buscó sin encontrar una hoja de codificación, datos o código públicos asociados.

Muestra: La unidad de análisis es el paper, no una persona ni una salida nueva de modelo. La muestra contiene 25 publicaciones de junio de 2022 a septiembre de 2023 según el texto, aunque la tabla final incorpora Pellert et al. (2024). Abarca cognición, personalidad, valores, moralidad, sesgos de decisión, bienestar y ansiedad. Veinte trabajos incluyen GPT-3 o posterior y 17 de ellos no comparan otra familia. Los requisitos R5a y R5b solo se puntúan cuando hay varios modelos o idiomas, respectivamente.

Hallazgos

  • Los siete requisitos propuestos son R1 fiabilidad, R2 validez, R3 adecuación, R4 control de divulgación/contaminación, R5a validez por modelo, R5b validez de traducción y R5c transparencia del uso del test.
  • La matriz editorialmente reconstruida da para R1: 6 con evidencia, 6 con esfuerzo sin evidencia, 7 discutidos y 6 no abordados.
  • Para R2: 3 con evidencia, 4 con estudio sin evidencia suficiente, 13 discutidos y 5 no abordados.
  • Para R3: 13 con evidencia y 12 con esfuerzo sin evidencia; el resultado depende de considerar compatible un formato de entrada/salida textual.
  • Para R4: 1 con evidencia, 8 con esfuerzo sin evidencia, 7 discutidos y 9 no abordados.
  • R5a no aplica a 15 estudios; entre los 10 restantes hay 1 con evidencia, 1 con estudio sin evidencia, 1 discutido y 7 no abordados.
  • R5b no aplica a 23 estudios; Pellert et al. recibe evidencia por usar traducciones validadas y Stevenson et al. queda como discutido por no documentar suficientemente la traducción.
  • Para R5c: 2 con evidencia, 19 con esfuerzo sin cumplimiento completo, 2 discutidos y 2 no abordados.
  • Ninguno de los 25 estudios obtiene evidencia en todos los requisitos que le resultan aplicables, incluso con la regla de puntuación benévola.
  • Nueve de 25 modifican o generan material para reducir contaminación; solo Coda-Forno et al. aporta evidencia de correspondencia entre ítems originales y reformulados.
  • De los 10 estudios comparativos a los que se aplica R5a, solo Serapio-García et al. ofrece evidencia de validez por modelo y observa mejores resultados en modelos mayores e instruction-tuned.
  • Solo dos trabajos satisfacen R5c porque versiones propietarias no fijadas impiden reproducir una configuración aunque se publiquen parámetros o código.
  • El paper concluye que no existe una metodología consensuada en la muestra y que hacen falta constructos y procesos de validación específicos para LLM.

Limitaciones

  • Es una revisión narrativa y de prueba de concepto, no una revisión sistemática: no publica strings exactos, fechas por base, protocolo, criterios completos de inclusión/exclusión, flujo, duplicados ni lista de descartes.
  • La búsqueda se cierra en octubre de 2023 y cubre una etapa muy temprana; no representa el estado del campo en 2024 ni en 2026.
  • El rango declarado junio de 2022–septiembre de 2023 no encaja literalmente con Pellert et al. (2024) en la tabla final, probablemente una versión actualizada de un preprint, sin que se explique el corte bibliográfico.
  • Las valoraciones se deciden colectivamente en reuniones; no hay codificación independiente, cegamiento, acuerdo interevaluador, registro de desacuerdos ni adjudicación reproducible.
  • No se publica la hoja de extracción, justificación por celda, citas de evidencia, datos, código o suplemento; solo puede reconstruirse la matriz visible.
  • La categoría superior significa cualquier evidencia de una sola forma, no validación suficiente o completa; un lector puede sobreinterpretar el símbolo positivo.
  • Los siete requisitos no se validan mediante Delphi, expertos externos, estudio de usuarios o prueba de que discriminan investigaciones con conclusiones fiables.
  • No hay criterios operativos de aprobado, umbrales de evidencia, tamaños muestrales, orden de prioridad ni reglas de transferencia de validez entre versiones de un modelo.
  • R3 está operacionalizado de manera demasiado débil: que un test acepte texto no prueba adecuación de contenido, proceso de respuesta, constructo o interpretación para un LLM.
  • R4 formula como exigencia que el training data no contenga el material, algo normalmente no verificable en modelos propietarios; sería más operativo estimar riesgo, efecto y mitigaciones de contaminación.
  • La agrupación bajo fairness se limita a validez entre modelos, traducción y transparencia; no evalúa sesgo por grupos, impacto adverso, accesibilidad, diferencias culturales, DIF ni daños.
  • R5c es principalmente una exigencia de transparencia y reproducibilidad, no una medida directa de fairness.
  • La afirmación de que test–retest, formas alternativas y consistencia interna pueden aplicarse con independencia de la naturaleza del examinado simplifica supuestos sobre unidad, población, estabilidad y significado de los ítems.
  • Una generación determinista solo garantiza repetibilidad si todo el sistema permanece fijado; APIs alojadas, pesos, kernels o infraestructura pueden cambiar, y repetir una salida no equivale a medir bien.
  • La matriz ordinal no pondera consecuencias, calidad de evidencia, alcance ni número de instrumentos; todos los papers y requisitos cuentan igual.
  • La muestra mezcla constructos, paradigmas y tipos de publicación muy distintos, de forma que los conteos agregados son descriptivos y no una estimación poblacional.
  • No se analizan posibles conflictos, solapamiento entre autores revisados, sesgo de citación o dependencia introducida por citation-network tracing.
  • Exigir nueva validez para cada modelo es prudente, pero el trabajo no define cuándo una familia, actualización o configuración constituye un nuevo examinado ni qué evidencia puede transferirse.
  • El marco reconoce que no es exhaustivo y deja sin resolver constructos propios de LLM, procesos de respuesta desconocidos y la ambigüedad entre individuo y población.

Qué no demuestra

  • No demuestra que las conclusiones sustantivas de los 25 estudios sean falsas; muestra que su soporte de medición es incompleto según esta rúbrica.
  • No demuestra que un LLM posea o carezca de personalidad, cognición, ansiedad, valores o teoría de la mente.
  • No prueba que los tests psicológicos humanos nunca puedan adaptarse a modelos; exige redefinición y validación específicas.
  • No constituye una revisión exhaustiva de toda la literatura disponible ni una fotografía actual del campo.
  • No valida empíricamente que R1–R5c sean necesarios y suficientes para todas las aplicaciones de machine psychology.
  • No ofrece un estándar completo, certificación, checklist con pass/fail o procedimiento de auditoría reproducible.
  • No permite comparar cuantitativamente la calidad global de los 25 papers sumando símbolos ordinales.
  • No demuestra ausencia o presencia de contaminación en ningún modelo propietario concreto.
  • No establece que una respuesta determinista sea psicométricamente fiable más allá de su repetibilidad bajo una configuración fijada.
  • No cubre de forma suficiente fairness social, impactos sobre personas, accesibilidad ni uso de scores en decisiones de alto riesgo.
  • No resuelve si el objeto de medida es una instancia, una versión, una familia, una distribución de prompts o una población de ejecuciones.
  • No proporciona los datos necesarios para verificar de manera independiente por qué cada celda recibió su categoría.

Trazabilidad

Alcance: Texto completo

Versión: INLG 2024 final proceedings paper, pp. 230–242, DOI 10.18653/v1/2024.inlg-main.19; 13 pages including two appendix tables

Fuente consultada: https://aclanthology.org/2024.inlg-main.19.pdf

Revisión: Codex editorial review and methods/artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • No new model inference; conceptual framework and literature review
  • GPT-1, GPT-2, GPT-3, GPT-3.5, ChatGPT and GPT-4 across reviewed studies
  • BLOOM, FLAN-PaLM, PaLM, Chinchilla and Delphi across reviewed studies
  • BERT-family and distilled encoder models in the reviewed multilingual study

Instrumentos y métricas

  • Standards for Educational and Psychological Testing (AERA, APA and NCME, 2014)
  • International Guidelines for Test Use (International Test Commission, 2001)
  • R1 reliability for intended use
  • R2 validity for intended use
  • R3 suitability for test takers
  • R4 non-disclosure of test materials and contamination control
  • R5a test validity for all compared models
  • R5b validity of test translations
  • R5c transparent and reproducible test use
  • Five-level ordinal evidence rubric including not applicable

Datos utilizados

  • 25 machine-psychology papers retained from searches and citation tracing
  • 12 psychological constructs
  • 34 psychological tests and assessments
  • Table 1 study-by-requirement rating matrix
  • Appendix Table 2 construct-and-assessment map
  • Appendix Table 3 study, model and assessment map
  • No public machine-readable coding sheet or evidence-level artifact found

Evidencia y localización

  • Publicación, autores, objetivo y conclusión principal: INLG 2024 final paper, title page, abstract and section 1, pp. 230–231
  • Normas de referencia y distinción entre fiabilidad y validez: Final paper, section 2, p. 231
  • Requisitos R1–R4: Final paper, sections 3.1–3.4, pp. 232–233
  • Requisitos R5a–R5c: Final paper, section 3.5, pp. 233–234
  • Búsqueda, corte temporal, 25 papers, 12 constructos y 34 tests: Final paper, opening of section 4, p. 233
  • 20 estudios con GPT-3 o posterior y 17 sin otra familia: Final paper, section 4.1, pp. 234–235
  • Matriz completa y conteos reconstruidos por requisito: Final paper, Table 1, p. 234; visual transcription and independent count checked 15 Jul 2026
  • Valoración conjunta y semántica de las cinco categorías: Final paper, section 4.2, p. 235
  • Hallazgos sobre R1 y R2: Final paper, section 4.2, pp. 235–236
  • Hallazgos sobre R3, R4, R5a, R5b y R5c: Final paper, section 4.2, p. 236
  • Nueve tests modificados, una validación, cero estudios con todos los requisitos y criterio benévolo: Final paper, end of section 4.2 and opening of section 5, pp. 236–237
  • Problemas abiertos, alcance no exhaustivo y conclusión: Final paper, sections 5–6, pp. 236–238
  • Mapa de 34 assessments y 25 estudios/modelos: Final paper, Appendix Tables 2–3, pp. 241–242
  • Ausencia de artefacto público asociado: Exact-title, author, GitHub and OSF public search audited 15 Jul 2026; no official coding sheet, data or code located
  • Metadatos bibliográficos finales: ACL Anthology 2024.inlg-main.19, pp. 230–242, DOI 10.18653/v1/2024.inlg-main.19, verified 15 Jul 2026