PsychoGAT: A Novel Psychological Measurement Paradigm through Interactive Fiction Games with LLM Agents

Evaluación y validez psicométrica2024ACL AnthologyRevisión editorial aprobada

Autores: Qisen Yang, Zekun Wang, Honghui Chen, Shenzhi Wang, Yifan Pu, Xin Gao, Wenhao Huang, Shiji Song, Gao Huang

Palabras clave: psychological measurement, LLM agents, interactive fiction games, gamification, personality traits, psychometric evaluation, mental health assessment

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

9
Autores
25
Hallazgos
40
Limitaciones
25
Evidencias

Resumen editorial

Español

PsychoGAT propone convertir cuestionarios psicológicos en ficción interactiva de primera persona. Un agente diseñador reordena y reescribe los ítems como nodos narrativos; un controlador produce párrafos y dos continuaciones que corresponden a las opciones puntuadas; y un crítico revisa coherencia, sesgo hacia una opción y cumplimiento del formato. La persona elige una continuación en cada ronda y un evaluador determinista suma los valores asociados. El artículo estudia extraversión, depresión y tres distorsiones cognitivas, con una preferencia de aprendizaje visual como constructo supuestamente no relacionado. Casi toda la evidencia psicométrica principal procede de GPT-4 interpretando participantes extremos definidos por prompt: para cada tarea y método hay solo 20 perfiles, mitad positivos y mitad negativos. Sobre esa muestra artificial, la Tabla 1 informa para PsychoGAT alfa/lambda-6, correlación convergente y correlación discriminante de 0,97/0,98/0,97/-0,59 en personalidad; 0,77/0,84/0,85/-0,07 en depresión; y valores de fiabilidad entre 0,88 y 0,95 y convergencia entre 0,93 y 0,97 en las tres distorsiones. Esas cifras muestran consistencia entre decisiones de un mismo simulador instruido y la escala de la que se deriva el juego, no validación clínica. Los autores también comparan el contenido con escala tradicional, escala generada, entrevista simulada y Diagnosis-of-Thought. Treinta y tres evaluadores con conocimientos psicológicos básicos puntúan 15 contenidos simulados sobre pensamiento dicotómico; el porcentaje que considera superior a PsychoGAT es 66,7 % en coherencia, 84,8 % en interactividad, 87,9 % en interés, 78,8 % en inmersión y 84,8 % en satisfacción. Un segundo estudio incluye 12 participantes anglófonos de 20 a 30 años, pero solo evalúa extraversión, dura unos 30 minutos y comunica resultados mediante un gráfico sin tabla, intervalos ni pruebas. El alcance es más estrecho de lo que sugiere el abstract: PHQ-9 se binariza y pierde sus cuatro categorías de frecuencia, las escalas de distorsión se amplían con situaciones construidas por los autores y el MBTI se reduce a diez elecciones de extraversión. No se publican código, datos, salidas, semillas ni una versión precisa de GPT-4. La propuesta es una demostración interesante de gamificación de ítems cerrados y obtiene mejores valoraciones de contenido en esta muestra; no demuestra que pueda transformar fielmente cualquier escala, que mida constructos psicológicos sin alterar su validez ni que sea segura o eficaz para cribado, diagnóstico o pacientes.

English

PsychoGAT proposes turning psychological questionnaires into first-person interactive fiction. A designer agent reorders and rewrites items as narrative nodes; a controller generates paragraphs and two continuations corresponding to scored response options; and a critic checks coherence, option-leading bias, and format compliance. The player selects one continuation per round, and a deterministic evaluator adds the linked item scores. The paper studies extraversion, depression, and three cognitive distortions, using visual learning preference as a supposedly unrelated construct. Most of the main psychometric evidence comes from GPT-4 role-playing prompt-defined extreme participants: each task and method has only 20 profiles, split evenly between positive and negative instances. On this artificial sample, Table 1 reports alpha/lambda-6, convergent correlation, and discriminant correlation of 0.97/0.98/0.97/-0.59 for personality; 0.77/0.84/0.85/-0.07 for depression; and reliability values from 0.88 to 0.95 and convergent correlations from 0.93 to 0.97 for the three distortions. These figures show consistency among choices by an instructed simulator and agreement with the scale from which the game is derived, not clinical validation. The authors also compare content with a traditional scale, an LLM-generated scale, a simulated psychologist interview, and Diagnosis-of-Thought. Thirty-three evaluators with basic psychological-assessment knowledge score 15 simulated all-or-nothing-thinking samples; the percentages judging PsychoGAT superior are 66.7% for coherence, 84.8% for interactivity, 87.9% for interest, 78.8% for immersion, and 84.8% for satisfaction. A second study involves 12 English-proficient participants aged 20 to 30, but covers extraversion only, lasts about 30 minutes, and reports results through a chart without a numeric table, intervals, or tests. The scope is narrower than the abstract suggests: PHQ-9 is binarized and loses its four frequency categories, the cognitive-distortion scales are expanded with author-constructed situations, and MBTI is reduced to ten extraversion choices. No code, data, outputs, seeds, or precise GPT-4 snapshot are released. The proposal is an interesting demonstration of gamifying closed items and receives better content ratings in this sample; it does not establish that any scale can be faithfully transformed, that psychological constructs remain valid after transformation, or that the system is safe or effective for screening, diagnosis, or patients.

Pregunta de investigación

¿Puede un sistema multiagente basado en GPT-4 convertir escalas de autoinforme de distintos constructos en juegos de ficción interactiva que conserven consistencia y correlación con las puntuaciones originales y que, además, resulten más coherentes, interactivos, interesantes, inmersivos y satisfactorios que escalas o entrevistas generadas con LLM?

Método

PsychoGAT emplea un diseñador, un controlador y un crítico basados en GPT-4. El diseñador produce título, esquema y ítems binarios adaptados a una trama; el controlador instancia cada ítem como párrafo y dos instrucciones; el crítico itera hasta tres veces para corregir coherencia, omisiones y sesgo; y una suma determinista convierte diez elecciones en puntuación. Para la evaluación automática, GPT-4 simula 20 participantes extremos por tarea y método, 10 con y 10 sin el constructo. Se calculan alfa de Cronbach, lambda-6 de Guttman y correlaciones de Pearson con la escala de referencia y con una escala visual. Se comparan escala tradicional, escala generada, entrevista psicológica, Diagnosis-of-Thought y PsychoGAT. Treinta y tres personas puntúan 15 muestras simuladas; 12 participantes reales completan escala y juego de extraversión; y tres expertos valoran ablations de agentes y rediseño.

Muestra: La evaluación psicométrica principal no usa pacientes ni una muestra poblacional: usa 20 personajes simulados por GPT-4 para cada tarea y método, deliberadamente divididos en diez casos positivos y diez negativos mediante instrucciones explícitas. La evaluación comparativa recluta 33 personas con conocimientos básicos de evaluación psicológica para juzgar 15 contenidos producidos con simuladores. El estudio de uso real incluye 12 participantes anglófonos de 20 a 30 años, todos sometidos a la escala tradicional y a diez rondas de PsychoGAT para extraversión. La sección ética sitúa el rango de evaluadores humanos en 20-45 años, excluye enfermedad mental actual y riesgo autolesivo o suicida, declara consentimiento, compensación de 20 USD/h y aprobación THU-03-2024-0001.

Hallazgos

  • PsychoGAT implementa una cadena de diseño, control, crítica y puntuación para convertir elecciones binarias de una escala en continuaciones narrativas.
  • La persona no responde directamente al texto original del ítem, pero cada una de sus dos continuaciones sigue vinculada de forma explícita a una opción y puntuación de la escala.
  • El controlador mantiene memoria resumida y el crítico intenta evitar que la narración induzca una opción por las elecciones previas.
  • Todos los componentes generativos y todos los baselines basados en LLM usan GPT-4 sin ajuste, a temperatura 0,5.
  • Cada tarea y método se evalúa con 20 simulaciones GPT-4, repartidas deliberadamente entre diez perfiles positivos y diez negativos.
  • En personalidad simulada, la Tabla 1 reporta alfa 0,97, lambda-6 0,98, convergencia 0,97 y discriminación -0,59.
  • En depresión simulada, la Tabla 1 reporta alfa 0,77, lambda-6 0,84, convergencia 0,85 y discriminación -0,07.
  • En pensamiento dicotómico, la Tabla 1 reporta alfa 0,92, lambda-6 0,93, convergencia 0,97 y discriminación -0,44.
  • En lectura de mente, la Tabla 1 reporta alfa 0,92, lambda-6 0,95, convergencia 0,97 y discriminación 0,25.
  • En enunciados de debería, la Tabla 1 reporta alfa 0,88, lambda-6 0,91, convergencia 0,93 y discriminación -0,18.
  • El artículo considera aceptable una correlación discriminante con valor absoluto inferior a 0,60, por lo que el -0,59 de personalidad supera el umbral por solo 0,01.
  • Los cinco métodos comparados cumplen los umbrales psicométricos definidos por los autores en el escenario simulado.
  • Entre 33 evaluadores, el 66,7 % juzga a PsychoGAT superior a todos los otros métodos en coherencia.
  • Los porcentajes de superioridad de PsychoGAT son 84,8 % en interactividad, 87,9 % en interés, 78,8 % en inmersión y 84,8 % en satisfacción.
  • Al excluir las dos entrevistas, el acuerdo de superioridad en coherencia sube de 66,7 % a 75,8 % y los demás porcentajes apenas cambian.
  • Los experimentos de escenas obtienen alfa entre 0,98 y 0,99 y convergencia 0,99 en vida cotidiana, ciencia ficción y horror, otra vez sobre 20 simulaciones extremas.
  • La ablation sugiere que eliminar agentes afecta poco a las métricas psicométricas simuladas pero reduce las valoraciones de experiencia.
  • La leyenda publicada de la Figura 7 contiene dos condiciones llamadas 'w/o Critic', lo que hace ambigua una de las ablations.
  • Doce participantes reales completan una escala de extraversión y diez rondas del juego en aproximadamente 30 minutos.
  • El texto afirma que el estudio humano reproduce fiabilidad y convergencia y que la mayoría prefiere PsychoGAT, pero la Figura 6 no aporta valores numéricos ni una tabla.
  • El abstract y la conclusión califican los resultados como estadísticamente significativos, aunque no se presentan p-valores, intervalos, pruebas de diferencias ni tamaños de efecto.
  • La sección ética declara que PsychoGAT no sustituye evaluación profesional ni constituye diagnóstico.
  • El estudio recibió aprobación de Tsinghua University bajo el protocolo THU-03-2024-0001.
  • Los participantes fueron remunerados a 20 USD por hora y los autores declaran consentimiento y ausencia de datos identificativos.
  • El artículo no incluye enlace de código o datos y la búsqueda dirigida no identificó una publicación oficial reproducible.

Limitaciones

  • El diseño principal usa GPT-4 como generador de juegos, simulador de participantes y componente de los baselines, creando dependencia de método común.
  • Los perfiles simulados reciben por prompt la presencia o ausencia del constructo, por lo que las correlaciones altas reflejan en parte cumplimiento de instrucciones extremas.
  • Veinte muestras por tarea son insuficientes para estimaciones estables de fiabilidad y correlación, especialmente sin intervalos de confianza.
  • Dividir artificialmente la muestra en diez positivos y diez negativos amplía la varianza y puede inflar correlaciones y consistencia interna.
  • No se evalúan distribuciones realistas, casos subclínicos, perfiles mixtos ni prevalencias poblacionales.
  • La validez convergente correlaciona el juego con la misma escala que guía su diseño, de modo que no aporta evidencia independiente del constructo.
  • La validez discriminante usa solo preferencia de aprendizaje visual como comparador, sin justificar empíricamente su independencia en esta muestra simulada.
  • El criterio absoluto de 0,60 para discriminación permite aprobar una correlación de -0,59, que sigue siendo moderada y casi falla el umbral.
  • No hay análisis factorial, invariancia, estructura dimensional, funcionamiento diferencial de ítems, test-retest o validez predictiva.
  • No se informa corrección por comparaciones múltiples, pruebas de hipótesis, intervalos ni tamaños de efecto.
  • La expresión 'statistically significant excellence' no corresponde a una prueba inferencial descrita en el artículo.
  • PHQ-9 se reduce de cuatro frecuencias a dos opciones, alterando administración, rango y reglas de puntuación del instrumento validado.
  • La versión binaria de PHQ-9 incluye el ítem de muerte o autolesión, pero el sistema no presenta un protocolo de respuesta o escalado de riesgo.
  • La extraversión se representa con diez ítems dicotómicos de MBTI y no con un instrumento dimensional moderno o validado para este uso.
  • Para las distorsiones, la escala estandarizada aporta un solo ítem por constructo y los autores construyen situaciones adicionales, por lo que la fiabilidad obtenida no valida el instrumento original.
  • Rediseñar los ítems cambia contenido, contexto y carga cognitiva sin un estudio formal de equivalencia semántica o psicométrica.
  • Las dos continuaciones permanecen enlazadas a valores binarios, simplificando conductas y eliminando respuestas ambiguas, mixtas o abiertas.
  • El orden de las opciones y la asociación 1/0 son fijos en los prompts publicados; no se estudian sesgos de posición.
  • Las selecciones previas cambian la historia y pueden condicionar las posteriores; el crítico intenta mitigarlo, pero no mide si lo consigue.
  • La demostración contiene elecciones socialmente valoradas y estereotipos narrativos, incluida una escena con 'tribal scouts', que pueden introducir deseabilidad y sesgo cultural.
  • Solo se prueban cinco constructos en inglés; esto no respalda la afirmación de transformar cualquier escala estandarizada.
  • El GPT-4 usado no tiene snapshot, fecha de API ni identificador exacto, impidiendo reproducir las salidas.
  • No se publican semillas, respuestas crudas, juegos, puntuaciones por ítem, datos de evaluadores ni scripts de análisis.
  • El artículo no proporciona código o repositorio oficial; los extensos prompts del apéndice no bastan para reconstruir el pipeline y sus parseos.
  • Los 33 evaluadores juzgan solo 15 contenidos simulados de pensamiento dicotómico y reciben la instrucción de imaginar que son participantes.
  • La evaluación de contenido no equivale a usar interactivamente cada método y puede favorecer el formato narrativo en interés e inmersión.
  • Los evaluadores solo necesitan conocimientos psicológicos básicos; no se detallan formación, calibración o acuerdo entre evaluadores.
  • Las medias 1-5 se normalizan a 0,1-0,9 sin justificar el efecto de esa transformación en la interpretación de los gráficos.
  • El estudio real tiene 12 participantes, solo extraversión y una sesión de unos 30 minutos.
  • La Figura 6 del estudio real no ofrece cifras exactas, dispersión, intervalos, comparaciones pareadas ni resultados por participante.
  • No se informa orden o contrabalanceo entre escala y juego; el apéndice indica que la escala se completa primero, lo que puede producir memoria y arrastre.
  • Los participantes reales tienen entre 20 y 30 años y dominio de inglés, sin datos adicionales de diversidad o representatividad.
  • Se excluye a personas con enfermedad mental actual o riesgo autolesivo, precisamente las poblaciones relevantes para las afirmaciones sobre depresión y diagnóstico.
  • No hay ensayo con pacientes, profesionales usando el sistema, consecuencias clínicas o comparación con entrevista humana.
  • Las ablations usan 20 simulaciones y solo tres evaluadores expertos, y su leyenda contiene una etiqueta duplicada que impide identificar una condición con certeza.
  • El coste, latencia, estabilidad de API y huella de datos de múltiples llamadas GPT-4 no se evalúan.
  • La privacidad se declara para el estudio, pero no se analiza el tratamiento de datos sensibles en una futura API externa.
  • No se prueba resistencia a prompt injection, contenido adversarial, respuestas incoherentes ni fallos de parseo.
  • El juego puede ocultar que cada elección es un ítem psicológico, pero no se discuten transparencia, consentimiento específico o uso manipulativo de evaluación encubierta.
  • El propio artículo reconoce que hacen falta estudios longitudinales, pacientes diversos, localización lingüística y supervisión profesional.

Qué no demuestra

  • No demuestra que PsychoGAT mida una personalidad interna, estable o completa.
  • No demuestra validez clínica para depresión o distorsiones cognitivas.
  • No demuestra equivalencia con PHQ-9 tras binarizar sus respuestas.
  • No demuestra equivalencia con MBTI ni validez general de MBTI como medida de personalidad.
  • No valida las escalas de distorsión construidas por los autores como instrumentos independientes.
  • No demuestra que cualquier escala estandarizada pueda convertirse sin alterar el constructo.
  • No demuestra que una correlación alta en simuladores instruidos se transfiera a personas.
  • No demuestra que GPT-4 simule fielmente distribuciones psicológicas humanas.
  • No demuestra validez discriminante amplia con un único constructo de comparación.
  • No demuestra fiabilidad test-retest, estabilidad longitudinal o invariancia entre grupos.
  • No demuestra superioridad estadística sobre escalas tradicionales o entrevistas humanas.
  • No demuestra que 12 participantes representen a poblaciones generales o clínicas.
  • No demuestra eficacia para personas con depresión, autolesión o riesgo suicida, que fueron excluidas.
  • No demuestra que mayor interés o inmersión produzca diagnósticos más exactos o mejores resultados.
  • No demuestra que la experiencia sea preferible en otros idiomas, edades, culturas o condiciones de accesibilidad.
  • No demuestra que el crítico elimine sesgos narrativos, deseabilidad social o dependencia entre ítems.
  • No demuestra seguridad frente a contenido dañino, fugas de datos o manipulación.
  • No justifica el uso autónomo para cribado, diagnóstico, tratamiento o decisiones de alto impacto.
  • No permite reproducir las cifras publicadas sin datos, código y versión exacta del modelo.
  • No establece que los resultados sigan vigentes con modelos o APIs actuales.

Trazabilidad

Alcance: Texto completo

Versión: ACL 2024 final proceedings paper, pp. 14470-14505, DOI 10.18653/v1/2024.acl-long.779, 36 pages; no official code or data release identified in the paper, ACL record, arXiv record, or targeted project search

Fuente consultada: https://aclanthology.org/2024.acl-long.779.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, psychometric, clinical-claims, experimental-design, metric-interpretation, reproducibility, privacy and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4 como diseñador, controlador, crítico y simulador humano; el artículo no identifica un snapshot exacto
  • GPT-4 en todos los baselines basados en LLM, temperatura 0,5
  • Evaluador psicométrico determinista que suma las opciones asociadas a los ítems

Instrumentos y métricas

  • Subescala de extraversión de Myers-Briggs Type Indicator (MBTI), reducida a 10 ítems binarios
  • Patient Health Questionnaire-9 (PHQ-9), transformado en respuestas binarias
  • Cognitive Distortions Questionnaire para pensamiento dicotómico, lectura de mente y enunciados de debería
  • Situaciones y pensamientos alternativos construidos por los autores para ampliar cada distorsión
  • Escala de preferencia de aprendizaje visual usada para validez discriminante
  • Alfa de Cronbach
  • Lambda-6 de Guttman
  • Correlación de Pearson para validez convergente y discriminante
  • Valoración 1-5 de coherencia, interactividad, interés, inmersión y satisfacción
  • Cuestionario de experiencia de usuario del estudio con participantes

Datos utilizados

  • 20 simulaciones GPT-4 por tarea y por método, con 10 perfiles positivos y 10 negativos
  • Cinco constructos objetivo: extraversión, depresión y tres distorsiones cognitivas
  • Diez combinaciones de tipo y tema narrativo: fantasía, romance, ciencia ficción, vida cotidiana y horror
  • 15 muestras simuladas de pensamiento dicotómico valoradas en la comparación de contenido
  • 33 evaluadores humanos con conocimientos básicos de evaluación psicológica
  • 12 participantes humanos en el experimento de extraversión
  • 20 simulaciones por condición en las ablations de escenas y agentes
  • Demostración no seleccionada manualmente de un juego de extraversión Fantasy/Adventure

Evidencia y localización

  • Registro bibliográfico oficial: ACL Anthology 2024.acl-long.779: 9 authors, ACL 2024, pp. 14470-14505, DOI 10.18653/v1/2024.acl-long.779
  • Fuente completa auditada: .cache/editorial-sources/article-095/source.pdf; official ACL PDF; 36 pages; sha256 afe1eb1f7cc8b299d85c1ea656d093554de0b970b67292698377a29b6247fad7
  • Arquitectura de diseñador, controlador, crítico y evaluador: Full text pp. 14471-14473, sections 2.1-2.5 and Figure 2
  • Sesgo por historial y mitigación del crítico: Full text p. 14473, section 2.4
  • Tareas e instrumentos: Full text pp. 14473-14474, section 3.1; Appendix pp. 14484-14487
  • GPT-4, temperatura y límites de iteración: Full text p. 14474, Baseline Methods
  • Veinte simulaciones extremas por tarea: Full text p. 14475, section 3.3
  • Definiciones y umbrales psicométricos: Full text pp. 14474-14475, section 3.2
  • Resultados exactos de fiabilidad y validez: Full text p. 14475, Table 1
  • Comparación con cuatro baselines: Full text pp. 14474-14476, Figure 4 and Comparative Experiments; Appendix p. 14483, section A
  • Treinta y tres evaluadores y quince contenidos: Full text p. 14475, Comparative Experiments
  • Porcentajes de superioridad: Full text p. 14476, Figure 5; Appendix p. 14483, Table 3
  • Robustez por escena: Full text p. 14476, Table 2
  • Ablations y leyenda ambigua: Full text pp. 14476-14477, Figure 7 and Ablation on Agents
  • Doce participantes reales: Full text p. 14476, Human Participant Experiments; Appendix pp. 14483-14484, section B.3
  • Resultados humanos solo como gráfico: Full text p. 14476, Figure 6; no numeric companion table
  • Binarización de PHQ-9 y escalas usadas: Appendix pp. 14485-14487, section C
  • Construcción de ítems de distorsión: Appendix p. 14484, footnote 5; pp. 14486-14487
  • Prompts completos y asociación binaria: Appendix pp. 14488-14500, section D
  • Demostración narrativa no seleccionada: Appendix pp. 14501-14505, section E
  • Límites reconocidos: Full text p. 14478, Limitations
  • No diagnóstico y supervisión profesional: Full text p. 14478, Ethics Statement
  • IRB, exclusiones, remuneración y privacidad: Full text p. 14478, Ethics Statement; protocol THU-03-2024-0001
  • Ausencia de artefacto reproducible: Paper and ACL/arXiv metadata contain no code or data URL; targeted official project and GitHub search checked 15 Jul 2026
  • Comprobación visual integral: All 36 PDF pages rendered and visually inspected, including Figures 1-9, Tables 1-3, prompts, scales, ethics, limitations and full demonstration; checked 15 Jul 2026