PsychoGAT propone convertir cuestionarios psicológicos en ficción interactiva de primera persona. Un agente diseñador reordena y reescribe los ítems como nodos narrativos; un controlador produce párrafos y dos continuaciones que corresponden a las opciones puntuadas; y un crítico revisa coherencia, sesgo hacia una opción y cumplimiento del formato. La persona elige una continuación en cada ronda y un evaluador determinista suma los valores asociados. El artículo estudia extraversión, depresión y tres distorsiones cognitivas, con una preferencia de aprendizaje visual como constructo supuestamente no relacionado. Casi toda la evidencia psicométrica principal procede de GPT-4 interpretando participantes extremos definidos por prompt: para cada tarea y método hay solo 20 perfiles, mitad positivos y mitad negativos. Sobre esa muestra artificial, la Tabla 1 informa para PsychoGAT alfa/lambda-6, correlación convergente y correlación discriminante de 0,97/0,98/0,97/-0,59 en personalidad; 0,77/0,84/0,85/-0,07 en depresión; y valores de fiabilidad entre 0,88 y 0,95 y convergencia entre 0,93 y 0,97 en las tres distorsiones. Esas cifras muestran consistencia entre decisiones de un mismo simulador instruido y la escala de la que se deriva el juego, no validación clínica. Los autores también comparan el contenido con escala tradicional, escala generada, entrevista simulada y Diagnosis-of-Thought. Treinta y tres evaluadores con conocimientos psicológicos básicos puntúan 15 contenidos simulados sobre pensamiento dicotómico; el porcentaje que considera superior a PsychoGAT es 66,7 % en coherencia, 84,8 % en interactividad, 87,9 % en interés, 78,8 % en inmersión y 84,8 % en satisfacción. Un segundo estudio incluye 12 participantes anglófonos de 20 a 30 años, pero solo evalúa extraversión, dura unos 30 minutos y comunica resultados mediante un gráfico sin tabla, intervalos ni pruebas. El alcance es más estrecho de lo que sugiere el abstract: PHQ-9 se binariza y pierde sus cuatro categorías de frecuencia, las escalas de distorsión se amplían con situaciones construidas por los autores y el MBTI se reduce a diez elecciones de extraversión. No se publican código, datos, salidas, semillas ni una versión precisa de GPT-4. La propuesta es una demostración interesante de gamificación de ítems cerrados y obtiene mejores valoraciones de contenido en esta muestra; no demuestra que pueda transformar fielmente cualquier escala, que mida constructos psicológicos sin alterar su validez ni que sea segura o eficaz para cribado, diagnóstico o pacientes.
Pregunta de investigación
¿Puede un sistema multiagente basado en GPT-4 convertir escalas de autoinforme de distintos constructos en juegos de ficción interactiva que conserven consistencia y correlación con las puntuaciones originales y que, además, resulten más coherentes, interactivos, interesantes, inmersivos y satisfactorios que escalas o entrevistas generadas con LLM?