AIPsychoBench es un artículo de Topics in Cognitive Science publicado en 2026 a partir de un trabajo de CogSci 2025. La versión definitiva tiene ocho autores y difiere del preprint de arXiv tanto en orden como en composición de autoría. Esta revisión usa el XML completo de la versión definitiva, inspecciona visualmente las ocho páginas del preprint y las cuatro figuras del artículo definitivo, y audita el repositorio oficial en el commit d4759bff.
El trabajo reúne 21 cuestionarios humanos de tipo Likert: 777 ítems agrupados en 112 subcategorías y seis dominios. Prueba seis LLM, GPT-4, GPT-4o-2024-11-20, GLM-4-plus, Gemini-2.0-flash-exp, DeepSeek-R1 y Claude-3-5-sonnet-20240620, en inglés, chino, francés, ruso, alemán, español, árabe y japonés. Las escalas se traducen con Microsoft Azure AI Translator y dos investigadores revisan una muestra de las traducciones. Cada condición se ejecuta cinco veces con temperature 0. GPT-4o actúa además como juez para decidir si una explicación es compatible con el número Likert y eliminar respuestas consideradas inválidas.
La intervención principal es un prompt ligero que ordena al modelo actuar como participante y responder según sus «emociones y pensamientos auténticos». Comparado con preguntas directas, Base64, cifrado César y el jailbreak STAN, el prompt eleva la tasa media de respuesta válida de 70,12% a 90,40%; STAN alcanza 81,49%. Estas medias de la Tabla 1 son aritméticamente correctas. El artículo también compara puntuaciones del prompt con baseline solo en ítems válidos bajo ambas condiciones. Reporta sesgo medio de +3,3% y −2,1% para el prompt frente a +9,8% y −6,9% para STAN, y afirma que 86 de 112 subcategorías quedan por debajo de 4%. En la comparación lingüística, informa desviaciones de al menos 5% y hasta 20,2% en 43 subcategorías frente al inglés.
El resultado defendible es mucho más estrecho que el lenguaje del artículo: bajo este protocolo, una instrucción antropomórfica aumenta la proporción de outputs que un juez GPT-4o puede convertir en números Likert, y el idioma del prompt y de una traducción automática cambia esos números. Esto no valida propiedades psicológicas del modelo. Pedir «emociones auténticas» a un sistema que el propio artículo reconoce que no las tiene cambia la tarea de medición por una tarea de obediencia o simulación. Las respuestas objetivas o neutrales no son datos faltantes accidentales: pueden ser la respuesta veraz de un asistente sin biografía, raza, religión, relaciones, empleo o experiencias corporales.
El cálculo de sesgo tiene además selección por intersección: solo compara ítems válidos en baseline y método, por lo que no evalúa justamente los casos adicionales que hacen subir la cobertura del 70,12% al 90,40%. El umbral de 4% se declara razonable sin benchmark humano, intervalo ni prueba. «Significant» se usa descriptivamente para diferencias que superan umbrales, no como resultado de inferencia estadística. No hay participantes humanos, estructura factorial, fiabilidad, validez convergente, invariancia de medida, intervalos, tests, seeds ni análisis de error del juez. Las diferencias entre idiomas confunden traducción, capacidad lingüística, tokenización, datos de entrenamiento, alineamiento y conducta del juez.
El repositorio no reproduce el paper. Publica las 777 preguntas inglesas más un MBTI adicional, pero no las ocho versiones completas, los outputs de seis modelos por cinco repeticiones, las tablas, las figuras derivadas ni scripts de análisis. Solo incluye un resultado BFI en alemán. El programa importa un módulo ResultManager ausente; ignora los 117 ítems invertidos de 13 escalas; y, para EPQ-R, configura el límite de modo que 0 es válido pero 1 se rechaza. El resultado BFI publicado promedia ítems invertidos sin recodificarlos: al corregirlos, cambian las medias de Agreeableness, Extraversion y Neuroticism. La documentación atribuye erróneamente Resistance to Change a Mael (1988) en lugar de Oreg (2003), y llama Zuckerman–Kuhlman Personality Questionnaire a lo que los ítems y dimensiones identifican como Zi's Negative Perfectionism Questionnaire. Sin resultados crudos ni análisis ejecutable, las cifras del artículo no son verificables desde los artefactos públicos.