Este trabajo de CLPsych 2025 no estudia personalidad ni teoría de la mente dentro de los LLM: usa modelos como calificadores binarios de respuestas humanas abiertas a diez narrativas sociales que pretenden medir mind-reading avanzado. Participaron 1.733 personas de 13 a 30 años, en centros educativos o Prolific. Un lead coder y cuatro codificadores entrenados asignaron etiquetas; antes de trabajar independientemente alcanzaron κ>0,7 frente al lead y este resolvió discrepancias. Cada prompt contiene narrativa, pregunta, rúbrica detallada y respuesta; el modelo devuelve 0/1. El paper compara plain/XML/JSON, tres versiones de rúbrica, zero-shot, 10-shot, 50-shot y fine-tuning. Declara 89,4 % macro de accuracy para GPT-4o zero-shot y 92,8 % tras fine-tuning, con κ=0,83. RoBERTa-large alcanza 92,0 %, GPT-4o-mini 90,5 %, Llama-3.2-3B 91,1 %, Mistral 88,7 %, Phi-3.5 83,8 %, Phi-4 87,5 % y Longformer 86,7 %. La augmentación mediante paráfrasis GPT-4o ayuda a Longformer, Mistral y Phi-3.5, apenas cambia Phi-4 y perjudica ligeramente a Llama. Son resultados prometedores para imitar una rúbrica fija, pero la auditoría del artefacto impide la interpretación amplia del artículo. El código genera 17.330 oportunidades de respuesta, elimina aleatoriamente 3.078 de la clase mayoritaria antes de dividir y publica 14.252 filas equilibradas. La partición real es 11.543/1.283/1.426, 80,99 %/9,00 %/10,01 %, no 80/10/10. Además, el pipeline descarta los IDs de participante antes de `train_test_split`; como cada persona responde las diez narrativas, sus estilos pueden aparecer en train y test. Los diez ítems y sus rúbricas están en los tres splits, por lo que el experimento mide nuevas respuestas a ítems conocidos, no transferencia a nuevos ítems o instrumentos. El dataset contiene tres prompts idénticos entre train/validation y uno entre train/test. Aunque test es 50/50 global, sus baselines mayoritarios por ítem promedian 62,03 % y varían de 50,32 % a 77,70 %; Llama zero-shot 64,3 % queda solo 2,27 puntos por encima. El paper llama significativas varias diferencias sin tests, intervalos, repeticiones o bootstrap por participante e ítem. La comparación humana es todavía más problemática: calcula kappa solo en casos donde GPT-4o y el codificador discrepaban, condicionando la muestra, y usa al lead coder como referencia. El texto dice que GPT-4o gana salvo en el ítem 5, pero Table 10 muestra que el humano también gana en el 3 y no contiene el ítem 7 que la prosa enumera. El repositorio tampoco reproduce el headline: carece de pipeline OpenAI, predicciones, resultados, código few-shot/formato y BERT/RoBERTa; el dataset de paráfrasis devuelve 401, falta `requirements.txt`, los scripts tienen rutas rotas, README intercambia enlaces Phi/Mistral y hay checkpoints incompletos. La conclusión defendible es que modelos ajustados pueden aproximar el criterio de un lead coder para diez preguntas conocidas en un corpus reducido y balanceado. No se valida el test, la generalización a participantes nuevos, ítems nuevos, grupos demográficos o clínicas, ni el uso como herramienta de cribado.
Pregunta de investigación
¿Con qué accuracy y acuerdo con un lead coder pueden varios modelos calificar respuestas abiertas humanas en diez ítems de mind-reading, y cómo cambian los resultados con formato, ejemplos, fine-tuning y paráfrasis sintéticas?