El artículo presenta MBTIBench, un banco de 286 perfiles tomado de los test sets de Kaggle MBTI, PANDORA y Twitter. Selecciona aproximadamente seis usuarios por cada uno de los 16 tipos autodeclarados y por fuente, elimina manualmente frases consideradas ruido o fuga de etiqueta, y pide a tres anotadores con formación universitaria en inglés que asignen a cada eje MBTI una de cuatro intensidades. Un procedimiento inspirado en Dawid–Skene ordena las combinaciones de anotaciones y las transforma, mediante frecuencias acumuladas normalizadas, en puntuaciones entre 0 y 1. Se comparan seis LLM y cuatro prompts; zero-shot suele ser competitivo, pero ningún modelo supera de forma consistente al baseline de predecir la media y las distribuciones presentan fuertes concentraciones dependientes del modelo y del prompt. En una prueba auxiliar de estrés sobre 300 casos de Dreaddit, añadir etiquetas blandas eleva la accuracy media de 72,13% sin MBTI y 73,37% con etiquetas duras a 74,00%, aunque la ventaja sobre etiquetas duras es solo 0,63 puntos, se invierte en tres de diez ejecuciones y el artículo no publica el resultado del test estadístico. La aportación defendible es señalar ruido, fuga de etiquetas, desacuerdo y sesgos de salida en los benchmarks de detección MBTI. No queda demostrado que el 29,58% de autoinformes sea psicológicamente incorrecto: esa cifra expresa desacuerdo con inferencias de tres anotadores, no comparación con un instrumento independiente. Tampoco se valida el supuesto alineamiento poblacional; la muestra se balancea por tipo, las etiquetas blandas se construyen a partir de las frecuencias del propio conjunto y una auditoría del release encuentra referencias explícitas a MBTI o teorías afines en al menos 67 de 286 registros. Inconsistencias entre escala, discretización y código, junto con acuerdo interanotador moderado y problemas de privacidad/licencia, obligan a interpretar MBTIBench como un recurso experimental todavía frágil, no como verdad psicométrica sobre las personas.
Pregunta de investigación
¿Puede un test set de detección MBTI, limpiado y reanotado con intensidades blandas, ofrecer una evaluación más realista de la inferencia de personalidad desde texto, qué patrones y sesgos muestran seis LLM bajo cuatro estrategias de prompting y aportan esas etiquetas información útil en una tarea auxiliar de detección de estrés?