El artículo propone ProtoMBTI para inferir uno de los 16 tipos MBTI a partir de publicaciones de usuarios. El sistema aumenta los datos de Kaggle y Pandora con GPT-4o y GPT-4o-mini, filtra ejemplos sintéticos con un clasificador de cuatro dicotomías, ajusta mediante LoRA codificadores de hasta 2B parámetros y almacena cada texto, su representación y su etiqueta como prototipo. En inferencia, GPT-4o-mini, Qwen2-72B o Llama-3.1-70B recibe el texto consultado y los tres prototipos más próximos para razonar y votar una clase. En los resultados principales, la mejor variante individual alcanza en Kaggle un promedio de 85,14 % en las cuatro dicotomías y 71,42 % de exactitud directa en los 16 tipos; en Pandora, GPT-4o-mini obtiene 71,41 % y 60,22 %, respectivamente. Los experimentos con entrenamiento mixto informan hasta 96,41 % por dicotomía y 92,13 % en 16 tipos dentro de Pandora, y alrededor de 81 % en la clasificación de 16 tipos al transferir entre dominios. Los baselines, sin embargo, no se comparan de forma equivalente en la tarea de 16 tipos: su cifra se calcula multiplicando las cuatro exactitudes bajo un supuesto de independencia, mientras ProtoMBTI se evalúa con una predicción multiclase directa. La amenaza principal afecta al propio protocolo de test. El Algoritmo 3 compara cada predicción con la etiqueta real del ejemplo de prueba y, solo si acierta, incorpora ese ejemplo ya etiquetado al banco para las predicciones posteriores. Esto es adaptación supervisada y secuencial sobre el test, no inferencia sin etiquetas; hace que el resultado dependa del orden y puede inflar especialmente los resultados mixtos. No se ofrece una ablación que elimine por separado esa retención. Además, aunque el texto afirma que el test permanece crudo, cada entrada de test pasa por una explicación/aumento generado por LLM antes de clasificarse. Los anexos tampoco permiten reconstruir con seguridad la evaluación: los totales posteriores al aumento difieren entre las Tablas 7 y 8, los recuentos de test de Pandora cambian según la dicotomía y varias matrices contienen unas 4.800 observaciones equilibradas, no las 835 muestras crudas declaradas. Los rótulos de las Figuras 10–12 se contradicen con sus títulos y pies. Por ello, el trabajo aporta una arquitectura interesante y ablations útiles sobre recuperación y aumento, pero no demuestra de forma fiable la magnitud de las mejoras ni una alineación cognitiva humana. Las etiquetas son autodeclaraciones MBTI de foros, los prompts incorporan estereotipos de cada tipo y la interpretabilidad se apoya en explicaciones generadas por el mismo tipo de modelo, sin validación humana de fidelidad.
Pregunta de investigación
¿Puede una arquitectura de recuperación y razonamiento inspirada en la teoría de prototipos mejorar la inferencia de las cuatro dicotomías y los 16 tipos MBTI a partir de texto, explicar sus decisiones y transferir entre los conjuntos Kaggle y Pandora?