Este trabajo no evalúa la personalidad de un LLM: usa GPT-3.5 como generador de datos auxiliares para predecir en personas las cuatro dicotomías MBTI a partir de sus publicaciones. El método TAE pide a gpt-3.5-turbo-0301, con temperatura cero, tres análisis por publicación, semántico, de sentimiento y lingüístico, y los usa como positivos de una pérdida contrastiva que entrena un codificador BERT. También genera descripciones de cada etiqueta MBTI para construir etiquetas suaves mediante similitud coseno; en inferencia solo queda el modelo pequeño. En particiones 60/20/20 de Kaggle/PersonalityCafe, con 8.675 usuarios, y PANDORA/Reddit, con 9.067, TAE obtiene macro-F1 medio de 72,07 y 63,05. Las mejoras frente al mejor baseline de cada tabla son 0,72 y 1,04 puntos absolutos, equivalentes a los 1,01% y 1,68% relativos que cita el texto; frente a BERTmean son 5,83 y 6,53 puntos. La evidencia apoya que, en esta configuración, las representaciones entrenadas con análisis generados superan a BERTmean y a las variantes que concatenan esos textos. No permite atribuir por separado el efecto a conocimiento psicolingüístico: no hay validación humana de los análisis, las ablaciones son ejecuciones puntuales sin incertidumbre y retirar la información de etiquetas apenas cambia 72,07 a 72,02. Tampoco sustenta la afirmación general de que el razonamiento o el few-shot empeoren ChatGPT: CoT baja a 65,12, pero tres ejemplos suben de 66,89 a 67,74 y además usan otro snapshot con ventana de contexto mayor. El trabajo trata declaraciones MBTI ruidosas y muy desequilibradas como referencia, no analiza validez psicométrica, clases minoritarias, sesgo, privacidad ni transferencia entre dominios. No publica código, semillas, salidas de GPT, coste, intervalos ni pruebas estadísticas, por lo que la reproducibilidad y la solidez de unas ventajas pequeñas quedan limitadas.
Pregunta de investigación
¿Puede el conocimiento generado por un LLM, análisis semánticos, de sentimiento y lingüísticos de publicaciones, más descripciones de etiquetas MBTI, mejorar un modelo BERT pequeño para detectar tipos de personalidad declarados en redes sociales sin añadir coste de LLM durante la inferencia?