PostToPersonality (P2P), publicado como short paper en CIKM 2025, clasifica por separado las cuatro dicotomías MBTI a partir de las 50 publicaciones recientes de cada uno de 8.675 usuarios de PersonalityCafe. Un DeepSeek-R1-Distill-Llama-8B local se ajusta con QA-LoRA durante diez épocas y genera una descripción textual de la personalidad. Para combatir el desbalance, el artículo interpola con SMOTE las representaciones ocultas de los quince tipos menos frecuentes. El texto original y la descripción generada se codifican con Sentence-BERT, se recuperan cinco usuarios de entrenamiento con sus etiquetas y una API DeepSeek-V3 produce las cuatro letras finales mediante aprendizaje en contexto. En un único split 60/20/20, P2P informa exactitudes de 93,21 % en I/E, 94,75 % en N/S, 93,06 % en T/F y 88,58 % en J/P, por encima de diez baselines clásicos y neuronales. Sin embargo, no se publica exactitud conjunta de los 16 tipos. La principal amenaza es una fuga de etiqueta inherente al corpus. El conjunto procede de un foro dedicado a MBTI y el preprocesado solo pasa a minúsculas, lematiza y elimina stopwords, caracteres, enlaces y espacios; no elimina nombres de tipos ni vocabulario MBTI. El propio anexo muestra un caso cuya entrada contiene literalmente “I knew I was an INTJ”, coincidiendo con su etiqueta real INTJ, y otro con abreviaturas como ENTP/ESTP/EXTP. El modelo y la recuperación pueden, por tanto, aprender autoetiquetas, citas y jerga del foro en lugar de inferir rasgos desde conducta lingüística. Tampoco se mide la alucinación: el artículo concluye que RAG la mitiga únicamente porque mejora algunas métricas de clasificación. El AUC de P2P no se calcula con probabilidades de su predicción, sino que se aproxima mediante la distribución de etiquetas reales entre los cinco vecinos recuperados; por ello no es el AUC del clasificador final ni una comparación equivalente con los baselines. La tubería de ajuste también está insuficientemente definida: se entrena al LLM local para predecir la etiqueta, pero después se usa para generar una explicación descriptiva sin publicar el objetivo que supervisa esa explicación; SMOTE crea vectores ocultos continuos, pero no se explica cómo se convierten en ejemplos compatibles con QA-LoRA. No hay código ni artefacto oficial enlazado, semillas, snapshots de API, temperatura, costes, repeticiones, intervalos o tests estadísticos. Los resultados prueban rendimiento sobre este benchmark contaminado, no inferencia psicométrica fiable de personalidad.
Pregunta de investigación
¿Puede una arquitectura con ajuste eficiente de un LLM local, sobremuestreo de tipos minoritarios, recuperación de ejemplos etiquetados y una API LLM superar baselines en la clasificación de las cuatro dicotomías MBTI desde publicaciones de PersonalityCafe?