From Post To Personality: Harnessing LLMs for MBTI Prediction in Social Media

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Tian Ma, Kaiyu Feng, Yu Rong, Kangfei Zhao

Palabras clave: Computation and Language, Social and Information Networks, CIKM 2025

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
7
Hallazgos
18
Limitaciones
10
Evidencias

Resumen editorial

Español

PostToPersonality (P2P), publicado como short paper en CIKM 2025, clasifica por separado las cuatro dicotomías MBTI a partir de las 50 publicaciones recientes de cada uno de 8.675 usuarios de PersonalityCafe. Un DeepSeek-R1-Distill-Llama-8B local se ajusta con QA-LoRA durante diez épocas y genera una descripción textual de la personalidad. Para combatir el desbalance, el artículo interpola con SMOTE las representaciones ocultas de los quince tipos menos frecuentes. El texto original y la descripción generada se codifican con Sentence-BERT, se recuperan cinco usuarios de entrenamiento con sus etiquetas y una API DeepSeek-V3 produce las cuatro letras finales mediante aprendizaje en contexto. En un único split 60/20/20, P2P informa exactitudes de 93,21 % en I/E, 94,75 % en N/S, 93,06 % en T/F y 88,58 % en J/P, por encima de diez baselines clásicos y neuronales. Sin embargo, no se publica exactitud conjunta de los 16 tipos. La principal amenaza es una fuga de etiqueta inherente al corpus. El conjunto procede de un foro dedicado a MBTI y el preprocesado solo pasa a minúsculas, lematiza y elimina stopwords, caracteres, enlaces y espacios; no elimina nombres de tipos ni vocabulario MBTI. El propio anexo muestra un caso cuya entrada contiene literalmente “I knew I was an INTJ”, coincidiendo con su etiqueta real INTJ, y otro con abreviaturas como ENTP/ESTP/EXTP. El modelo y la recuperación pueden, por tanto, aprender autoetiquetas, citas y jerga del foro en lugar de inferir rasgos desde conducta lingüística. Tampoco se mide la alucinación: el artículo concluye que RAG la mitiga únicamente porque mejora algunas métricas de clasificación. El AUC de P2P no se calcula con probabilidades de su predicción, sino que se aproxima mediante la distribución de etiquetas reales entre los cinco vecinos recuperados; por ello no es el AUC del clasificador final ni una comparación equivalente con los baselines. La tubería de ajuste también está insuficientemente definida: se entrena al LLM local para predecir la etiqueta, pero después se usa para generar una explicación descriptiva sin publicar el objetivo que supervisa esa explicación; SMOTE crea vectores ocultos continuos, pero no se explica cómo se convierten en ejemplos compatibles con QA-LoRA. No hay código ni artefacto oficial enlazado, semillas, snapshots de API, temperatura, costes, repeticiones, intervalos o tests estadísticos. Los resultados prueban rendimiento sobre este benchmark contaminado, no inferencia psicométrica fiable de personalidad.

English

PostToPersonality (P2P), published as a CIKM 2025 short paper, separately classifies the four MBTI dichotomies from the 50 most recent posts of each of 8,675 PersonalityCafe users. A local DeepSeek-R1-Distill-Llama-8B is QA-LoRA-fine-tuned for ten epochs and generates a textual personality description. To address imbalance, the paper uses SMOTE to interpolate hidden representations for the 15 less frequent types. The original text and generated description are encoded with Sentence-BERT, five labeled training users are retrieved, and a DeepSeek-V3 API returns four letters through in-context learning. On one 60/20/20 split, P2P reports 93.21% I/E, 94.75% N/S, 93.06% T/F, and 88.58% J/P accuracy, outperforming ten conventional and neural baselines. It does not report joint 16-type accuracy. The central threat is label leakage intrinsic to the corpus. Data come from an MBTI-focused forum, while preprocessing only lowercases, lemmatizes, and removes stopwords, special characters, links, URLs, and whitespace; it does not remove type names or MBTI vocabulary. The appendix itself includes an input literally stating “I knew I was an INTJ”, matching its INTJ ground truth, and another containing ENTP/ESTP/EXTP abbreviations. The model and retriever can therefore learn self-labels, quotations, and forum jargon rather than infer traits from language behavior. Hallucination is not measured either: the paper concludes that RAG mitigates hallucination solely because some classification metrics improve. P2P AUC is not computed from its prediction probabilities; it is approximated using the ground-truth label distribution among the five retrieved neighbors. It is therefore not the final classifier’s AUC and is not equivalent to baseline AUC. The fine-tuning pipeline is also underspecified: the local LLM is trained to predict a label but later used to generate a descriptive explanation without a published target for that explanation; SMOTE creates continuous hidden vectors, but the paper does not explain how these become QA-LoRA training examples. No official code or artifact is linked, and seeds, API snapshot, decoding parameters, costs, repeated runs, intervals, and statistical tests are absent. The results demonstrate benchmark performance under severe leakage risk, not reliable psychometric personality inference.

Pregunta de investigación

¿Puede una arquitectura con ajuste eficiente de un LLM local, sobremuestreo de tipos minoritarios, recuperación de ejemplos etiquetados y una API LLM superar baselines en la clasificación de las cuatro dicotomías MBTI desde publicaciones de PersonalityCafe?

Método

Se concatenan las 50 publicaciones recientes de cada usuario y se dividen los 8.675 registros en 60 % entrenamiento, 20 % validación y 20 % test. El texto se normaliza, lematiza y limpia. DeepSeek-R1-Distill-Llama-8B se ajusta con QA-LoRA, AdamW, diez épocas, tasa 1e-4, batch 8, early stopping y dropout 5 %. Para todos los tipos salvo INFP, SMOTE interpola representaciones de la última capa entre usuarios de la misma etiqueta. El LLM local genera rasgos textuales; Sentence-BERT codifica por separado publicaciones y rasgos, concatena ambos vectores y FAISS recupera cinco vecinos del entrenamiento con sus etiquetas. DeepSeek-V3 recibe el texto, los rasgos y las demostraciones y devuelve cuatro letras. Se comparan exactitud, F1 y AUC con diez baselines y se hacen ablations de PEFT, SMOTE, RAG, backbones y k.

Muestra: El corpus contiene 8.675 usuarios de PersonalityCafe, cada uno con una etiqueta MBTI autodeclarada y sus 50 publicaciones recientes concatenadas. Se usan aproximadamente 5.205 usuarios para entrenamiento, 1.735 para validación y 1.735 para test si el reparto 60/20/20 es exacto, pero el artículo no publica las listas del split. La distribución es muy desigual: INFP e INFJ dominan y ESFJ, ESTJ, ESFP y ESTP son escasos. Los autores tratan como minoritarios los quince tipos salvo INFP. No se informa cuántos vectores sintéticos se generan, el balance final ni si se repitió la partición.

Hallazgos

  • P2P obtiene exactitud 0,9321/0,9475/0,9306/0,8858 y F1 0,9224/0,8747/0,9342/0,8759 en I/E, N/S, T/F y J/P, respectivamente.
  • Frente al mejor baseline de cada dicotomía, la ventaja absoluta media de exactitud calculable en la Tabla 1 es de unos 6,2 puntos, no una validación de personalidad fuera del corpus.
  • P2P no domina todos los AUC: en N/S obtiene 0,8849, por debajo del SVM con 0,9184. Además, su AUC usa etiquetas de vecinos y no probabilidades de la salida final.
  • Sin SMOTE, T/F alcanza F1 0,9530 y AUC 0,9516, superiores al sistema completo en esas métricas; SMOTE mejora otras dicotomías, por lo que su efecto no es uniformemente positivo.
  • Eliminar RAG manteniendo PEFT y SMOTE deja exactitudes de 0,8950/0,9061/0,9006/0,8674; RAG mejora el resultado, pero el estudio no mide alucinación factual ni demuestra que esa sea la causa.
  • La configuración con DeepSeek-V3 supera a GPT-4 en esta tabla, aunque no se fijan versión de API ni parámetros de decodificación y la explicación de consistencia entre modelos es especulativa.
  • Los casos cualitativos muestran atención a estereotipos como arte para INFP y pensamiento para ENTP; también revelan términos MBTI explícitos en las entradas, incluida la etiqueta INTJ del propio usuario.

Limitaciones

  • El corpus presenta fuga de etiqueta directa: las publicaciones del foro incluyen nombres de tipos y afirmaciones de autoidentificación. El anexo contiene “I knew I was an INTJ” en un caso con etiqueta INTJ y múltiples siglas MBTI en otro.
  • El preprocesado descrito no elimina cadenas MBTI, nombres de tipos, firmas, citas o respuestas a tests. No hay una evaluación con esas pistas enmascaradas ni un conjunto ajeno a foros de tipología.
  • La distribución de un foro autoseleccionado no demuestra la “distribución natural en la población”; esa afirmación confunde frecuencia del dataset con prevalencia poblacional.
  • Las etiquetas son tipos autodeclarados por usuarios, sin instrumento verificado, fecha, fiabilidad, acuerdo independiente o evaluación psicométrica.
  • Solo se publican métricas por dicotomía. No se informa qué porcentaje de usuarios obtiene correctamente las cuatro letras, que sería la exactitud real de los 16 tipos.
  • El AUC de P2P se aproxima a partir de la distribución de etiquetas reales de los vecinos recuperados, no de probabilidades o scores del predictor final; no es comparable de forma directa con el AUC de los baselines.
  • No se define si F1 es macro, micro, weighted o de una clase positiva ni qué polo se considera positivo; bajo fuerte desbalance, esa omisión cambia la interpretación.
  • La alucinación no tiene definición operacional, conjunto de hechos, evaluación humana o métrica. Una mejora de clasificación al añadir RAG no demuestra reducción de alucinaciones.
  • El objetivo publicado ajusta el LLM local para predecir la etiqueta c, pero la tubería después le pide producir una descripción textual h. No se documentan targets, prompts o pérdida que enseñen esa explicación.
  • SMOTE interpola representaciones continuas de la última capa y dice añadirlas al conjunto de ajuste QA-LoRA, pero no explica dónde se inyectan, cómo se alinean con secuencias de tokens ni cómo producen ejemplos generativos válidos.
  • Se denomina OOD al desbalance de clases, aunque rareza de clase y cambio de distribución son problemas distintos; no se evalúa generalización OOD.
  • Se usa un único split 60/20/20 sin semillas, repeticiones, intervalos de confianza, pruebas de significación ni análisis de sensibilidad a la partición.
  • No se especifican hardware, versión exacta de DeepSeek-V3, temperatura, top-p, semillas de decodificación, formato de reintentos, tasa de respuestas inválidas, coste o latencia.
  • La comparación de “estado del arte” se limita a diez baselines implementados por los autores y algunas ablations; no incluye una prueba limpia de prompting directo con control de contaminación ni otros datasets contemporáneos.
  • Las visualizaciones de atención no se validan como explicaciones fieles y la interpretación usa estereotipos MBTI. No hay evaluación humana, perturbación causal o acuerdo de expertos.
  • No se analiza privacidad, consentimiento, sesgo por edad/género/cultura/lengua, daño por perfilado, posibilidad de manipulación ni usos de alto impacto.
  • El paper no enlaza código, pesos, prompts completos, predicciones ni artefactos reproducibles; la búsqueda de materiales oficiales no identificó un repositorio verificable asociado a la publicación.
  • La sección de IA generativa declara que GPT-4.1 pulió parte del texto, pero no identifica qué pasajes; esto no invalida los resultados, aunque refuerza la necesidad de código y trazas experimentales que no se publican.

Qué no demuestra

  • No demuestra que P2P infiera personalidad desde lenguaje espontáneo; puede reconocer autoetiquetas MBTI, jerga del foro y correlaciones de un benchmark contaminado.
  • No establece una reducción de alucinaciones, porque no mide factualidad ni alucinación antes y después de RAG.
  • No demuestra rendimiento sobre los 16 tipos completos, poblaciones generales, otras plataformas, otras lenguas o usuarios que nunca mencionan MBTI.
  • No valida MBTI, la etiqueta autodeclarada ni las explicaciones psicológicas generadas por el LLM.
  • No prueba que SMOTE mejore de forma consistente todas las dicotomías ni que sus vectores sintéticos correspondan a textos o personas plausibles.
  • No justifica usar la herramienta para educación, empleo, salud mental, recomendación sensible, segmentación o decisiones sobre individuos.
  • No permite reproducir las cifras principales con materiales públicos enlazados por el artículo.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2509.04461v1, submitted 28 August 2025, 8 pages; CIKM 2025 short paper, DOI 10.1145/3746252.3760813

Fuente consultada: https://arxiv.org/pdf/2509.04461v1

Revisión: Codex full-text, bilingual-fidelity, 8-page visual, CIKM-metadata, direct-label-leakage, forum-contamination, metric-equivalence, SMOTE-implementation, RAG-hallucination, 16-type-scope, statistical, interpretability, privacy, fairness and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • DeepSeek-R1-Distill-Llama-8B
  • DeepSeek-V3 API
  • Sentence-BERT
  • MindChat-7B
  • ChatGLM-6B
  • GPT-4
  • Multinomial Naive Bayes
  • Logistic Regression
  • Support Vector Machine
  • XGBoost
  • Multilayer Perceptron
  • Word2Vec
  • e5-base
  • ModernBERT-base
  • DeBERTa-v3-base

Instrumentos y métricas

  • Four binary MBTI dichotomy classifiers
  • QA-LoRA fine-tuning
  • SMOTE on local-LLM hidden representations
  • FAISS exact k-nearest-neighbor retrieval
  • Labeled in-context demonstrations
  • Accuracy and unspecified F1 variant
  • Neighbor-label proxy AUC
  • Final-layer attention visualization

Datos utilizados

  • Kaggle MBTI Personality Type Dataset / PersonalityCafe forum posts

Evidencia y localización

  • Arquitectura, contribuciones y afirmaciones de rendimiento: Paper, pp. 1–2, Abstract, Introduction and Figure 1
  • Recuperación etiquetada, ajuste local y SMOTE oculto: Paper, pp. 2–3, Sections 3.1–3.2 and Equations 1–3
  • Dataset, split, modelos, API y AUC aproximado: Paper, p. 3, Section 4.1
  • Resultados principales y comparación con baselines: Paper, p. 4, Table 1
  • Ablations de PEFT, SMOTE, RAG, modelos y k: Paper, p. 4, Table 2 and Section 4.2.2
  • Fuga de etiqueta y ejemplos con siglas MBTI explícitas: Paper, pp. 6–8, Appendix D, especially Case 2: “I knew I was an INTJ”
  • Atención, estereotipos y ausencia de validación de fidelidad: Paper, p. 4, Figure 2 and Section 4.2.3
  • Uso de IA generativa y materiales no enlazados: Paper, p. 5, Usage of Generative AI; arXiv:2509.04461v1 metadata and paper references
  • Publicación CIKM 2025: Crossref record for DOI 10.1145/3746252.3760813; CIKM 2025, pp. 5011–5015
  • Inspección visual integral: Paper, all 8 rendered pages, including both result tables, three figures and complete case-study appendix