Cognitive Alignment in Personality Reasoning: Leveraging Prototype Theory for MBTI Inference

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Haoyuan Li, Yuanbo Tong, Yuchen Li, Zirui Wang, Chunhou Liu, Jiamou Liu

Palabras clave: Computation and Language, Artificial Intelligence

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
7
Hallazgos
14
Limitaciones
9
Evidencias

Resumen editorial

Español

El artículo propone ProtoMBTI para inferir uno de los 16 tipos MBTI a partir de publicaciones de usuarios. El sistema aumenta los datos de Kaggle y Pandora con GPT-4o y GPT-4o-mini, filtra ejemplos sintéticos con un clasificador de cuatro dicotomías, ajusta mediante LoRA codificadores de hasta 2B parámetros y almacena cada texto, su representación y su etiqueta como prototipo. En inferencia, GPT-4o-mini, Qwen2-72B o Llama-3.1-70B recibe el texto consultado y los tres prototipos más próximos para razonar y votar una clase. En los resultados principales, la mejor variante individual alcanza en Kaggle un promedio de 85,14 % en las cuatro dicotomías y 71,42 % de exactitud directa en los 16 tipos; en Pandora, GPT-4o-mini obtiene 71,41 % y 60,22 %, respectivamente. Los experimentos con entrenamiento mixto informan hasta 96,41 % por dicotomía y 92,13 % en 16 tipos dentro de Pandora, y alrededor de 81 % en la clasificación de 16 tipos al transferir entre dominios. Los baselines, sin embargo, no se comparan de forma equivalente en la tarea de 16 tipos: su cifra se calcula multiplicando las cuatro exactitudes bajo un supuesto de independencia, mientras ProtoMBTI se evalúa con una predicción multiclase directa. La amenaza principal afecta al propio protocolo de test. El Algoritmo 3 compara cada predicción con la etiqueta real del ejemplo de prueba y, solo si acierta, incorpora ese ejemplo ya etiquetado al banco para las predicciones posteriores. Esto es adaptación supervisada y secuencial sobre el test, no inferencia sin etiquetas; hace que el resultado dependa del orden y puede inflar especialmente los resultados mixtos. No se ofrece una ablación que elimine por separado esa retención. Además, aunque el texto afirma que el test permanece crudo, cada entrada de test pasa por una explicación/aumento generado por LLM antes de clasificarse. Los anexos tampoco permiten reconstruir con seguridad la evaluación: los totales posteriores al aumento difieren entre las Tablas 7 y 8, los recuentos de test de Pandora cambian según la dicotomía y varias matrices contienen unas 4.800 observaciones equilibradas, no las 835 muestras crudas declaradas. Los rótulos de las Figuras 10–12 se contradicen con sus títulos y pies. Por ello, el trabajo aporta una arquitectura interesante y ablations útiles sobre recuperación y aumento, pero no demuestra de forma fiable la magnitud de las mejoras ni una alineación cognitiva humana. Las etiquetas son autodeclaraciones MBTI de foros, los prompts incorporan estereotipos de cada tipo y la interpretabilidad se apoya en explicaciones generadas por el mismo tipo de modelo, sin validación humana de fidelidad.

English

The paper proposes ProtoMBTI to infer one of 16 MBTI types from user posts. It augments Kaggle and Pandora with GPT-4o and GPT-4o-mini, filters synthetic examples through a four-dichotomy classifier, LoRA-fine-tunes encoders of at most 2B parameters, and stores each text, embedding, and label as a prototype. At inference, GPT-4o-mini, Qwen2-72B, or Llama-3.1-70B receives a query and its three nearest prototypes for reasoning and voting. In the main results, the best single-model variant reaches 85.14% average dichotomy accuracy and 71.42% direct 16-type accuracy on Kaggle; on Pandora, GPT-4o-mini reaches 71.41% and 60.22%. Mixed-training experiments report as much as 96.41% average dichotomy accuracy and 92.13% 16-type accuracy for within-Pandora evaluation, and roughly 81% 16-type accuracy in cross-domain settings. The baseline comparison is not equivalent for the 16-type task: baseline figures are calculated by multiplying four dichotomy accuracies under an independence assumption, whereas ProtoMBTI is evaluated using a direct multiclass prediction. More importantly, Algorithm 3 compares every test prediction with the example’s ground-truth label and, only when correct, inserts that now-labeled test example into the prototype bank for subsequent predictions. This is sequential supervised test-time adaptation, not label-free inference; it makes results order-dependent and may inflate the mixed-setting results in particular. No ablation separately removes retention. Although the paper says test sets remain raw, every test input also undergoes LLM-generated explanation/augmentation before classification. The appendices do not provide a coherent reconstruction of evaluation: post-augmentation totals differ between Tables 7 and 8, Pandora test counts change across dichotomies, and several confusion matrices contain about 4,800 balanced observations rather than the stated 835 raw test users. Figure 10–12 plot titles also conflict with their captions. ProtoMBTI is therefore an interesting retrieval and augmentation architecture with useful component ablations, but the reported gain magnitude and claimed human-like cognitive alignment are not established reliably. Labels are self-reported MBTI types from online communities, class prompts encode type stereotypes, and interpretability rests on model-generated explanations without human faithfulness validation.

Pregunta de investigación

¿Puede una arquitectura de recuperación y razonamiento inspirada en la teoría de prototipos mejorar la inferencia de las cuatro dicotomías y los 16 tipos MBTI a partir de texto, explicar sus decisiones y transferir entre los conjuntos Kaggle y Pandora?

Método

Se dividen Kaggle y Pandora en entrenamiento, validación y test con una proporción declarada de 8:1:1. Solo entrenamiento y validación se equilibran mediante generación de ejemplos por clase y transformaciones semánticas, lingüísticas y de sentimiento con GPT-4o/GPT-4o-mini, filtradas por un clasificador BERT, RoBERTa o DeBERTa de cuatro dicotomías. Se ajustan mediante LoRA DeepSeek-1B, Qwen2.5-1.5B y Llama-3-1B para representar los ejemplos y construir un banco de tripletas texto–embedding–tipo. En test, el texto se transforma con un LLM, se recuperan los tres vecinos más próximos y GPT-4o-mini, Qwen2-72B o Llama-3.1-70B razona sobre ellos. El algoritmo comprueba la predicción con la etiqueta real y añade los aciertos al banco. Se informa exactitud por dicotomía y tipo completo, más F1, recall, matrices de confusión y ROC en anexos; no se informan repeticiones, intervalos, pruebas estadísticas ni semillas concretas.

Muestra: Kaggle contiene 8.675 usuarios de PersonalityCafe, cada uno con extractos de sus 50 publicaciones más recientes, y Pandora contiene 9.067 usuarios de Reddit. La Tabla 6 confirma esos totales brutos. Después del aumento, la Tabla 7 declara 34.050 ejemplos para Kaggle y 33.994 para Pandora, mientras la Tabla 8 declara 34.068 y 34.079; no se explica la diferencia. La Tabla 9 atribuye 853 casos de test a Kaggle en cada dicotomía, salvo un error de 91 ejemplos en el I/E de entrenamiento. En Pandora los recuentos de test suman 835, 843, 855 y 845 según la dicotomía, aunque cada usuario debería aportar las cuatro letras. Las matrices mixtas de Pandora y transferencia muestran aproximadamente 300 observaciones por cada uno de los 16 tipos, unas 4.800, incompatibles con los 835 casos de test crudo declarados. No se publican los identificadores del split ni los resultados por ejemplo.

Hallazgos

  • En Kaggle, ProtoMBTI con Qwen obtiene el mejor promedio individual por dicotomía, 85,14 %, y 71,42 % de exactitud directa en los 16 tipos; la variante con GPT-4o-mini alcanza 82,66 % y 68,39 %.
  • En Pandora, GPT-4o-mini obtiene el mejor resultado individual: 71,41 % de promedio por dicotomía y 60,22 % en 16 tipos; Qwen logra 70,55 % y 41,86 %, mostrando que la media dicotómica no determina el rendimiento multiclase.
  • Con entrenamiento mixto, el artículo informa 93,50 %/85,54 % para test Kaggle y 96,41 %/92,13 % para test Pandora en validación del mismo dominio; en transferencia cruzada informa alrededor de 91 % por dicotomía y 81 % en 16 tipos.
  • Las ablations de Kaggle reducen la exactitud de 16 tipos desde 71,42 % a 50,77 % con prototipos aleatorios, 54,15 % sin prototipos, 45,37 % con texto crudo y 60,62 % con solo el codificador; no hay una ablación de la retención supervisada durante test.
  • La recuperación con k=3 produce 59,38 % en el experimento de sensibilidad mostrado; k=1 logra 56,92 % y k=9, 55,38 %.
  • El clasificador de control DeBERTa obtiene 88,63 % de promedio y 71,08 % en 16 tipos en validación Kaggle, un resultado muy próximo al 71,42 % principal de ProtoMBTI con Qwen.
  • Las mejoras publicadas no pueden atribuirse limpiamente al razonamiento por prototipos porque el test usa sus etiquetas para retener ejemplos y el número/origen de casos evaluados no concuerda entre tablas y figuras.

Limitaciones

  • El Algoritmo 3 consulta la etiqueta real de cada caso de test y añade al banco los aciertos para predecir los casos siguientes. Es una adaptación supervisada y transductiva sobre el test, dependiente del orden, que no estaría disponible en despliegue.
  • No existe una ablación que compare la misma tubería con y sin retención basada en la etiqueta real; por ello no puede separarse cuánto rendimiento procede de la recuperación inicial y cuánto de contaminar progresivamente el banco con el test.
  • La comparación de 16 tipos no es equivalente: para los baselines se multiplica la exactitud de cuatro clasificadores suponiendo independencia, pero ProtoMBTI recibe crédito por una predicción multiclase observada directamente.
  • El texto dice que el test queda crudo, pero el Algoritmo 3 aplica la transformación A2 a cada publicación antes de inferir. La entrada evaluada incluye así explicaciones semánticas, afectivas y estilísticas generadas por LLM.
  • Los totales de datos son internamente incoherentes: las Tablas 7 y 8 difieren en 18 ejemplos de Kaggle y 85 de Pandora; la Tabla 9 cambia el total de test Pandora entre dicotomías; y varias matrices muestran unas 4.800 observaciones equilibradas en lugar de 835 casos crudos.
  • Las Figuras 10–12 contienen contradicciones entre el título del gráfico y su pie: Qwen-Pandora se describe como Llama en Kaggle, y gráficos rotulados Qwen se presentan como Llama. Esto impide asignar con seguridad esas matrices a un modelo y conjunto.
  • Se afirma significación y robustez sin pruebas estadísticas, intervalos de confianza, desviaciones, ejecuciones repetidas, valores de semilla ni análisis de sensibilidad al orden del test.
  • Las etiquetas son tipos MBTI autodeclarados por usuarios de foros, no diagnósticos ni mediciones psicométricas verificadas; no se mide fiabilidad de etiqueta ni acuerdo humano.
  • El aumento parte de prompts que codifican descripciones estereotipadas de los 16 tipos y usa un clasificador entrenado con las mismas etiquetas como filtro, lo que puede amplificar artefactos lingüísticos y separabilidad circular.
  • Las explicaciones y el caso cualitativo provienen de LLM; no hay evaluación humana, prueba de fidelidad causal ni comprobación de que el razonamiento textual refleje el mecanismo que produjo la clase.
  • t-SNE y la separación de embeddings no validan la teoría psicológica de prototipos ni la afirmación de alineación cognitiva. El estudio no incluye experimento cognitivo con personas ni comparación con juicios humanos graduados.
  • No se evalúan sesgos por grupo, privacidad residual, consentimiento, uso indebido o daño de inferir personalidad desde publicaciones. La limpieza de PII se afirma sin describir reglas o auditoría.
  • La versión v1 no enlaza un repositorio reproducible. El manuscrito declara código parcialmente generado con GPT-4.1 y validado por los autores, pero no permite inspeccionar implementación, splits, prompts ejecutados, resultados crudos ni snapshots exactos de las APIs.
  • La maquetación conserva un pie ajeno de “NeurIPS 2023 Generative AI and Biology Workshop” en un preprint de 2025 y errores de figuras/tablas, señales adicionales de control editorial insuficiente.

Qué no demuestra

  • No demuestra que ProtoMBTI pueda aprender en producción a partir de predicciones correctas sin recibir confirmación o etiqueta externa; el protocolo de evaluación sí dispone de la verdad de test.
  • No establece una mejora válida y comparable frente a los baselines en la clasificación completa de 16 tipos, porque esas cifras se calculan con procedimientos distintos.
  • No demuestra que la teoría de prototipos describa el mecanismo cognitivo del LLM ni que exista alineación con el razonamiento humano; usa una analogía arquitectónica y etiquetas MBTI.
  • No valida MBTI como constructo psicométrico ni convierte tipos autodeclarados de foros en rasgos clínicos, laborales o personales fiables.
  • No prueba que las explicaciones generadas sean fieles, que los prototipos sean interpretables para personas ni que la decisión dependa causalmente de los ejemplos recuperados.
  • No permite verificar las cifras principales ni saber qué conjunto exacto alimenta las matrices de confusión y ROC a partir de los materiales publicados en la versión auditada.
  • No justifica usar el sistema para selección de personal, salud mental, vigilancia, personalización sensible o decisiones sobre individuos.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2511.00115v1, submitted 31 October 2025, 43 pages

Fuente consultada: https://arxiv.org/pdf/2511.00115v1

Revisión: Codex full-text, bilingual-fidelity, 43-page visual, source-integrity, test-leakage, split-accounting, baseline-comparability, construct-validity, statistical, interpretability, privacy, reproducibility and editorial-consistency audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o
  • GPT-4o-mini
  • GPT-5 for manuscript refinement
  • GPT-4.1-based coding assistant
  • Qwen2-72B
  • Llama-3.1-70B
  • DeepSeek-1B encoder
  • Qwen2.5-1.5B encoder
  • Llama-3-1B encoder
  • BERT
  • RoBERTa
  • DeBERTa

Instrumentos y métricas

  • LLM-guided class balancing and semantic, linguistic and sentiment augmentation
  • Four-dichotomy gatekeeper classifier
  • LoRA prototype encoder and cosine top-k retrieval
  • Retrieve–reuse–revise–retain inference cycle with prompt voting
  • Direct four-dichotomy and 16-type accuracy
  • Macro F1, recall, confusion matrices and micro/macro ROC AUC
  • t-SNE visualization
  • Author-designed MBTI stereotype prompts

Datos utilizados

  • Kaggle MBTI Personality Type Dataset / PersonalityCafe posts
  • PANDORA Reddit personality dataset
  • LLM-augmented derivatives of Kaggle and PANDORA

Evidencia y localización

  • Objetivo, arquitectura y resultados principales: Paper, pp. 1–3, Abstract and Introduction; pp. 8–10, Tables 1–2
  • Aumento, construcción de prototipos e inferencia con verdad de test: Paper, pp. 4–7, Sections 3.1–3.3 and Figure 3; pp. 18–20, Algorithms 1–3
  • Modelos, splits, métricas y configuración experimental: Paper, pp. 7–8 and 17–18, Experiment Setup and Implementation Details
  • Ablations de prototipos, aumento, encoder y k: Paper, pp. 9–10, Table 2; pp. 23–24, More Results and Figure 6
  • Distribuciones y recuentos internamente incompatibles: Paper, pp. 28–29, Tables 6–9
  • F1, recall y comparación del gatekeeper: Paper, p. 30, Tables 10–13
  • Matrices con rótulos contradictorios y tamaños no reconciliados: Paper, pp. 31–36 and 40–43, Figures 8–13 and 17–20
  • Uso de LLM, PII y ausencia de materiales reproducibles enlazados: Paper, p. 15, Appendix A, The Use of Large Language Models; arXiv:2511.00115v1 metadata
  • Inspección visual integral y defectos editoriales: Paper, all 43 rendered pages; p. 1 unrelated NeurIPS 2023 footer; pp. 33–35 title/caption mismatches