Can Large Language Models Understand You Better? An MBTI Personality Detection Dataset Aligned with Population Traits

Evaluación y validez psicométrica2025ACL AnthologyRevisión editorial aprobada

Autores: Bohan Li, Jiannan Guan, Longxu Dou, Yunlong Feng, Dingzirui Wang, Yang Xu, Enbo Wang, Qiguang Chen, Bichen Wang, Xiao Xu, Yimeng Zhang, Libo Qin, Yanyan Zhao, Qingfu Zhu, Wanxiang Che

Palabras clave: Computation and Language, Computers and Society, MBTI Personality Detection, Large Language Models, Personality Traits

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

15
Autores
13
Hallazgos
24
Limitaciones
19
Evidencias

Resumen editorial

Español

El artículo presenta MBTIBench, un banco de 286 perfiles tomado de los test sets de Kaggle MBTI, PANDORA y Twitter. Selecciona aproximadamente seis usuarios por cada uno de los 16 tipos autodeclarados y por fuente, elimina manualmente frases consideradas ruido o fuga de etiqueta, y pide a tres anotadores con formación universitaria en inglés que asignen a cada eje MBTI una de cuatro intensidades. Un procedimiento inspirado en Dawid–Skene ordena las combinaciones de anotaciones y las transforma, mediante frecuencias acumuladas normalizadas, en puntuaciones entre 0 y 1. Se comparan seis LLM y cuatro prompts; zero-shot suele ser competitivo, pero ningún modelo supera de forma consistente al baseline de predecir la media y las distribuciones presentan fuertes concentraciones dependientes del modelo y del prompt. En una prueba auxiliar de estrés sobre 300 casos de Dreaddit, añadir etiquetas blandas eleva la accuracy media de 72,13% sin MBTI y 73,37% con etiquetas duras a 74,00%, aunque la ventaja sobre etiquetas duras es solo 0,63 puntos, se invierte en tres de diez ejecuciones y el artículo no publica el resultado del test estadístico. La aportación defendible es señalar ruido, fuga de etiquetas, desacuerdo y sesgos de salida en los benchmarks de detección MBTI. No queda demostrado que el 29,58% de autoinformes sea psicológicamente incorrecto: esa cifra expresa desacuerdo con inferencias de tres anotadores, no comparación con un instrumento independiente. Tampoco se valida el supuesto alineamiento poblacional; la muestra se balancea por tipo, las etiquetas blandas se construyen a partir de las frecuencias del propio conjunto y una auditoría del release encuentra referencias explícitas a MBTI o teorías afines en al menos 67 de 286 registros. Inconsistencias entre escala, discretización y código, junto con acuerdo interanotador moderado y problemas de privacidad/licencia, obligan a interpretar MBTIBench como un recurso experimental todavía frágil, no como verdad psicométrica sobre las personas.

English

The paper introduces MBTIBench, a 286-profile benchmark drawn from the test sets of Kaggle MBTI, PANDORA, and Twitter. It selects roughly six users per self-reported 16-type class and source, manually removes sentences considered noise or label leakage, and asks three English-degree annotators to assign one of four intensity labels on each MBTI dimension. A Dawid–Skene-inspired procedure ranks annotation combinations and converts them, through normalized cumulative frequencies, into scores between 0 and 1. Six LLMs and four prompting methods are compared; zero-shot is often competitive, but no model consistently beats the mean-label baseline and predictions show strong model- and prompt-specific concentrations. In an auxiliary stress task on 300 Dreaddit cases, adding soft labels raises mean accuracy from 72.13% without MBTI and 73.37% with hard labels to 74.00%, although the gain over hard labels is only 0.63 points, reverses in three of ten runs, and the paper does not report the statistical test result. The defensible contribution is its attention to noise, label leakage, disagreement, and output bias in MBTI detection benchmarks. It does not establish that 29.58% of self-reports are psychologically incorrect: that figure records disagreement with three annotators' text-based inferences, not validation against an independent instrument. Population alignment is also unproven because sampling is balanced by type, soft scores are constructed from frequencies within the same dataset, and an audit of the release finds explicit MBTI or related-theory references in at least 67 of 286 records. Scale and discretization inconsistencies, moderate agreement, and privacy and licensing concerns make MBTIBench a useful but still fragile experimental resource rather than psychometric ground truth about people.

Pregunta de investigación

¿Puede un test set de detección MBTI, limpiado y reanotado con intensidades blandas, ofrecer una evaluación más realista de la inferencia de personalidad desde texto, qué patrones y sesgos muestran seis LLM bajo cuatro estrategias de prompting y aportan esas etiquetas información útil en una tarea auxiliar de detección de estrés?

Método

Se reconstruyen los test sets de Kaggle MBTI, PANDORA y Twitter seleccionando seis perfiles por cada uno de los 16 tipos en cada fuente, salvo cuatro ESFJ disponibles en PANDORA, para un total de 286. Se eliminan manualmente frases de menos de 100 palabras, texto ilegible, enlaces y menciones directas o indirectas de teorías de personalidad. Tres anotadores con grado o máster en inglés, entrenados con ejemplos elaborados bajo orientación de estudiantes de doctorado y expertos en psicología, asignan independientemente E+/E−/I−/I+ y equivalentes en los cuatro ejes. Tras tres rondas piloto, votación, revisión humana y reanotación de menos del 15%, se obtienen kappas de Fleiss entre 0,4622 y 0,5517. Un algoritmo inspirado en Dawid–Skene estima probabilidades por combinación de anotadores y después las reescala mediante frecuencias acumuladas para crear etiquetas blandas. Se evalúan gpt-4o-mini, gpt-4o, Qwen2-7B/72B-Instruct y Llama-3.1-8B/70B-Instruct con zero-shot, step-by-step, few-shot y PsyCoT, temperatura 0 y truncación de cada post a 80 tokens. Las predicciones continuas se comparan mediante RMSE/MAE y versiones segmentadas; las duras, con accuracy y macro-F1. Finalmente, gpt-4o infiere MBTI desde cada post de Dreaddit y Llama-3.1-70B usa esa información como entrada auxiliar para clasificar estrés en diez ejecuciones. La revisión también contrasta el dataset, los logs SQLite y el código público del commit b33ec40.

Muestra: MBTIBench contiene 286 perfiles: 96 de Kaggle, 96 de Twitter y 94 de PANDORA. El muestreo parte de seis casos por cada tipo MBTI y fuente, con solo cuatro ESFJ disponibles en PANDORA; por tanto es deliberadamente equilibrado por etiquetas autodeclaradas y no una muestra poblacional. Cada perfil recibe cuatro anotaciones de dimensión por tres anotadores. Los experimentos abiertos se repiten cinco veces y los dos modelos GPT una sola vez. La validación auxiliar usa 300 casos de Dreaddit durante diez ejecuciones por condición.

Hallazgos

  • Los autores contabilizan ruido inútil en 15,92% de Kaggle, 43,13% de Twitter y 2,65% de PANDORA, y fuga de etiqueta en 31,21%, 0,62% y 16,56%, respectivamente. Estas cifras muestran que los benchmarks originales contienen atajos importantes.
  • El 29,58% destacado en el abstract agrega desacuerdos entre las etiquetas autodeclaradas y la mayoría de los anotadores: 29,17% en Kaggle, 29,17% en Twitter y 29,79% en PANDORA. El estudio no dispone de una medida psicológica independiente que determine cuál de ambas es correcta.
  • El acuerdo final es moderado: kappa de Fleiss 0,4779 en E/I, 0,4686 en S/N, 0,5517 en T/F y 0,4622 en J/P. La dimensión mejor acordada sigue lejos de una concordancia casi perfecta.
  • El release contiene 38, 41, 42 y 43 valores blandos únicos para E/I, S/N, T/F y J/P. No son mediciones continuas individualizadas: cada valor depende de una de las combinaciones observadas de tres etiquetas ordinales y de su frecuencia en el mismo conjunto.
  • La distribución de etiquetas blandas tiene más casos centrales que extremos, pero esta forma no constituye una validación poblacional independiente porque el mapeo utiliza frecuencias acumuladas del propio benchmark y la muestra fue seleccionada por cuotas de tipos.
  • El baseline de predecir la media obtiene S-RMSE de 2,66, 2,70, 2,82 y 3,04 en E/I, S/N, T/F y J/P. Numerosas combinaciones de modelo y prompt lo empeoran, de modo que los LLM no demuestran una ventaja consistente sobre una regla sin texto.
  • Zero-shot consigue el mejor rango dentro de gpt-4o-mini y Llama-3.1-8B y suele estar entre los mejores métodos, pero no domina todos los backbones: PsyCoT tiene mejor rango en Qwen2-7B y hay empates o ventajas por dimensión para otros prompts.
  • En clasificación dura, el mejor resultado global de la tabla suplementaria es gpt-4o con step-by-step, 66,70% de accuracy y 65,75 macro-F1. Algunas configuraciones muestran brechas grandes entre accuracy y F1, señal de predicciones concentradas en clases mayoritarias.
  • Las figuras muestran distribuciones discretas y fuertemente polarizadas: Qwen2 se concentra a menudo en el punto medio, PsyCoT puede empujar respuestas a extremos y las predicciones duras favorecen P en J/P. Son sesgos de salida bajo este protocolo, no una medición general de fairness.
  • En Dreaddit, las medias publicadas son 72,13/71,95 de accuracy/F1 sin MBTI, 73,37/72,40 con etiqueta dura y 74,00/73,73 con etiqueta blanda. Los logs liberados reproducen esas medias.
  • La ventaja de soft sobre hard en Dreaddit es pequeña: 0,63 puntos de accuracy media y las etiquetas blandas quedan por debajo de las duras en tres de diez rondas. El artículo afirma haber realizado un t-test, pero no publica estadístico, p-value, intervalo ni tamaño de efecto.
  • Los logs SQLite y el evaluador permiten reproducir las tablas principales con nueve bins. Esto aporta trazabilidad parcial, aunque expone una contradicción con el texto de actas, que afirma usar diez intervalos.
  • La versión de actas de COLING 2025 confirma los resultados principales del preprint y publica el trabajo en las páginas 5071–5081; los apéndices metodológicos y éticos solo están disponibles en arXiv v1.

Limitaciones

  • El desacuerdo con una etiqueta autodeclarada no demuestra que el autoinforme sea incorrecto. Los anotadores infieren señales lingüísticas según una guía; no administran MBTI, no observan conducta longitudinal y no disponen de historia clínica o evaluación de informantes.
  • Los tres anotadores tienen formación en inglés, no acreditación profesional en psicometría. Estudiantes de doctorado y expertos en psicología orientan las guías y revisiones, pero no se identifica su número, independencia, especialización ni papel exacto en cada adjudicación.
  • Las guías pueden convertir estereotipos lingüísticos en supuesta verdad: asocian ansiedad social con introversión, escritura formal y tiempos verbales con J, gramática casual con P y emoción expresada con F. Estas señales pueden reflejar situación, idioma, salud o plataforma.
  • Los kappas 0,46–0,55 indican acuerdo solo moderado. El criterio de aceptación de 0,45 es bajo para un recurso presentado como high-quality y no se acompaña de intervalos, acuerdo por fuente, confusiones o fiabilidad de la intensidad +/−.
  • La revisión de casos 'unreasonable' no se describe como ciega ni independiente. Los problemas se comunican al mismo anotador y se reinsertan para reanotación; no se informa cuántos casos exactos cambian ni cómo se resuelven desacuerdos persistentes.
  • El muestreo por seis casos de cada tipo MBTI en cada fuente no representa ninguna población natural. No hay pesos poblacionales, demografía, país, edad, género, nivel educativo ni comparación con una muestra probabilística.
  • La afirmación de alineamiento poblacional es circular: el algoritmo ordena combinaciones de anotadores, acumula su frecuencia dentro de MBTIBench y normaliza ambos lados de 0,5. Observar después más valores centrales en esa distribución no valida una estructura latente externa.
  • Las etiquetas blandas no son respuestas a un instrumento continuo ni estimaciones individuales con incertidumbre. Solo hay 38–43 valores distintos por eje, compartidos por todos los perfiles con la misma combinación de tres etiquetas.
  • El dataset liberado no incluye las etiquetas autodeclaradas originales, por lo que la cifra de 29,58% y los desplazamientos antes/después no pueden reproducirse directamente desde los artefactos publicados.
  • Una auditoría conservadora del JSONL encuentra al menos 67 de 286 perfiles con términos explícitos como MBTI, eneagrama, introvertido, extrovertido o tipos de cuatro letras: 34 en Kaggle y 33 en PANDORA. Varias entradas contienen explicaciones extensas de funciones y tipos, contradiciendo la eliminación declarada de fuga directa y cross-theory.
  • La selección de pocos ejemplos se hace manualmente y no se estudia su sensibilidad. Los prompts no reciben información equivalente: PsyCoT añade un cuestionario completo y few-shot puede inducir el rango de las demostraciones elegidas.
  • El texto de método dice predecir valores 1–9, mientras las plantillas solicitan 0–10. El parser acepta 0 y 10 pero transforma con (score−1)/8, produciendo −0,125 o 1,125, fuera del rango declarado.
  • Las aserciones de rango del evaluador usan y_true.all() y y_pred.all(), por lo que solo comprueban booleanos y no detectan predicciones fuera de [0,1]. Los logs contienen algunas respuestas extremas 0 o 10 en Llama-3.1-8B.
  • El artículo de actas afirma discretizar en diez intervalos; el apéndice y el código usan nueve. Las cifras de la tabla coinciden con nueve bins, de modo que la definición publicada del métrico no reproduce el resultado sin consultar el repositorio.
  • El preprint arXiv v1 contiene ejemplos numéricos de baseline y Llama-3.1-70B que no coinciden con su tabla principal. La versión de actas reorganiza esas preguntas de investigación, pero no documenta explícitamente la corrección.
  • Los aliases gpt-4o y gpt-4o-mini no fijan snapshot ni fecha. Los modelos abiertos carecen de revisión de checkpoint y semillas; el código usa rutas locales rígidas y tokenizers de 70B/72B incluso para variantes 8B/7B.
  • Los modelos abiertos se repiten cinco veces, pero GPT solo una. No hay intervalos de confianza ni tests por modelo, dimensión o prompt; las desviaciones casi nulas con temperatura 0 no sustituyen una evaluación sobre nuevas muestras.
  • La prueba de Dreaddit usa la misma publicación para inferir MBTI y para detectar estrés. La etiqueta auxiliar puede actuar como reformulación generada de señales del propio texto, sin demostrar que represente personalidad ni que medie causalmente la mejora.
  • El código del t-test usa ttest_ind sobre rondas emparejadas y no publica resultados. Soft supera a hard por solo 0,63 puntos de accuracy media y pierde en tres rondas, por lo que la afirmación de superioridad necesita un análisis emparejado y un intervalo de efecto.
  • El término 'bias' se aplica a concentraciones de puntuaciones entre modelos y prompts. No se evalúan grupos protegidos, daño, calibración, falsos positivos por demografía ni consecuencias de uso; no es una auditoría de equidad social.
  • El repositorio no incluye tests automatizados, manifiesto de hardware completamente portable ni una licencia jurídica, aunque el README afirma permitir investigación académica y comercial sin restricciones. La reproducibilidad depende de rutas y hosts internos, APIs y paquetes CUDA fijados.
  • El release redistribuye texto social con nombres, edades, ubicaciones, diagnósticos, medicación, depresión, ataques de pánico y referencias a ideación suicida. Haber tomado datos públicos o con permiso de adaptación no equivale a consentimiento para una nueva inferencia psicológica; faltan auditoría de desidentificación, procedimiento de retirada y licencia clara por fuente.
  • La declaración ética afirma que la privacidad se mantiene porque no se interactúa con las cuentas, pero la publicación de mensajes sensibles puede permitir reidentificación por búsqueda textual. Tampoco se discute el riesgo de usar etiquetas inferidas en empleo, educación, salud o personalización persuasiva.
  • El estudio se limita a texto social en inglés, MBTI y modelos de 2024. No valida estabilidad temporal, conversación multi-turn, otros idiomas/culturas, Big Five, entornos privados ni decisiones reales sobre usuarios.

Qué no demuestra

  • No demuestra que el 29,58% de las personas haya informado mal su personalidad ni que las etiquetas de los anotadores sean la verdad psicológica.
  • No demuestra que MBTIBench reproduzca la distribución de personalidad de una población humana ni que sus puntuaciones sean equivalentes a una escala psicométrica continua validada.
  • No demuestra que los LLM comprendan mejor a una persona, infieran rasgos internos estables o superen consistentemente un baseline que ignora el texto.
  • No demuestra que zero-shot sea universalmente superior; el orden cambia según backbone, dimensión y métrica.
  • No demuestra que las etiquetas blandas mejoren de forma general otras tareas psicológicas: solo aporta un experimento de estrés pequeño, con la misma entrada reutilizada y una ventaja media reducida sobre hard labels.
  • No evalúa fairness demográfica ni demuestra que las concentraciones de salida procedan causalmente de los corpus de entrenamiento.
  • No justifica usar estas inferencias en clínica, selección laboral, educación, crédito, vigilancia, publicidad o decisiones individualizadas de alto impacto.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2412.12510v1 frozen source; COLING 2025 proceedings version, pp. 5071–5081, and linked repository commit b33ec40af3eba25f0ebec5e719da8784c714be30 also reviewed

Fuente consultada: https://arxiv.org/pdf/2412.12510

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • gpt-4o-mini (API alias; snapshot unspecified)
  • gpt-4o (API alias; snapshot unspecified)
  • Qwen2-7B-Instruct
  • Qwen2-72B-Instruct
  • Meta-Llama-3.1-8B-Instruct
  • Meta-Llama-3.1-70B-Instruct

Instrumentos y métricas

  • Myers–Briggs Type Indicator four dichotomies
  • Four-level polarity annotation per MBTI dimension
  • Fleiss’ kappa and annotator accuracy
  • Dawid–Skene-inspired EM and cumulative-frequency soft-label mapping
  • RMSE, MAE, segmented RMSE and segmented MAE
  • Accuracy and macro-F1
  • Zero-shot, step-by-step, few-shot and PsyCoT prompts

Datos utilizados

  • MBTIBench release (286 profiles)
  • Kaggle MBTI / PersonalityCafe test set
  • PANDORA test set
  • Twitter MBTI test set
  • Dreaddit stress-detection test subset (300 profiles)

Evidencia y localización

  • Publicación, objetivo y contribuciones declaradas: COLING 2025 proceedings, pp. 5071–5072, abstract and introduction
  • Fuentes, muestreo equilibrado y criterios de filtrado: COLING proceedings, pp. 5072–5073, sections 2.1 and 3.1–3.2
  • Formación de anotadores, pilotos y control de calidad: COLING proceedings, pp. 5073–5074, sections 3.3–3.4
  • Kappas finales y reanotación de menos del 15%: COLING proceedings, p. 5074, section 3.4.2 and footnote 6
  • Algoritmo EM, acumulación y normalización de tendencias: COLING proceedings, pp. 5074–5075, section 3.5 and Algorithm 1
  • Distribuciones de ruido, fuga y desacuerdo del 29,58%: arXiv:2412.12510v1, pp. 7–8, section 4 and Tables 3–4
  • Afirmación de alineamiento poblacional y distribución central: COLING proceedings, pp. 5075–5076, sections 4.2–4.3 and Figures 5–6
  • Modelos, prompts, truncación y evaluación: COLING proceedings, pp. 5076–5077, section 5
  • Baseline y resultados segmentados de los seis modelos: COLING proceedings, p. 5077, Table 2 and section 6.1
  • Polarización y concentración de predicciones: COLING proceedings, pp. 5077–5078, Figure 7 and RQ1–RQ3
  • Diseño y medias de la validación de estrés: COLING proceedings, p. 5078, section 6.2 and Figure 8
  • Templates, escala solicitada y métricas: arXiv v1, pp. 20–22, Appendix E and Tables 7–8
  • Resultados continuos y duros completos: arXiv v1, pp. 23–28, Appendix F and Tables 9–10
  • Declaraciones de privacidad y participación experta: arXiv v1, pp. 17–18, Appendices A–C
  • Tamaño, distribución por fuente y residuos de fuga en el release: Linked repository commit b33ec40af3eba25f0ebec5e719da8784c714be30, dataset/mbtibench.jsonl audit
  • Construcción discreta de etiquetas blandas y ausencia de etiquetas originales: Linked repository commit b33ec40, dataset/em_softlabel.py and dataset/mbtibench-nolabel.jsonl
  • Escala, parser, bins y comprobaciones de rango: Linked repository commit b33ec40, mbtibench/prompt.py, mbtibench/evaluator.py and reproduced SQLite metrics
  • Diez rondas de Dreaddit, medias y test estadístico no reportado: Linked repository commit b33ec40, downstream/results-reproduce and downstream/evaluate.py
  • Portabilidad, aliases, rutas y ausencia de licencia: Linked repository commit b33ec40, README.md, requirements.txt, mbtibench/llm.py and repository root