Ask, Answer, and Detect: Role-Playing LLMs for Personality Detection with Question-Conditioned Mixture-of-Experts

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Yifan Lyu, Liang Zhang

Palabras clave: Large Language Models, Personality, MBTI, Psychometrics, Persona

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
29
Hallazgos
50
Limitaciones
13
Evidencias

Resumen editorial

Español

ROME es un clasificador supervisado de las cuatro dimensiones binarias MBTI a partir de publicaciones de usuarios. Su etapa Ask entrega a GPT-4o-2024-08-06 los posts y la etiqueta MBTI verdadera de cada usuario de entrenamiento y le pide contestar 60 preguntas “MBTI-style” en una escala de −3 a +3. La etapa Answer entrena un Mixture-of-Experts condicionado por pregunta para reproducir esas respuestas sintéticas desde los posts; Detect combina las respuestas predichas con la representación textual para clasificar I/E, S/N, T/F y P/J. La fuente disponible sigue siendo arXiv v1 de 13 páginas; no se localizó versión publicada ni repositorio de código.

La intermediación no constituye una medición psicométrica independiente. El prompt ordena usar el tipo MBTI para resolver casos ambiguos o reforzar el juicio, y el método llama “ground truth” a respuestas que nunca fueron dadas por las personas. Así, la señal auxiliar está condicionada explícitamente por la misma clase objetivo que el modelo debe aprender. Esto puede ser una forma de destilación supervisada útil, pero no demuestra que GPT-4o reconstruya respuestas reales ni que el vector resultante sea evidencia psicológica. Las 60 preguntas no se publican completas, no se identifica su instrumento, licencia, fuente o estudio de validación y el texto alterna “standardized”, “validated” y “MBTI-style” sin aportar fiabilidad, estructura factorial, reglas de puntuación o comparación con respuestas humanas.

La evaluación usa 8.675 usuarios del corpus Kaggle/PersonalityCafe, con sus 50 posts más recientes, y 9.067 usuarios de PANDORA/Reddit, con decenas o cientos de posts. Las etiquetas son tipos autodeclarados en comunidades centradas en personalidad, no resultados administrados por el estudio ni una verdad objetiva. El paper declara splits de usuario 60/20/20 sin solapamiento, pero no publica seed, índices o repeticiones. Una auditoría de la descarga exacta de Kaggle citada encontró códigos MBTI explícitos en 8.220/8.675 filas (94,76%) y el tipo objetivo en 7.576 (87,33%). Un control determinista sin entrenamiento que elige el tipo más mencionado obtiene 64,20% de exactitud de 16 tipos y 79,70% de macro-F1 medio en las cuatro dimensiones. El artículo no informa haber eliminado esos tokens ni evalúa un corpus limpio, por lo que Kaggle mide en parte recuperación de etiquetas y lenguaje sobre MBTI, no solo inferencia de personalidad desde texto ordinario.

ROME reporta macro-F1 medio de 89,78% en Kaggle frente a 77,79% de ETM, una mejora relativa de 15,41%, y 69,04% en PANDORA frente a 65,77%, una mejora relativa de 4,97%. Sin embargo, no supera al mejor baseline en todas las dimensiones: cae 9,24% relativamente en P/J de Kaggle, 28,47% en I/E de PANDORA y 3,79% en P/J de PANDORA. No hay intervalos, desviaciones entre seeds, tests de significación o corrección por selección de hiperparámetros, por lo que “consistently” y “significantly” exceden la evidencia publicada. La prueba de escasez compara ROME con 40% de entrenamiento contra ETM con 100%, no contra baselines reentrenados con la misma fracción, y cada usuario reducido sigue requiriendo su etiqueta para generar las 60 dianas auxiliares.

Las ablaciones respaldan que la señal sintética contribuye al clasificador, no que sea psicométricamente válida. Sin evidencia auxiliar el promedio de Kaggle baja a 65,77%; usando solo esa evidencia llega a 75,12%. El análisis de expertos está condicionado por un one-hot del eje MBTI asignado por otro LLM no identificado, de modo que la especialización por eje no es enteramente emergente. El caso interpretativo elige un único usuario correctamente clasificado, calcula impacto por eliminación y después pide a GPT-4o seleccionar snippets compatibles; no rastrea la decisión real del modelo ni valida fidelidad. Incluso incluye como evidencia una frase sobre “INFPs”, ilustrando el riesgo de confundir discusión de tipos con rasgos del autor. Además, el texto intercambia las etiquetas random y minimum en la descripción de la Tabla 6.

El trabajo propone una arquitectura plausible para destilar supervisión sintética condicionada por etiqueta y obtiene promedios altos en dos benchmarks MBTI conocidos. La conclusión defendible es limitada: bajo un split no reproducible de comunidades con autodeclaraciones y fuerte vocabulario de tipos, el auxiliar generado por GPT-4o mejora un clasificador BERT/MoE. No establece respuestas de cuestionario humanas, validez psicométrica, inferencia de personalidad real, explicaciones fieles, robustez fuera de dominio, fairness, seguridad clínica ni aptitud para recomendación o salud mental.

English

ROME is a supervised classifier for the four binary MBTI dimensions from user posts. Its Ask stage gives GPT-4o-2024-08-06 each training user's posts and true MBTI label and asks it to answer 60 “MBTI-style” questions on a −3 to +3 scale. The Answer stage trains a question-conditioned Mixture-of-Experts to reproduce those synthetic answers from posts; Detect combines predicted answers with a text representation to classify I/E, S/N, T/F, and P/J. The available source remains the 13-page arXiv v1; no published version or code repository was located.

The intermediate targets are not independent psychometric measurements. The prompt tells the model to use the MBTI type to resolve ambiguous cases or reinforce its judgment, while the method calls answers never supplied by participants “ground truth.” The auxiliary signal is therefore explicitly conditioned on the same target class the classifier must learn. This may be a useful form of supervised distillation, but it does not show that GPT-4o reconstructs real questionnaire responses or that the resulting vector is psychological evidence. The full 60-item inventory is not released, and its instrument, license, source, or validation study is not identified. The paper alternates among “standardized,” “validated,” and “MBTI-style” without reporting reliability, factor structure, scoring rules, or agreement with human responses.

Evaluation uses 8,675 Kaggle/PersonalityCafe users with their 50 most recent posts and 9,067 PANDORA/Reddit users with dozens to hundreds of posts. Labels are self-declared types from personality-centered communities, not assessments administered by this study or objective ground truth. The paper states a user-disjoint 60/20/20 split but releases no seed, indices, or repeated runs. An audit of the exact cited Kaggle download found explicit MBTI codes in 8,220/8,675 rows (94.76%) and the row's own target type in 7,576 (87.33%). A parameter-free contamination control that predicts the most frequently mentioned type reaches 64.20% exact 16-type accuracy and 79.70% mean macro-F1 across the four dimensions. The paper does not report removing these tokens or evaluating a cleaned corpus, so Kaggle partly measures label recovery and MBTI-discussion language rather than personality inference from ordinary text alone.

ROME reports 89.78% mean macro-F1 on Kaggle versus 77.79% for ETM, a 15.41% relative gain, and 69.04% on PANDORA versus 65.77%, a 4.97% relative gain. It does not outperform the best baseline on every dimension: relative results are −9.24% for Kaggle P/J, −28.47% for PANDORA I/E, and −3.79% for PANDORA P/J. No confidence intervals, between-seed variation, significance tests, or hyperparameter-selection correction are reported, so “consistently” and “significantly” go beyond the published evidence. The limited-data experiment compares ROME trained on 40% of the data with ETM trained on 100%, rather than retraining baselines at the same fractions, and every retained user still requires a target label to generate 60 auxiliary targets.

Ablations support that the synthetic signal contributes to classification, not that it is psychometrically valid. Removing auxiliary evidence lowers Kaggle mean macro-F1 to 65.77%; using only that evidence reaches 75.12%. Expert routing receives an explicit one-hot MBTI-axis assignment produced by another unidentified LLM, so apparent axis specialization is not wholly emergent. The interpretability case selects one correctly classified user, computes item-removal impact, and then asks GPT-4o post hoc to select compatible snippets; this does not trace the model's actual decision or validate faithfulness. One displayed rationale even uses a sentence about “INFPs,” illustrating the risk of treating type discussion as evidence about the author. The prose also swaps the random- and minimum-removal labels around Table 6.

The paper presents a plausible architecture for distilling label-conditioned synthetic supervision and reports high averages on two familiar MBTI benchmarks. The defensible conclusion is narrow: on an unreproducible split of self-identifying communities with heavy type vocabulary, GPT-4o-generated auxiliary targets improve a BERT/MoE classifier. It does not establish human questionnaire responses, psychometric validity, real-personality inference, faithful explanations, out-of-domain robustness, fairness, clinical safety, or fitness for recommendation or mental-health decisions.

Pregunta de investigación

¿Puede una señal auxiliar de 60 respuestas MBTI sintéticas, generadas por un LLM que recibe posts y la etiqueta del usuario, mejorar la clasificación de las cuatro dimensiones MBTI mediante un Mixture-of-Experts condicionado por pregunta?

Método

Estudio supervisado sobre Kaggle/PersonalityCafe y PANDORA. Para cada usuario de entrenamiento, GPT-4o recibe posts y la etiqueta MBTI y genera T muestras de 60 respuestas Likert; T y la pauta completa de temperaturas no se especifican. Un router condicionado por posts, pregunta y eje MBTI combina 32 expertos MLP para imitar esas respuestas con pérdida L1. La importancia de cada ítem se calcula con la separación de respuestas sintéticas entre clases y la fiabilidad con varianza entre muestras. Las respuestas predichas se enmascaran por eje, se fusionan con BERT y se optimizan junto con cuatro pérdidas binarias. Se informa macro-F1 en un único split 60/20/20 y se añaden ablaciones en Kaggle.

Muestra: Kaggle contiene 8.675 usuarios y PANDORA 9.067. Los conteos de la Tabla 1 suman correctamente esos totales por cada dimensión y reflejan desequilibrios fuertes, especialmente S/N. El split declarado es 60/20/20 por usuario sin solapamiento. Las unidades no son participantes reclutados y evaluados por el estudio, sino cuentas de foros con tipos autodeclarados. Kaggle procede de PersonalityCafe y conserva abundante vocabulario MBTI; PANDORA obtiene etiquetas de presentaciones que mencionan el tipo. No se reportan edad, cultura, idioma, localización, consentimiento, eliminaciones, actividad, ni evaluación por subgrupos.

Hallazgos

  • arXiv v1 del 9 de diciembre de 2025 sigue siendo la última y única versión localizada.
  • La arquitectura tiene tres etapas: generación sintética Ask, imitación MoE Answer y clasificación fusionada Detect.
  • GPT-4o-2024-08-06 recibe explícitamente los posts y la etiqueta MBTI verdadera de cada usuario de entrenamiento.
  • El prompt permite usar la etiqueta para resolver ambigüedades o reforzar el juicio.
  • Las respuestas auxiliares no fueron emitidas por usuarios ni verificadas contra respuestas humanas.
  • La lista completa de 60 ítems, su procedencia y su validación no se publican.
  • El modelo usa 32 expertos MLP, BERT-base-uncased, 100 épocas de preentrenamiento L1 y ajuste conjunto con lambda de clasificación 0,05.
  • Kaggle tiene 8.675 usuarios y PANDORA 9.067, con split declarado 60/20/20 sin solapamiento de usuario.
  • ROME obtiene 89,78 macro-F1 medio en Kaggle y 69,04 en PANDORA.
  • Las mejoras relativas medias frente a ETM son 15,41% en Kaggle y 4,97% en PANDORA.
  • ROME empeora frente al mejor baseline en Kaggle P/J y en PANDORA I/E y P/J.
  • No hay repeticiones, intervalos o tests que sustenten significación estadística.
  • La descarga exacta de Kaggle contiene algún código MBTI en 94,76% de las filas.
  • La etiqueta objetivo exacta aparece en el texto del 87,33% de las filas de Kaggle.
  • En 67,85% de las filas, el tipo objetivo empata como el código MBTI más mencionado.
  • Una regla sin entrenamiento basada en el tipo más mencionado alcanza 64,20% de exactitud de 16 tipos.
  • El mismo control alcanza 78,81/80,16/80,70/79,13 macro-F1 para I/E, S/N, T/F y P/J; media 79,70%.
  • El paper no informa limpieza de códigos MBTI ni una evaluación con esos tokens eliminados.
  • Sin evidencia de cuestionario, ROME baja a 65,77; solo con evidencia llega a 75,12; el modelo completo llega a 89,78.
  • La ablación sin ponderación baja solo 1,31 puntos, de 89,78 a 88,47.
  • Con 40% del entrenamiento, ROME obtiene 78,01, pero no se reportan baselines entrenados con el mismo 40%.
  • GPT-3.5, GPT-mix y GPT-4o como generadores Ask producen promedios 86,20, 87,45 y 89,78 en Kaggle.
  • BERT, Llama y RoBERTa como encoders producen 89,78, 92,71 y 85,93, respectivamente.
  • La aparente especialización de expertos recibe como entrada una asignación explícita del eje MBTI.
  • El caso interpretativo usa selección post-hoc de snippets por GPT-4o, no una traza causal del clasificador.
  • El único caso mostrado se elige entre usuarios correctamente clasificados en las cuatro dimensiones.
  • Una explicación mostrada usa un post sobre INFPs para apoyar la clasificación de un usuario ISTJ.
  • La descripción de Tabla 6 intercambia los nombres de random-removal y minimum-weight-removal.
  • No se encontró repositorio de código o artefactos enlazado desde arXiv ni mediante búsquedas exactas.

Limitaciones

  • La etiqueta objetivo se introduce en el generador de las dianas auxiliares, por lo que no son supervisión independiente.
  • El método no separa cuánto aporta el texto y cuánto la regularidad estereotipada inducida por la etiqueta en GPT-4o.
  • No hay control con respuestas generadas sin etiqueta, con etiqueta permutada o con respuestas humanas reales.
  • La afirmación de cuestionario validado carece de nombre, versión, fuente, licencia y cita de validación del inventario de 60 ítems.
  • Los 60 ítems completos no se publican, impidiendo auditar contenido, balance de polos, redundancia y scoring.
  • No se reportan fiabilidad, validez convergente, estructura factorial, invariancia, test-retest o error de medición.
  • El formato de siete puntos −3 a +3 no se vincula con una administración oficial del MBTI.
  • Las respuestas sintéticas son llamadas ground truth aunque no fueron observadas.
  • T, temperaturas exactas, seed, top-p, system prompt, handling de errores y parsing no se especifican.
  • La figura sugiere varias temperaturas, pero el número y procedimiento de muestras no quedan documentados.
  • Otro LLM no identificado asigna cada pregunta a un eje sin publicar prompt, validación humana o tasa de error.
  • La importancia del ítem usa directamente la separación entre clases verdaderas, por lo que es una estadística supervisada, no evidencia psicométrica independiente.
  • El router recibe el one-hot del eje y después la activación se interpreta como especialización psicológica emergente.
  • BERT tiene longitud limitada, pero no se explica truncado, segmentación o pooling de 50 posts o cientos de posts.
  • Tampoco se explica cómo se construye una sola representación de usuario para BERT, RoBERTa o Llama.
  • No se publican código, pesos, respuestas sintéticas, outputs, preguntas, splits o configuración ejecutable.
  • El split aleatorio no tiene seed ni índices y solo se reporta una ejecución.
  • No hay validación cruzada, desviaciones estándar, bootstrap, intervalos o tests de hipótesis.
  • Los hiperparámetros, número de expertos y longitud del cuestionario se seleccionan en el mismo benchmark sin corrección por búsqueda.
  • Las implementaciones y configuraciones de los once baselines no se documentan suficientemente.
  • No se aclara si los números de baselines se reprodujeron con el mismo split o se tomaron de trabajos previos.
  • La afirmación consistently outperforms es falsa a nivel de dimensión en tres columnas de la Tabla 2.
  • La palabra significantly se usa sin estadístico, p-value, intervalo o tamaño de efecto inferencial.
  • El experimento de pocos datos no compara todos los métodos con la misma fracción de entrenamiento.
  • Generar 60 respuestas sigue requiriendo una etiqueta por usuario, por lo que no resuelve la escasez de etiquetas.
  • No se contabilizan llamadas, tokens, coste, latencia offline o huella computacional de GPT-4o y ocho RTX 5880 Ada.
  • El texto dice que GPT-4o se consulta una vez, pero el método requiere T muestras por usuario; el significado de once no se aclara.
  • Kaggle contiene códigos MBTI explícitos en casi todo el corpus y no se reporta su eliminación.
  • La regla de control por menciones supera al mejor baseline ETM promedio en Kaggle, mostrando que el benchmark admite atajos triviales.
  • No hay ablación con los 16 códigos, nombres de tipos, URLs y vocabulario relacionado eliminados.
  • PersonalityCafe es una comunidad centrada en personalidad, por lo que su lenguaje no representa texto cotidiano general.
  • PANDORA también deriva etiquetas de autodeclaraciones; no son evaluaciones administradas ni observaciones externas.
  • No se evalúa si las publicaciones usadas incluyen el comentario de autodeclaración, flairs o referencias de tipo.
  • Las clases están muy desequilibradas y no se reportan calibración, curvas precision-recall o comportamiento por tipo completo.
  • Los resultados por dimensión ocultan errores de combinaciones de 16 tipos.
  • No hay comparación con una regla explícita de recuperación de etiqueta, mayoría, regresión logística sobre tokens de tipo o corpus limpiado.
  • El caso de interpretabilidad es uno solo, correctamente clasificado, no una muestra ciega o representativa.
  • Los snippets se seleccionan por GPT-4o después de conocer los ítems influyentes y no prueban fidelidad del modelo.
  • El paper no verifica que los snippets describan al autor en vez de terceras personas, citas o discusión de estereotipos.
  • El análisis de eliminación prueba sensibilidad del agregado, no causalidad psicológica ni corrección del razonamiento.
  • La nomenclatura random/minimum de Tabla 6 se contradice entre texto y nombres de variantes.
  • No hay evaluación en Big Five, medidas continuas, cuestionarios reales o participantes fuera de comunidades MBTI.
  • No se evalúa estabilidad temporal de la etiqueta, autoinforme repetido, desacuerdo entre pruebas o cambio de tipo.
  • No se analizan edad, género, cultura, idioma, región, subcomunidad o fairness.
  • El uso potencial en salud mental se menciona sin validación clínica, análisis de daño o umbral de seguridad.
  • No hay sección específica de limitaciones, ética, privacidad o consentimiento.
  • El tratamiento de posts sensibles mediante una API cerrada no se acompaña de política de retención, anonimización o gobernanza.
  • No se evalúan ataques, manipulación de posts, menciones adversarias de tipos o robustez a paráfrasis.
  • No hay validación externa, temporal, interplataforma o fuera de distribución.
  • El rendimiento alto en Kaggle no puede separarse de contaminación de etiquetas y lenguaje específico del dominio.

Qué no demuestra

  • No establece que los usuarios hubieran respondido así a un cuestionario.
  • No valida el inventario de 60 ítems como MBTI oficial o instrumento psicométrico.
  • No demuestra que las respuestas generadas sean evidencia psicológica y no codificación de la etiqueta.
  • No demuestra inferencia de personalidad desde texto libre sin menciones explícitas de tipos.
  • No demuestra superioridad consistente en las ocho dimensiones-dataset.
  • No demuestra significación estadística de las mejoras.
  • No demuestra eficiencia de datos frente a baselines bajo igual presupuesto de etiquetas.
  • No demuestra interpretabilidad fiel o causal del MoE.
  • No demuestra generalización a usuarios, plataformas, idiomas o culturas diferentes.
  • No demuestra validez clínica, fairness, privacidad o seguridad para decisiones sobre personas.
  • No demuestra que MBTI autodeclarado sea personalidad verdadera u objetiva.
  • No ofrece un resultado reproducible sin preguntas, splits, dianas sintéticas, código y seeds.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2512.08814v1, submitted 9 December 2025; 13 pages; latest version confirmed through the arXiv API on 15 July 2026; no later proceedings or journal version located

Fuente consultada: https://arxiv.org/pdf/2512.08814v1

Revisión: Codex complete bilingual full-text fidelity pass, all-page PDF visual inspection, arXiv latest-version reconciliation, prompt and label-conditioning audit, exact cited Kaggle-source contamination audit, metric and table audit, interpretability-fidelity review, reproducibility and psychometric-validity assessment; summaries written from the full paper and verified source data rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o-2024-08-06 as the label-aware offline role-play generator
  • BERT-base-uncased as the default post and question encoder
  • Question-conditioned Mixture-of-Experts with 32 MLP experts and hidden dimension 1024
  • Meta-Llama-3-8B-Instruct as a frozen encoder ablation
  • RoBERTa-base as an encoder ablation
  • GPT-3.5 as an Ask-stage ablation; exact model snapshot not reported
  • GPT-mix averaging GPT-3.5 and GPT-4o synthetic answers
  • ChatGPT-3.5 and GPT-4o zero-shot and three-shot personality-prediction baselines

Instrumentos y métricas

  • Undocumented 60-item MBTI-style questionnaire with integer responses from −3 to +3
  • Label-aware prompt that explicitly permits using the true MBTI type
  • T stochastic GPT samples averaged per user and item; T and full decoding schedule not reported
  • LLM-generated one-hot assignment of each item to one MBTI dimension; model and prompt not reported
  • Question-conditioned router over post, item and explicit dimension embeddings
  • Robust L1 answer-prediction objective and binary cross-entropy personality objective
  • Reliability weight from across-sample variance and importance weight from true-label class separation
  • Macro-F1 per binary dimension and unweighted mean over four dimensions
  • Component, data-fraction, generator, encoder, questionnaire-length and expert-count ablations
  • Single-user item-removal case study with post-hoc GPT-4o snippet selection

Datos utilizados

  • Kaggle datasnaek/mbti-type: 8,675 PersonalityCafe users, target type plus 50 recent posts per row
  • PANDORA MBTI subset: 9,067 Reddit users labeled from self-introductions, with dozens to hundreds of posts
  • User-level 60/20/20 train/validation/test partitions with no user overlap; split seed and indices unavailable
  • Locally verified Kaggle archive hash f0a190405e43c76c9d86ad6a2d09177567976fc56ef6e951a55f9e56de033fc1 and CSV hash 8b068e734efaed7a7905a1434b1f76eab2fc2f8c943247b5af78103e96940bdb
  • No released synthetic-answer table, questionnaire inventory, split files, trained weights, outputs, or source code

Evidencia y localización

  • Versión, autoría y fecha de arXiv: arXiv API record 2512.08814v1 checked 15 July 2026 and paper page 1
  • Prompt que recibe etiqueta y 60 preguntas: Paper Section 3.3 and Figure 3, page 4
  • Arquitectura Ask–Answer–Detect y objetivos: Paper Sections 3.2–3.5, pages 3–6
  • Asignación de constructo por LLM y ponderación por clase: Paper Equations 2 and 5–8, pages 5–6
  • Tamaños, procedencia y splits: Paper Section 4.1 and Table 1, page 6
  • Baselines, implementación y entrenamiento: Paper Sections 4.2–4.3, pages 6–7
  • Resultados y mejoras por dimensión: Paper Table 2 and Section 4.4, page 7
  • Ablaciones y comparación con LLM: Paper Tables 3–4 and Sections 4.5–4.8, pages 8–9
  • Longitud de cuestionario y número de expertos: Paper Figures 6–7 and Section 4.9, page 10
  • Caso, snippets y contradicción random/minimum: Paper Table 5, Table 6 and Section 4.10, pages 10–11
  • Contaminación de códigos MBTI y control determinista: reports/verification/article-177-kaggle-label-leakage-audit.json; exact cited Kaggle CSV audited 15 July 2026
  • Ausencia de publicación posterior y código: arXiv API plus exact-title, arXiv-ID, GitHub and Hugging Face searches checked 15 July 2026
  • Inspección visual: All 13 pages of arXiv:2512.08814v1 rendered and visually inspected on 15 July 2026