From Classification to Ranking: Enhancing LLM Reasoning Capabilities for MBTI Personality Detection

Evaluación y validez psicométrica2026arXivRevisión editorial aprobada

Autores: Yuan Cao, Feixiang Liu, Xinyue Wang, Yihan Zhu, Hui Xu, Zheng Wang, Qiang Qiu

Palabras clave: Large Language Models, Personality, MBTI, Persona, Personality Control

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

7
Autores
20
Hallazgos
134
Limitaciones
11
Evidencias

Resumen editorial

Español

PerDet-R1 es un paper de nueve páginas publicado en el AAAI 2026 Bridge on LLM Reasoning y alojado oficialmente en OpenReview; no debe confundirse con un paper del main track de AAAI. Esta revisión audita las nueve páginas de arXiv:2601.18582v1, el paquete LaTeX y la ficha oficial de OpenReview, modificada el 8 de marzo de 2026. No se localizó repositorio, modelo, dataset transformado, prompts completos en texto reutilizable, outputs ni código de entrenamiento/evaluación. El source package solo contiene LaTeX, bibliografía, estilo y cuatro figuras.

El sistema toma hasta 50 posts de un usuario, limitados a 128 tokens cada uno, y devuelve los tres tipos MBTI más probables. Parte de Qwen2.5-7B-Instruct. En una fase SFT, Qwen-plus genera un razonamiento en etiquetas <think> y un top-3; solo se conservan ejemplos donde la etiqueta MBTI registrada aparece en ese top-3, hasta seleccionar 1.000. En la fase GRPO, el resto del dataset se usa como training data y cada grupo contiene 16 generaciones. El reward suma NDCG sobre los candidatos y una similitud de dimensiones aplicada otra vez al primer candidato.

La idea de ofrecer alternativas ordenadas puede ser útil, pero aquí no existe una verdad de ranking. Cada usuario tiene una única etiqueta MBTI de cuatro letras. La relevancia de los otros quince tipos es construida por los autores contando coincidencias de caracteres con esa etiqueta: E/I pesa 1,1; S/N 1,2; T/F 1,3; J/P 1,4 cuando ε=0,1. No hay datos humanos que digan que un tipo es segunda o tercera opción, ni intensidades de rasgo, probabilidades del instrumento o distancias psicométricas. El peso creciente por posición de letra tampoco se justifica psicológicamente.

El reward total está dominado por la primera respuesta. NDCG está acotado aproximadamente entre 0 y 1, mientras la Dimension Similarity del top-1 puede ir de 0 a 5 y reutiliza el mismo score que alimenta NDCG. Esto convierte el objetivo principalmente en una clasificación top-1 suavizada por Hamming, no en preference learning. La fórmula de IDCG imprime s_sorted sin índice y no aclara si el ideal se calcula sobre los tres candidatos producidos o sobre los 16 tipos. La normalización GRPO divide por la desviación del grupo sin describir qué ocurre cuando todos los rewards coinciden.

El paper afirma que el ranking modela un espectro continuo y elimina la “categorical fallacy”, pero la salida sigue siendo una lista de categorías discretas y la evaluación principal toma el primer elemento como clase. No estima posición continua en E–I, S–N, T–F o J–P. Incluso la fuente oficial de MBTI distingue type theory, que clasifica preferencias, de trait theory, que mide cantidad continua; ordenar tipos por letras compartidas no transforma una tipología en un rasgo continuo.

La omisión metodológica más grave es el split. No se informa train/validation/test, tamaños, estratificación, seed, selección de checkpoint ni test held-out. El texto dice literalmente que la fase RL usa los datasets originales excluyendo las 1.000 muestras SFT. Si eso significa todo el resto, no queda test descrito. La tabla SOTA no puede interpretarse como generalización sin un protocolo no documentado. Tampoco se aclara si hay 1.000 ejemplos SFT por dataset o en total, cómo se seleccionan, qué proporción rechaza Qwen-plus ni la distribución por clase.

Los benchmarks tienen shortcuts sustanciales. Kaggle contiene 8.675 perfiles con los 50 posts más recientes de PersonalityCafe, un foro dedicado a discutir MBTI. Se enmascaran strings que coinciden con tipos completos, pero los autores admiten que quedan abreviaturas como NS, ExFJ y xNTP que mejoran el rendimiento. También pueden quedar “introvert”, funciones cognitivas como Ni/Te y contexto del foro. PANDORA aporta etiquetas auto-reportadas principalmente en flair; su paper original advierte que no representa Reddit ni la población, y muestra fuertes desequilibrios: 8.024 Intuitive frente a 1.030 Sensing y 7.134 Introverted frente a 1.920 Extraverted en 9.054 usuarios con dimensiones completas. PerDet-R1 dice usar 9.067 usuarios sin explicar la reconciliación con los 9.084 labels originales o las exclusiones.

Table 1 sí muestra los mejores valores puntuales: Kaggle 80,57 macro-F1 binaria y 41,34 F1 multiclass; PANDORA 66,10 y 35,08. Pero los márgenes narrados están mal comparados. En Kaggle multiclass, Qwen-plus alcanza 38,63 y es mejor baseline que ETM 32,55, por lo que el margen SOTA es 2,71 puntos, no 8,79. En PANDORA multiclass, TAE 30,22 supera ETM 30,09, por lo que el margen es 4,86, no 4,99. En PANDORA binary, 66,10−65,77 son 0,33 puntos, no el 0,83 publicado. Solo Kaggle binary coincide: 80,57−77,79=2,78.

El paper usa repetidamente el signo % para restas absolutas de scores. Los “drops” de ablation, 8,95, 10,22, 20,49, 24,85, 4,93, 7,39, 4,13, 2,24 y 0,60, son diferencias en puntos de la tabla, no cambios porcentuales relativos. También llama “significant” a diferencias sin tests, intervalos, seeds, media, desviación o distribución. Figure 4 es una curva de reward de training suavizada de una ejecución, no performance held-out; la caída roja cerca del paso 800 se recupera, de modo que no prueba por sí sola estabilidad o ausencia de reward hacking.

Aunque el artículo se presenta como ranking, la tabla principal no informa NDCG para PANDORA ni compara NDCG con un ranking baseline. NDCG aparece solo en ablations internas de Kaggle. Los resultados SOTA se calculan convirtiendo el primer elemento del top-3 en una predicción binaria/multiclase. “F1-score” multiclass no especifica macro, micro o weighted; en single-label multiclass, micro-F1 equivale a accuracy, por lo que la definición es indispensable. No hay scores por tipo, matrices de confusión o análisis de las clases muy minoritarias.

El rechazo SFT selecciona razonamientos solo cuando Qwen-plus incluye el gold en top-3. Eso introduce survivorship bias hacia usuarios, clases y ejemplos que el teacher ya resuelve. El paper afirma que el filtro garantiza razonamientos “highly readable”, pero solo comprueba presencia de la etiqueta; no evalúa legibilidad, corrección de la explicación o faithfulness. Mejor F1 después de entrenar con traces no demuestra mejor razonamiento: el texto puede ser racionalización post-hoc y no se compara con respuesta directa a igual compute.

La reivindicación de eliminar dependencia de expertos tampoco se sostiene. El prompt del teacher exige usar “official interpretations of 16 MBTI personality types”, el formato y el top-k se diseñan manualmente, y el reward codifica a mano similitud de letras, pesos por dimensión y doble prioridad del top-1. No hay comparación coste/latencia con prompt baselines ni evidencia de real-time deployment. Temperature=1 en Qwen-plus se describe erróneamente como “mostly deterministic”.

La reproducibilidad es baja: faltan learning rate, scheduler, optimizer LLM, LoRA alpha/dropout/target modules, longitud total y truncation order, clipping ε, KL β, GPUs, precision, framework GRPO, versiones, checkpoint selection, seeds y costes. No hay release público del modelo o artefactos. La auditoría aritmética y metodológica no puede contrastarse con outputs.

La conclusión defendible es estrecha: con un protocolo no completamente especificado, un Qwen2.5-7B post-entrenado con traces filtrados y reward de similitud de etiqueta obtiene scores puntuales superiores a los baselines listados en dos datasets de MBTI auto-reportado y con shortcuts. No demuestra un espectro continuo, ranking psicométrico real, razonamiento fiel, personalidad humana, validez clínica, mental-health screening, generalización fuera de esos foros ni siquiera performance held-out hasta que se publique el split y el pipeline.

English

PerDet-R1 is a nine-page paper published at the AAAI 2026 Bridge on LLM Reasoning and hosted officially on OpenReview; it should not be confused with an AAAI main-track paper. This review audits all nine pages of arXiv:2601.18582v1, its LaTeX source package, and the official OpenReview record last modified 8 March 2026. No repository, model, transformed dataset, reusable full prompts, outputs, or training/evaluation code was found. The source package contains only LaTeX, bibliography/style files, and four figures.

The system takes up to 50 posts per user, capped at 128 tokens each, and returns the three most likely MBTI types. It starts from Qwen2.5-7B-Instruct. During SFT, Qwen-plus generates a <think> rationale and top-3 list; examples are retained only when the recorded MBTI label occurs in that top-3, until 1,000 are selected. During GRPO, the remainder of the dataset is used as training data and each group contains 16 generations. Reward adds NDCG over candidates to another dimension-similarity score applied to the first candidate.

Providing ordered alternatives can be useful, but there is no ranking ground truth here. Each user has one four-letter MBTI label. Relevance for the other fifteen types is authored by counting character matches with that label: E/I receives weight 1.1, S/N 1.2, T/F 1.3, and J/P 1.4 when epsilon=.1. There are no human data saying which type is second or third, no trait intensities, instrument probabilities, or psychometric distances. Increasing weight by letter position is not psychologically justified.

Total reward is dominated by the first answer. NDCG is approximately bounded from 0 to 1, whereas top-1 Dimension Similarity ranges from 0 to 5 and reuses the same relevance signal already used by NDCG. The objective is therefore primarily a softened top-1 Hamming classifier, not preference learning. The IDCG equation prints an unindexed s_sorted and does not say whether the ideal is computed over the three generated candidates or all sixteen types. GRPO normalization divides by group reward standard deviation without describing the all-equal-reward case.

The paper claims ranking models a continuous spectrum and eliminates a “categorical fallacy,” yet output remains a list of discrete categories and primary evaluation takes the first item as a class. It does not estimate continuous position along E–I, S–N, T–F, or J–P. Even official MBTI materials distinguish type theory, which sorts preferences, from trait theory, which measures amounts continuously; ordering types by shared letters does not turn a typology into a continuous trait.

The most serious methodological omission is the split. No train/validation/test protocol, sizes, stratification, seed, checkpoint selection, or held-out test is reported. The text literally says the RL stage uses the original datasets excluding the 1,000 SFT samples. If that means all remaining records, no test remains described. The SOTA table cannot be interpreted as generalization without an undocumented protocol. It is also unclear whether 1,000 SFT examples are drawn per dataset or in total, how they are selected, what fraction Qwen-plus rejects, or their class distribution.

The benchmarks contain substantial shortcuts. Kaggle has 8,675 profiles with 50 recent posts from PersonalityCafe, a forum devoted to MBTI discussion. Exact type strings are masked, but the authors acknowledge that abbreviations such as NS, ExFJ, and xNTP remain and improve performance. Terms such as “introvert,” cognitive-function abbreviations such as Ni/Te, and forum context can remain too. PANDORA labels are predominantly self-reported in Reddit flairs; its original paper warns that the sample is not representative of Reddit or the general population and reports severe imbalance: 8,024 Intuitive versus 1,030 Sensing and 7,134 Introverted versus 1,920 Extraverted among 9,054 users with complete dimensions. PerDet-R1 says it uses 9,067 users without reconciling this with the original 9,084 MBTI reports or explaining exclusions.

Table 1 does show the highest point estimates: Kaggle 80.57 binary macro-F1 and 41.34 multiclass F1; PANDORA 66.10 and 35.08. But narrative margins use the wrong comparators. On Kaggle multiclass, Qwen-plus reaches 38.63 and is a stronger baseline than ETM at 32.55, so the SOTA margin is 2.71 points, not 8.79. On PANDORA multiclass, TAE at 30.22 exceeds ETM at 30.09, making the margin 4.86 rather than 4.99. On PANDORA binary, 66.10−65.77 is .33 points, not the reported .83. Only Kaggle binary is correct: 80.57−77.79=2.78.

The paper repeatedly uses percent signs for absolute score subtraction. Ablation “drops” of 8.95, 10.22, 20.49, 24.85, 4.93, 7.39, 4.13, 2.24, and .60 are table-point differences, not relative percentages. It also calls differences “significant” without tests, intervals, seeds, means, standard deviations, or distributions. Figure 4 is a smoothed training-reward curve from one run, not held-out performance; the red dip near step 800 recovers and cannot alone establish stability or freedom from reward hacking.

Although framed as ranking, the main table reports no PANDORA NDCG and compares NDCG against no ranking baseline. NDCG appears only in internal Kaggle ablations. SOTA results convert the top item into binary/multiclass predictions. Multiclass “F1-score” is not defined as macro, micro, or weighted; for single-label multiclass data, micro-F1 equals accuracy, making the definition essential. There are no per-type scores, confusion matrices, or minority-class analysis.

SFT rejection retains rationales only when Qwen-plus places gold in the top three. This introduces survivorship bias toward users, classes, and examples the teacher already solves. The paper says filtering ensures “highly readable” reasoning, but it only checks label presence; readability, explanation correctness, and faithfulness are not evaluated. Better F1 after training on traces does not demonstrate better reasoning: text may be post-hoc rationalization, and there is no direct-answer control at matched compute.

The claim of eliminating expert dependency is also unsupported. The teacher prompt requires “official interpretations of 16 MBTI personality types,” output format and top-k are hand-designed, and reward manually encodes letter similarity, dimension weights, and duplicated top-1 priority. There is no cost/latency comparison with prompt baselines or evidence of real-time deployment. Qwen-plus temperature=1 is incorrectly described as “mostly deterministic.”

Reproducibility is low: learning rate, scheduler, LLM optimizer, LoRA alpha/dropout/target modules, total context and truncation order, clipping epsilon, KL beta, GPUs, precision, GRPO framework, versions, checkpoint selection, seeds, and cost are absent. No model or artifact release exists. Arithmetic and methodological claims cannot be checked against outputs.

The defensible conclusion is narrow: under an incompletely specified protocol, a Qwen2.5-7B model post-trained on filtered traces and a label-similarity reward obtains higher point estimates than the listed baselines on two self-reported MBTI datasets with shortcuts. It does not establish a continuous spectrum, real psychometric ranking, faithful reasoning, human personality, clinical validity, mental-health screening, out-of-forum generalization, or even held-out performance until the split and pipeline are released.

Pregunta de investigación

¿Puede un Qwen2.5-7B post-entrenado primero con razonamientos top-k filtrados de Qwen-plus y después con GRPO y un reward NDCG+similitud de letras mejorar la predicción de etiquetas MBTI auto-reportadas frente a baselines de clasificación?

Método

Dos etapas sobre Kaggle PersonalityCafe y PANDORA Reddit. SFT LoRA de Qwen2.5-7B-Instruct durante tres epochs con 1.000 ejemplos generados por Qwen-plus y seleccionados si el gold aparece en top-3. Después, GRPO durante 2.000 steps, batch 128, 16 generaciones y temperature 1, con reward NDCG@k más similitud Hamming ponderada del top-1. La primera respuesta se convierte en clase para macro-F1 binaria media y F1 de 16 clases; NDCG se reporta en ablations de Kaggle.

Muestra: Las unidades son perfiles online con etiquetas MBTI auto-reportadas, no participantes evaluados con el instrumento oficial dentro del estudio. Kaggle aporta 8.675 perfiles de un foro MBTI y PANDORA alrededor de 9.000 usuarios Reddit con labels obtenidos principalmente de flairs. No se informa un test held-out ni se realiza evaluación humana de las predicciones o razonamientos.

Hallazgos

  • La ficha oficial sitúa el trabajo en AAAI 2026 Bridge on LLM Reasoning, no en el main track.
  • PerDet-R1 produce top-3 de tipos MBTI mediante SFT y GRPO sobre Qwen2.5-7B.
  • El gold de cada usuario es una única categoría, no un ranking.
  • La relevancia de tipos alternativos se inventa como coincidencia ponderada de letras con el gold.
  • Los pesos 1,1/1,2/1,3/1,4 favorecen arbitrariamente dimensiones posteriores.
  • Dimension Similarity top-1 tiene rango 0–5 y domina NDCG 0–1.
  • El reward duplica el mismo signal de similitud en NDCG y top-1 DS.
  • La salida y evaluación principal siguen siendo categóricas top-1.
  • No se informa ningún split train/validation/test o test held-out.
  • Kaggle alcanza 80,57 macro-F1 binaria y 41,34 F1 multiclass.
  • PANDORA alcanza 66,10 macro-F1 binaria y 35,08 F1 multiclass.
  • El margen correcto de Kaggle multiclass sobre el mejor baseline es 2,71 puntos, no 8,79.
  • El margen correcto de PANDORA multiclass es 4,86 puntos, no 4,99.
  • El margen PANDORA binary es 0,33 puntos, no 0,83.
  • Los drops de ablation se expresan como porcentajes aunque son restas en puntos.
  • No hay tests o intervalos que sustenten el adverbio significantly.
  • El main comparison no incluye NDCG ni ranking baselines.
  • El paper reconoce shortcuts MBTI residuales en Kaggle tras el masking.
  • El filtro SFT conserva solo ejemplos que Qwen-plus ya sitúa en top-3.
  • No hay código, modelo, outputs o artefactos públicos para reproducir los resultados.

Limitaciones

  • No debe presentarse como paper del main track de AAAI.
  • La ficha OpenReview no expone en la página auditada reviews o decisión detallada.
  • No hay repositorio oficial localizado por título, arXiv ID, modelo o autores.
  • No se libera el checkpoint PerDet-R1.
  • No se liberan traces SFT, rankings, rewards, logs o predictions.
  • El source package contiene solo LaTeX y figuras.
  • No hay train/validation/test split.
  • No hay tamaños por split.
  • No hay seed de split o entrenamiento.
  • No hay estratificación documentada.
  • No hay criterio de checkpoint selection.
  • No hay test held-out descrito.
  • El texto parece asignar todo el dataset restante a RL training.
  • Sin split, las cifras podrían ser training performance.
  • No se aclara si se entrena un modelo separado por dataset.
  • No se aclara si los 1.000 SFT son por dataset o totales.
  • No se informa cuántos candidatos genera Qwen-plus antes del filtro.
  • No se informa rejection rate.
  • No se informa distribución SFT por tipo.
  • El filtro selecciona casos que el teacher ya resuelve.
  • El filtro puede excluir clases minoritarias y ejemplos difíciles.
  • Presencia del gold en top-3 no valida el razonamiento.
  • No hay evaluación de readability pese a afirmarla.
  • No hay evaluación de faithfulness de <think>.
  • No hay anotadores humanos.
  • No hay direct-answer control a igual compute.
  • Mejor F1 no demuestra mejor reasoning.
  • El ranking gold no existe en los datasets.
  • Solo existe una etiqueta MBTI por usuario.
  • Las posiciones segunda y tercera se derivan de una heurística del autor.
  • Similitud de letras no es distancia psicométrica validada.
  • Epsilon pondera dimensiones por orden de carácter sin justificación.
  • E/I recibe menos peso que J/P arbitrariamente.
  • No se prueba sensibilidad a epsilon=.1.
  • NDCG e IDCG no se especifican de forma ejecutable completa.
  • La ecuación IDCG omite el índice de s_sorted.
  • No se aclara el universo usado para el ideal ranking.
  • Dimension Similarity duplica el signal de relevance de NDCG.
  • DS top-1 tiene una escala hasta cinco veces mayor que NDCG.
  • No se normalizan ni ponderan los dos componentes del reward.
  • El reward está dominado por top-1 classification.
  • No hay análisis adversarial de reward hacking.
  • Que dos rewards correlacionados caigan juntos no prueba ausencia de hacking.
  • Group normalization no documenta el caso sigma=0.
  • Epsilon se reutiliza para clipping y dimension weight.
  • No se informa clipping epsilon de GRPO.
  • No se informa KL beta.
  • No se informa learning rate.
  • No se informa scheduler o warmup.
  • No se informa optimizer del LLM.
  • No se informa LoRA alpha, dropout o target modules.
  • No se informa precision o quantization.
  • No se informa hardware, GPU count o tiempo.
  • No se informa framework/versión de GRPO.
  • No se informa versión PyTorch/Transformers/PEFT.
  • No se informa contexto total efectivo.
  • No se describe el orden de truncation de 50×128 tokens.
  • No se describe padding, packing o batch global versus microbatch.
  • Qwen-plus es un alias mutable sin snapshot/fecha por llamada.
  • Temperature=1 no es mostly deterministic.
  • No hay contamination audit de Qwen sobre datasets públicos.
  • PersonalityCafe y PANDORA pueden estar en pretraining.
  • Kaggle proviene de un foro dedicado a MBTI.
  • El contexto del foro es un shortcut de dominio.
  • Masking de tipos completos no elimina abreviaturas parciales.
  • Los autores reconocen NS, ExFJ y xNTP como cues residuales.
  • No se analiza leakage mediante introvert/extrovert o cognitive functions.
  • No se publica la regex/lista exacta de masking.
  • No se mide rendimiento sin posts de subreddits/foros MBTI.
  • PANDORA labels son auto-reportados en flairs o comentarios.
  • No son resultados del instrumento oficial administrado en el estudio.
  • No se controla test source o calidad del self-report.
  • PANDORA original advierte fuerte selection bias.
  • PANDORA no representa Reddit ni población general.
  • PANDORA tiene fuerte imbalance I/E y N/S.
  • No se dan distribuciones de tipos tras preprocessing.
  • No hay class-wise F1.
  • No hay confusion matrix.
  • No hay fairness por edad, género, país o idioma.
  • No se reconcilian 9.067 usuarios con 9.084 labels originales.
  • No se justifican exclusiones hasta 9.067.
  • No se especifica qué 50 posts PANDORA se conservan.
  • No hay cross-dataset train-test transfer.
  • No hay temporal split.
  • No hay evaluación fuera de foros con discourse MBTI.
  • La tabla principal solo ofrece point estimates.
  • No hay replicates, mean o standard deviation.
  • No hay intervalos de confianza.
  • No hay significance tests.
  • Significantly se usa sin evidencia inferencial.
  • PANDORA binary improvement tiene error aritmético .83 versus .33.
  • Kaggle multiclass compara contra ETM aunque Qwen-plus es mejor.
  • PANDORA multiclass compara contra ETM aunque TAE es mejor.
  • Los márgenes SOTA narrados están inflados o mal calculados.
  • Se confunden porcentajes relativos y puntos de score.
  • Todos los drops de Table 2 son restas absolutas.
  • No se define averaging del F1 multiclass.
  • Micro-F1 multiclass equivaldría a accuracy.
  • No se confirma que baselines usen el mismo split.
  • No se confirma que baselines se reejecuten o copien de papers.
  • Baselines tienen compute, fechas y escalas muy distintos.
  • gpt-3.5-turbo-0301 es un baseline histórico de 2023.
  • XGBoost se describe pero no aparece en Table 1.
  • La tabla principal no reporta NDCG.
  • No hay ranking baseline para NDCG.
  • No hay NDCG de PANDORA.
  • El claim SOTA se apoya solo en classification metrics top-1.
  • Figure 4 muestra training reward, no held-out evaluation.
  • Figure 4 solo presenta una run y no uncertainty band.
  • Figure 4 está suavizada y no ofrece datos crudos.
  • La caída without-DS se recupera y no constituye colapso definitivo.
  • No hay generalization curve o overfitting analysis.
  • La ablation classification+SFT+GRPO no define su reward/output equivalente.
  • La ablation mezcla formato, objective y search space.
  • Top-5 cambia también la métrica NDCG y no es directamente equivalente.
  • El sistema sigue devolviendo tipos discretos.
  • No estima scores continuos por dimensión.
  • No prueba interacciones psicométricas reales.
  • No prueba que las cuatro dimensiones sean interdependientes en los datos.
  • No compara contra un structured classifier de 16 tipos a igual capacidad.
  • No hay calibration, abstention o uncertainty evaluation.
  • No se evalúa estabilidad de ranking ante subsets/paraphrases de posts.
  • No se evalúa test-retest o longitudinal personality stability.
  • No hay privacy/ethics section para inferencia sensible desde redes sociales.
  • No se discuten consentimiento o downstream profiling harms.
  • Se menciona mental-health screening sin evaluarlo.
  • No hay validación clínica o diagnóstica.
  • No hay coste/latencia reportado pese al claim de real-time practicality.
  • No se demuestra eliminar expert prompt dependency.
  • El teacher prompt exige interpretaciones oficiales MBTI.
  • Reward y output format incorporan expert rules manuales.
  • No se distinguen MBTI official type results de 16Personalities u otros tests.
  • No se discute validez de labels auto-reportados.
  • No se reporta licencia para modelo/artefactos porque no se publican.

Qué no demuestra

  • No establece un ranking MBTI ground-truth humano.
  • No demuestra que personality type sea un espectro continuo.
  • No elimina categorías: sigue prediciendo una de 16 como top-1.
  • No demuestra distancias psicométricas entre tipos.
  • No demuestra interacciones de dimensiones más allá de compartir letras.
  • No demuestra reasoning faithful o causal.
  • No demuestra ausencia de reward hacking.
  • No demuestra generalización held-out por falta de split reportado.
  • No demuestra SOTA en ranking contra otros rankers.
  • No demuestra significancia estadística de los point estimates.
  • No demuestra inferencia de personalidad fuera de discourse MBTI.
  • No demuestra validez del MBTI auto-reportado de cada usuario.
  • No demuestra utilidad para mental-health screening.
  • No demuestra menor latencia o coste que prompt-based methods.
  • No permite reproducir resultados o verificar aritmética desde artefactos públicos.

Trazabilidad

Alcance: Texto completo

Versión: Nine-page AAAI 2026 Bridge on LLM Reasoning paper, arXiv:2601.18582v1 submitted 26 January 2026; official OpenReview venue record ARbfTzTFyd checked, last modified 8 March 2026

Fuente consultada: https://arxiv.org/pdf/2601.18582v1

Revisión: Codex full-text bilingual-fidelity, all-page visual, AAAI-Bridge/OpenReview reconciliation, arXiv-source, ranking-ground-truth, reward-scale, equation, split, shortcut/leakage, dataset-provenance, imbalance, arithmetic, baseline, metric-definition, ablation, reasoning-faithfulness, reproducibility, privacy and downstream-claim audit; summaries written from complete sources rather than abstract keyword extraction, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Qwen2.5-7B-Instruct base/student model with LoRA rank 32
  • Qwen-plus API model as SFT rationale and top-k teacher; exact dated snapshot not reported
  • Llama3-8B as a secondary ablation base model; exact checkpoint not reported
  • gpt-3.5-turbo-0301 baseline with temperature 0
  • Qwen-plus baseline described as Qwen3 flagship with temperature 1
  • BERT-concat, BERT-mean, D-DGCN, TAE and ETM neural baselines
  • SVM traditional baseline; XGBoost is described but absent from Table 1

Instrumentos y métricas

  • Top-3 ordered list of four-letter MBTI types
  • Teacher-generated <think> reasoning trace and <answer> list format
  • Rejection sampling requiring the gold type anywhere in teacher top-3
  • Supervised fine-tuning with LoRA rank 32 for three epochs
  • Group Relative Policy Optimization for 2,000 steps with group size/generations 16
  • Dimension similarity: weighted character match with weights 1.1, 1.2, 1.3 and 1.4
  • NDCG@k computed from author-defined MBTI letter similarity
  • Total reward equal to NDCG plus top-1 Dimension Similarity
  • Average macro-F1 across four binary MBTI dimensions from top-1
  • Unspecified F1 averaging for 16-type single-label multiclass prediction
  • Training reward curves smoothed with sigma 0.8

Datos utilizados

  • Kaggle MBTI/PersonalityCafe: 8,675 user rows, each with 50 recent forum posts and one self-reported type
  • PANDORA/MBTI9k Reddit subset reported as 9,067 users by this paper
  • Original PANDORA paper reports 9,084 users with MBTI reports and 9,054 with complete dimension counts
  • One thousand teacher-success-filtered SFT examples; per-dataset and per-class composition not reported
  • Remaining original data described as RL training data; no train/validation/test split is reported
  • No released transformed training data, rationales, rankings, checkpoints, logs or predictions

Evidencia y localización

  • Venue, title, authors and public status: Official OpenReview forum ARbfTzTFyd, AAAI 2026 Bridge LMReasoning; arXiv:2601.18582v1
  • Two-stage SFT and GRPO pipeline: Method and Figure 2, pp. 3–4
  • Teacher filtering and 1,000 SFT examples: Training Data Construction, p. 3
  • NDCG and dimension-similarity reward equations: Reward Function Design, Equations 4–8, pp. 4–5
  • Datasets and missing split: Experiments/Datasets, pp. 5–6; complete source text contains no train-validation-test protocol
  • Main performance numbers and arithmetic discrepancies: Table 1 and Overall Results, pp. 5 and 7; independent subtraction against best listed baselines
  • Ablation scores and percent-versus-point issue: Table 2, Figure 4 and Ablation Study, pp. 6–7
  • Kaggle shortcut acknowledged by authors: Overall Results, p. 7
  • PANDORA label provenance, imbalance and representativeness: PANDORA Talks original paper, Sections 3.1 and 3.4, Tables 1–2
  • No code or artifacts: Paper/source package and exact-title, arXiv-ID, PerDet-R1 GitHub/Hugging Face searches on 15 July 2026
  • Inspección visual completa: All nine PDF pages and four source-package figures rendered and visually inspected on 15 July 2026