PerDet-R1 es un paper de nueve páginas publicado en el AAAI 2026 Bridge on LLM Reasoning y alojado oficialmente en OpenReview; no debe confundirse con un paper del main track de AAAI. Esta revisión audita las nueve páginas de arXiv:2601.18582v1, el paquete LaTeX y la ficha oficial de OpenReview, modificada el 8 de marzo de 2026. No se localizó repositorio, modelo, dataset transformado, prompts completos en texto reutilizable, outputs ni código de entrenamiento/evaluación. El source package solo contiene LaTeX, bibliografía, estilo y cuatro figuras.
El sistema toma hasta 50 posts de un usuario, limitados a 128 tokens cada uno, y devuelve los tres tipos MBTI más probables. Parte de Qwen2.5-7B-Instruct. En una fase SFT, Qwen-plus genera un razonamiento en etiquetas <think> y un top-3; solo se conservan ejemplos donde la etiqueta MBTI registrada aparece en ese top-3, hasta seleccionar 1.000. En la fase GRPO, el resto del dataset se usa como training data y cada grupo contiene 16 generaciones. El reward suma NDCG sobre los candidatos y una similitud de dimensiones aplicada otra vez al primer candidato.
La idea de ofrecer alternativas ordenadas puede ser útil, pero aquí no existe una verdad de ranking. Cada usuario tiene una única etiqueta MBTI de cuatro letras. La relevancia de los otros quince tipos es construida por los autores contando coincidencias de caracteres con esa etiqueta: E/I pesa 1,1; S/N 1,2; T/F 1,3; J/P 1,4 cuando ε=0,1. No hay datos humanos que digan que un tipo es segunda o tercera opción, ni intensidades de rasgo, probabilidades del instrumento o distancias psicométricas. El peso creciente por posición de letra tampoco se justifica psicológicamente.
El reward total está dominado por la primera respuesta. NDCG está acotado aproximadamente entre 0 y 1, mientras la Dimension Similarity del top-1 puede ir de 0 a 5 y reutiliza el mismo score que alimenta NDCG. Esto convierte el objetivo principalmente en una clasificación top-1 suavizada por Hamming, no en preference learning. La fórmula de IDCG imprime s_sorted sin índice y no aclara si el ideal se calcula sobre los tres candidatos producidos o sobre los 16 tipos. La normalización GRPO divide por la desviación del grupo sin describir qué ocurre cuando todos los rewards coinciden.
El paper afirma que el ranking modela un espectro continuo y elimina la “categorical fallacy”, pero la salida sigue siendo una lista de categorías discretas y la evaluación principal toma el primer elemento como clase. No estima posición continua en E–I, S–N, T–F o J–P. Incluso la fuente oficial de MBTI distingue type theory, que clasifica preferencias, de trait theory, que mide cantidad continua; ordenar tipos por letras compartidas no transforma una tipología en un rasgo continuo.
La omisión metodológica más grave es el split. No se informa train/validation/test, tamaños, estratificación, seed, selección de checkpoint ni test held-out. El texto dice literalmente que la fase RL usa los datasets originales excluyendo las 1.000 muestras SFT. Si eso significa todo el resto, no queda test descrito. La tabla SOTA no puede interpretarse como generalización sin un protocolo no documentado. Tampoco se aclara si hay 1.000 ejemplos SFT por dataset o en total, cómo se seleccionan, qué proporción rechaza Qwen-plus ni la distribución por clase.
Los benchmarks tienen shortcuts sustanciales. Kaggle contiene 8.675 perfiles con los 50 posts más recientes de PersonalityCafe, un foro dedicado a discutir MBTI. Se enmascaran strings que coinciden con tipos completos, pero los autores admiten que quedan abreviaturas como NS, ExFJ y xNTP que mejoran el rendimiento. También pueden quedar “introvert”, funciones cognitivas como Ni/Te y contexto del foro. PANDORA aporta etiquetas auto-reportadas principalmente en flair; su paper original advierte que no representa Reddit ni la población, y muestra fuertes desequilibrios: 8.024 Intuitive frente a 1.030 Sensing y 7.134 Introverted frente a 1.920 Extraverted en 9.054 usuarios con dimensiones completas. PerDet-R1 dice usar 9.067 usuarios sin explicar la reconciliación con los 9.084 labels originales o las exclusiones.
Table 1 sí muestra los mejores valores puntuales: Kaggle 80,57 macro-F1 binaria y 41,34 F1 multiclass; PANDORA 66,10 y 35,08. Pero los márgenes narrados están mal comparados. En Kaggle multiclass, Qwen-plus alcanza 38,63 y es mejor baseline que ETM 32,55, por lo que el margen SOTA es 2,71 puntos, no 8,79. En PANDORA multiclass, TAE 30,22 supera ETM 30,09, por lo que el margen es 4,86, no 4,99. En PANDORA binary, 66,10−65,77 son 0,33 puntos, no el 0,83 publicado. Solo Kaggle binary coincide: 80,57−77,79=2,78.
El paper usa repetidamente el signo % para restas absolutas de scores. Los “drops” de ablation, 8,95, 10,22, 20,49, 24,85, 4,93, 7,39, 4,13, 2,24 y 0,60, son diferencias en puntos de la tabla, no cambios porcentuales relativos. También llama “significant” a diferencias sin tests, intervalos, seeds, media, desviación o distribución. Figure 4 es una curva de reward de training suavizada de una ejecución, no performance held-out; la caída roja cerca del paso 800 se recupera, de modo que no prueba por sí sola estabilidad o ausencia de reward hacking.
Aunque el artículo se presenta como ranking, la tabla principal no informa NDCG para PANDORA ni compara NDCG con un ranking baseline. NDCG aparece solo en ablations internas de Kaggle. Los resultados SOTA se calculan convirtiendo el primer elemento del top-3 en una predicción binaria/multiclase. “F1-score” multiclass no especifica macro, micro o weighted; en single-label multiclass, micro-F1 equivale a accuracy, por lo que la definición es indispensable. No hay scores por tipo, matrices de confusión o análisis de las clases muy minoritarias.
El rechazo SFT selecciona razonamientos solo cuando Qwen-plus incluye el gold en top-3. Eso introduce survivorship bias hacia usuarios, clases y ejemplos que el teacher ya resuelve. El paper afirma que el filtro garantiza razonamientos “highly readable”, pero solo comprueba presencia de la etiqueta; no evalúa legibilidad, corrección de la explicación o faithfulness. Mejor F1 después de entrenar con traces no demuestra mejor razonamiento: el texto puede ser racionalización post-hoc y no se compara con respuesta directa a igual compute.
La reivindicación de eliminar dependencia de expertos tampoco se sostiene. El prompt del teacher exige usar “official interpretations of 16 MBTI personality types”, el formato y el top-k se diseñan manualmente, y el reward codifica a mano similitud de letras, pesos por dimensión y doble prioridad del top-1. No hay comparación coste/latencia con prompt baselines ni evidencia de real-time deployment. Temperature=1 en Qwen-plus se describe erróneamente como “mostly deterministic”.
La reproducibilidad es baja: faltan learning rate, scheduler, optimizer LLM, LoRA alpha/dropout/target modules, longitud total y truncation order, clipping ε, KL β, GPUs, precision, framework GRPO, versiones, checkpoint selection, seeds y costes. No hay release público del modelo o artefactos. La auditoría aritmética y metodológica no puede contrastarse con outputs.
La conclusión defendible es estrecha: con un protocolo no completamente especificado, un Qwen2.5-7B post-entrenado con traces filtrados y reward de similitud de etiqueta obtiene scores puntuales superiores a los baselines listados en dos datasets de MBTI auto-reportado y con shortcuts. No demuestra un espectro continuo, ranking psicométrico real, razonamiento fiel, personalidad humana, validez clínica, mental-health screening, generalización fuera de esos foros ni siquiera performance held-out hasta que se publique el split y el pipeline.