ROME es un clasificador supervisado de las cuatro dimensiones binarias MBTI a partir de publicaciones de usuarios. Su etapa Ask entrega a GPT-4o-2024-08-06 los posts y la etiqueta MBTI verdadera de cada usuario de entrenamiento y le pide contestar 60 preguntas “MBTI-style” en una escala de −3 a +3. La etapa Answer entrena un Mixture-of-Experts condicionado por pregunta para reproducir esas respuestas sintéticas desde los posts; Detect combina las respuestas predichas con la representación textual para clasificar I/E, S/N, T/F y P/J. La fuente disponible sigue siendo arXiv v1 de 13 páginas; no se localizó versión publicada ni repositorio de código.
La intermediación no constituye una medición psicométrica independiente. El prompt ordena usar el tipo MBTI para resolver casos ambiguos o reforzar el juicio, y el método llama “ground truth” a respuestas que nunca fueron dadas por las personas. Así, la señal auxiliar está condicionada explícitamente por la misma clase objetivo que el modelo debe aprender. Esto puede ser una forma de destilación supervisada útil, pero no demuestra que GPT-4o reconstruya respuestas reales ni que el vector resultante sea evidencia psicológica. Las 60 preguntas no se publican completas, no se identifica su instrumento, licencia, fuente o estudio de validación y el texto alterna “standardized”, “validated” y “MBTI-style” sin aportar fiabilidad, estructura factorial, reglas de puntuación o comparación con respuestas humanas.
La evaluación usa 8.675 usuarios del corpus Kaggle/PersonalityCafe, con sus 50 posts más recientes, y 9.067 usuarios de PANDORA/Reddit, con decenas o cientos de posts. Las etiquetas son tipos autodeclarados en comunidades centradas en personalidad, no resultados administrados por el estudio ni una verdad objetiva. El paper declara splits de usuario 60/20/20 sin solapamiento, pero no publica seed, índices o repeticiones. Una auditoría de la descarga exacta de Kaggle citada encontró códigos MBTI explícitos en 8.220/8.675 filas (94,76%) y el tipo objetivo en 7.576 (87,33%). Un control determinista sin entrenamiento que elige el tipo más mencionado obtiene 64,20% de exactitud de 16 tipos y 79,70% de macro-F1 medio en las cuatro dimensiones. El artículo no informa haber eliminado esos tokens ni evalúa un corpus limpio, por lo que Kaggle mide en parte recuperación de etiquetas y lenguaje sobre MBTI, no solo inferencia de personalidad desde texto ordinario.
ROME reporta macro-F1 medio de 89,78% en Kaggle frente a 77,79% de ETM, una mejora relativa de 15,41%, y 69,04% en PANDORA frente a 65,77%, una mejora relativa de 4,97%. Sin embargo, no supera al mejor baseline en todas las dimensiones: cae 9,24% relativamente en P/J de Kaggle, 28,47% en I/E de PANDORA y 3,79% en P/J de PANDORA. No hay intervalos, desviaciones entre seeds, tests de significación o corrección por selección de hiperparámetros, por lo que “consistently” y “significantly” exceden la evidencia publicada. La prueba de escasez compara ROME con 40% de entrenamiento contra ETM con 100%, no contra baselines reentrenados con la misma fracción, y cada usuario reducido sigue requiriendo su etiqueta para generar las 60 dianas auxiliares.
Las ablaciones respaldan que la señal sintética contribuye al clasificador, no que sea psicométricamente válida. Sin evidencia auxiliar el promedio de Kaggle baja a 65,77%; usando solo esa evidencia llega a 75,12%. El análisis de expertos está condicionado por un one-hot del eje MBTI asignado por otro LLM no identificado, de modo que la especialización por eje no es enteramente emergente. El caso interpretativo elige un único usuario correctamente clasificado, calcula impacto por eliminación y después pide a GPT-4o seleccionar snippets compatibles; no rastrea la decisión real del modelo ni valida fidelidad. Incluso incluye como evidencia una frase sobre “INFPs”, ilustrando el riesgo de confundir discusión de tipos con rasgos del autor. Además, el texto intercambia las etiquetas random y minimum en la descripción de la Tabla 6.
El trabajo propone una arquitectura plausible para destilar supervisión sintética condicionada por etiqueta y obtiene promedios altos en dos benchmarks MBTI conocidos. La conclusión defendible es limitada: bajo un split no reproducible de comunidades con autodeclaraciones y fuerte vocabulario de tipos, el auxiliar generado por GPT-4o mejora un clasificador BERT/MoE. No establece respuestas de cuestionario humanas, validez psicométrica, inferencia de personalidad real, explicaciones fieles, robustez fuera de dominio, fairness, seguridad clínica ni aptitud para recomendación o salud mental.