Machine Mindset: An MBTI Exploration of Large Language Models

Evaluación y validez psicométrica2023arXivRevisión editorial aprobada

Autores: Jiaxi Cui, Liuzhenghao Lv, Jing Wen, Rongsheng Wang, Jing Tang, YongHong Tian, Li Yuan

Palabras clave: Computation and Language, Large Language Models, MBTI Personality Traits, Artificial Intelligence, Personalized AI

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

7
Autores
6
Hallazgos
7
Limitaciones
6
Evidencias

Resumen editorial

Español

Machine Mindset describe un pipeline para producir adaptadores de 16 tipos Myers-Briggs en inglés y chino mediante datos sintéticos, dos etapas de ajuste supervisado y una fase de Direct Preference Optimization. Para construir el conjunto conductual, ChatGPT asigna cada instrucción de Alpaca-GPT4 a una de las cuatro dicotomías MBTI y genera dos respuestas opuestas, una por polo. La distribución queda muy desequilibrada: el artículo identifica Information como la dimensión predominante y Energy como la menos representada. Un segundo conjunto, también generado por ChatGPT, contiene preguntas directas o indirectas sobre personalidad y respuestas que declaran el tipo propio; su finalidad es enseñar al modelo «autoconciencia». Para cada tipo, por ejemplo INFP, la primera SFT combina los cuatro subconjuntos de polos I, N, F y P; la segunda usa las preguntas de autodescripción de INFP. Los autores proponen adaptadores LoRA intercambiables y DPO con respuestas de polos opuestos como preferencias. Sin embargo, el informe no identifica el modelo base, tamaños de los datasets, particiones, hiperparámetros, prompts completos, versión de ChatGPT ni configuración de LoRA/DPO. La evaluación publicada consiste principalmente en gráficos de un cuestionario MBTI modificado y seis capturas de conversaciones chinas. La inspección de los 16 gráficos contradice la afirmación de alineación completa: solo ocho perfiles, INTJ, INTP, ENFP, ISTJ, ESTJ, ESFJ, ISTP y ESTP, muestran inequívocamente los cuatro polos asignados por encima del 50 %. ENTP e INFJ empatan exactamente 50/50 en J/P. Los otros seis contradicen al menos una letra: ENTJ puntúa 67 % Sensing en lugar de Intuition; INFP, 57 % Thinking en lugar de Feeling; ENFJ, 55 % Perceiving en lugar de Judging; ISFJ resulta 52 % Extraversion y 57 % Thinking; ISFP obtiene 54 % Thinking y empata Sensing/Intuition; ESFP obtiene 59 % Intuition en lugar de Sensing. Algunos aciertos son fuertes, ISTJ llega a I 79 %, S 81 %, T 83 % y J 86 %; ESTJ a E 60 %, S 93 %, T 96 % y J 86 %, pero otros apenas superan el umbral. Las gráficas radiales llamadas «Second Results» no explican una segunda réplica ni aportan incertidumbre. El cuerpo afirma que se evaluaron calidad, coherencia, dominios, feedback de usuarios, ablaciones y capacidades como razonamiento, pero no publica muestra, métricas, baselines, resultados numéricos ni análisis de esas pruebas. Las seis capturas de preguntas abiertas muestran que algunos modelos declaran el tipo solicitado y responden con estilos distintos, pero son ejemplos seleccionados sin evaluación. Tampoco se compara con prompting, solo SFT, solo autoconciencia, sin DPO o un modelo base; no se prueba estabilidad entre ejecuciones, prompts, idiomas o tiempo. Enseñar respuestas que nombran explícitamente el tipo y evaluarlas después con un cuestionario similar introduce circularidad y no demuestra autoconocimiento. El trabajo aporta una receta y recursos abiertos para control estilístico MBTI, pero su evidencia publicada respalda un éxito parcial de clasificación de salidas, no 16 personalidades estables ni capacidades cognitivas influidas por el tipo.

English

Machine Mindset describes a pipeline for producing adapters for all 16 Myers-Briggs types in English and Chinese using synthetic data, two supervised fine-tuning stages, and Direct Preference Optimization. To build the behavior dataset, ChatGPT assigns each Alpaca-GPT4 instruction to one of the four MBTI dichotomies and generates two opposing responses, one for each pole. The distribution is highly imbalanced: the paper identifies Information as dominant and Energy as least represented. A second ChatGPT-generated dataset contains direct or indirect personality questions with answers that state the model's own type; it is intended to teach “self-awareness.” For each type, INFP, for example, the first SFT combines the four I, N, F, and P behavior subsets, and the second uses INFP self-description questions. The authors propose interchangeable LoRA adapters and DPO preferences built from opposite-pole responses. However, the report does not identify the base model, dataset sizes, splits, hyperparameters, full prompts, ChatGPT version, or LoRA/DPO configuration. The published evaluation consists mainly of charts from a modified MBTI questionnaire and six screenshots of Chinese conversations. Visual inspection of all 16 charts contradicts the claim of complete alignment: only eight profiles, INTJ, INTP, ENFP, ISTJ, ESTJ, ESFJ, ISTP, and ESTP, unambiguously place all four assigned poles above 50%. ENTP and INFJ are exactly tied 50/50 on J/P. The other six contradict at least one assigned letter: ENTJ scores 67% Sensing rather than Intuition; INFP 57% Thinking rather than Feeling; ENFJ 55% Perceiving rather than Judging; ISFJ is 52% Extraversion and 57% Thinking; ISFP is 54% Thinking and ties Sensing/Intuition; and ESFP is 59% Intuition rather than Sensing. Some successes are strong, ISTJ reaches I 79%, S 81%, T 83%, J 86%, while ESTJ reaches E 60%, S 93%, T 96%, J 86%, but others barely cross the threshold. Radar charts labelled “Second Results” do not define a second replication or report uncertainty. The main text says it evaluated quality, coherence, multiple domains, user feedback, ablations, and reasoning-related abilities, but supplies no sample, metrics, baselines, numerical results, or analyses for those claims. Six open-question screenshots show that selected models declare the requested type and answer in different styles, but they are unscored examples. There is no comparison with prompting, SFT-only, self-awareness-only, no-DPO, or the base model, and no stability test across runs, prompts, languages, or time. Training models to name their type and then assessing them with similar personality questions is circular and does not establish self-knowledge. The work offers a recipe and open resources for MBTI-style control, but its published evidence supports partial output classification, not 16 stable personalities or type-driven cognitive abilities.

Pregunta de investigación

¿Puede una combinación de datos conductuales y de autodescripción generados por ChatGPT, dos etapas de SFT y DPO hacer que un LLM produzca respuestas y declaraciones de identidad alineadas de forma estable con uno de los 16 tipos MBTI?

Método

ChatGPT clasifica instrucciones Alpaca-GPT4 por dicotomía MBTI y genera pares de respuestas opuestas para ocho polos; además genera Q&A de autodescripción para 16 tipos. Cada tipo recibe SFT conductual con cuatro polos, SFT de «autoconciencia» y DPO con preferencias entre respuestas opuestas, usando LoRA. La evaluación aplica un cuestionario MBTI modificado y muestra capturas de preguntas abiertas. El informe no especifica modelo base, tamaños, splits, hiperparámetros, réplicas ni baselines.

Muestra: Dieciséis adaptadores de personalidad en inglés y chino, pero el número de ejemplos de entrenamiento y evaluación no se reporta. El apéndice publica un gráfico de cuestionario y un radar por tipo, más seis capturas chinas de conversaciones seleccionadas; no declara participantes humanos ni tamaño de encuesta.

Hallazgos

  • Solo 8 de los 16 gráficos muestran inequívocamente las cuatro letras asignadas: INTJ, INTP, ENFP, ISTJ, ESTJ, ESFJ, ISTP y ESTP.
  • ENTP e INFJ empatan 50/50 en J/P, por lo que el cuestionario no distingue la cuarta letra que define esos tipos.
  • ENTJ, INFP, ENFJ, ISFJ, ISFP y ESFP contradicen al menos un polo objetivo; ISFJ contradice dos y ISFP añade un empate S/N.
  • Los perfiles más separados incluyen ISTJ (I 79 %, S 81 %, T 83 %, J 86 %) y ESTJ (E 60 %, S 93 %, T 96 %, J 86 %); otros resultados quedan cerca del umbral y no tienen intervalos ni réplicas.
  • Las capturas abiertas ilustran autodeclaraciones y diferencias estilísticas, pero no constituyen una evaluación comparativa de calidad, conocimiento o coherencia.
  • Aunque el texto afirma resultados de feedback, ablación, capacidades y múltiples dominios, el PDF no presenta sus datos ni análisis.

Limitaciones

  • Faltan el nombre y la versión del modelo base, tamaños y particiones de datos, prompts, versión de ChatGPT, hiperparámetros de SFT/LoRA/DPO, configuración de inferencia y artefactos de evaluación.
  • No hay baseline del modelo original, prompting, etapas individuales o entrenamiento sin DPO; por tanto no puede atribuirse ninguna diferencia a un componente concreto.
  • El conjunto conductual es sintético y muy desequilibrado entre dimensiones; ChatGPT clasifica instrucciones y redacta respuestas, de modo que sus propios estereotipos definen la señal aprendida.
  • Las preguntas de autodescripción entrenan explícitamente la etiqueta que después se consulta, creando fuga conceptual entre intervención y evaluación.
  • El cuestionario está modificado sin publicar los ítems, reglas de puntuación, fiabilidad, validez o sensibilidad a orden y prompt; MBTI ya posee limitaciones psicométricas reconocidas por el propio artículo.
  • No se publican réplicas, incertidumbre, test-retest, comparación inglés-chino, evaluación humana, resultados de ablación ni benchmarks de capacidades.
  • Las seis conversaciones son ejemplos seleccionados y no permiten medir generalización, seguridad, utilidad o consistencia fuera de esas preguntas.

Qué no demuestra

  • No demuestra que los modelos tengan autoconciencia, identidad, personalidad humana ni conocimiento interno de su tipo; han sido entrenados para declarar una etiqueta.
  • No demuestra que los 16 tipos se hayan implantado con éxito: la mitad de los gráficos no confirma inequívocamente las cuatro letras objetivo.
  • No prueba que DPO, la segunda SFT o LoRA sean necesarios o superiores, porque no se muestran ablaciones ni baselines.
  • No demuestra personalidad estable entre prompts, tareas, sesiones, idiomas, temperaturas o actualizaciones del modelo.
  • No establece que el tipo MBTI cause diferencias en razonamiento, derecho, patentes, conocimiento, satisfacción o cualquier capacidad operativa.
  • No valida MBTI como medida psicométrica para LLM ni hace sus porcentajes equivalentes a tipos o rasgos humanos.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2312.12999v4; Technical Report

Fuente consultada: https://arxiv.org/pdf/2312.12999

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • Unspecified base LLM with LoRA adapters
  • ChatGPT (dataset generation; version not specified)

Instrumentos y métricas

  • Modified MBTI questionnaire
  • Four MBTI dichotomies and 16 assigned types
  • Unscored random question-answering screenshots

Datos utilizados

  • Alpaca-GPT4 instructions
  • Eight synthetic MBTI-pole behavior datasets
  • Sixteen synthetic MBTI self-awareness datasets
  • DPO preference pairs from opposing MBTI poles

Evidencia y localización

  • Objetivo, pipeline y afirmaciones de contribución: arXiv v4, pp. 1–3, Abstract, Introduction and Figure 1
  • Construcción sintética y desequilibrio de datasets: arXiv v4, pp. 3–4, section 3.1 and Figures 2–3
  • Dos etapas SFT, LoRA y DPO: arXiv v4, pp. 4–5, section 3.2
  • Evaluación anunciada y falta de resultados reportados: arXiv v4, pp. 5–7, sections 3.3–5
  • Coincidencias, empates y contradicciones de los 16 tipos: arXiv v4, pp. 8–12, Appendix A.1, Figures 4–35
  • Ejemplos no puntuados de preguntas abiertas: arXiv v4, pp. 12–15, Appendix A.2, Figures 36–41