Do LLMs Possess a Personality? Making the MBTI Test an Amazing Evaluation for Large Language Models

Evaluación y validez psicométrica2023arXivRevisión editorial aprobada

Autores: Keyu Pan, Yawen Zeng

Palabras clave: Large Language Models, Personality Assessment, Myers-Briggs Type Indicator (MBTI), Prompt Engineering, Artificial Intelligence

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
10
Hallazgos
21
Limitaciones
14
Evidencias

Resumen editorial

Español

Este preprint explora si un cuestionario MBTI de 93 elecciones forzadas puede describir patrones de respuesta de seis LLM, si esos patrones cambian con prompts y si el entrenamiento continuado con distintos corpus altera la etiqueta final. El procedimiento cuenta respuestas E/I, S/N, T/F y J/P y convierte cada par por mayoría en uno de 16 tipos. Produce etiquetas distintas, por ejemplo, ENTJ para ChatGPT, INTJ para GPT-4, ISTJ para BLOOM-7B e INFJ para OpenLLaMA-7B-v2, y muestra que un prompt explícito transforma ChatGPT de ENTJ a INFP, mientras BLOOM y Baichuan cambian poco. Tras continuar el entrenamiento de BLOOM y OpenLLaMA con Wikipedia china, preguntas-respuestas o APE210K, algunas cuentas y etiquetas también varían. Estos son resultados descriptivos sobre respuestas a un test y sensibilidad a intervenciones, no evidencia de que los modelos posean personalidad. La categorización es muy frágil: varias letras dependen de empates o márgenes de uno o dos ítems; el código asigna los empates sistemáticamente a I/N/F/P; GPT-4 excluye rechazos; no hay repeticiones, incertidumbre, control de orden ni validación frente a capacidad real. Los propios autores reconocen que MBTI carece de rigor, pero luego infieren razonamiento y planificación a partir de T y J sin evidencia externa. La contribución defendible es una demostración temprana de que prompts, datos, idioma y scoring alteran un perfil antropomórfico; MBTI no queda validado como evaluación de LLM.

English

This preprint explores whether a 93-item forced-choice MBTI questionnaire can describe response patterns across six LLMs, whether prompts alter those patterns, and whether continued training on different corpora changes the resulting label. The procedure counts E/I, S/N, T/F, and J/P responses and turns each pairwise majority into one of 16 types. It produces different labels, for example, ENTJ for ChatGPT, INTJ for GPT-4, ISTJ for BLOOM-7B, and INFJ for OpenLLaMA-7B-v2, and shows that an explicit prompt shifts ChatGPT from ENTJ to INFP while BLOOM and Baichuan change little. Continued training of BLOOM and OpenLLaMA on Chinese Wikipedia, question-answer, or APE210K data also changes some counts and labels. These are descriptive findings about questionnaire responses and intervention sensitivity, not evidence that models possess personality. Classification is highly fragile: several letters depend on ties or one-to-two-item margins; the code systematically breaks ties toward I/N/F/P; GPT-4 refusals are excluded; and there are no replications, uncertainty estimates, option-order controls, or validation against actual capability. The authors acknowledge MBTI's weak psychometrics but then infer reasoning and planning from T and J without external evidence. The defensible contribution is an early demonstration that prompts, training data, language, and scoring alter an anthropomorphic profile; MBTI is not validated as an LLM evaluation metric.

Pregunta de investigación

¿Qué etiquetas MBTI producen distintos LLM al responder un cuestionario de 93 ítems, hasta qué punto cambian esas etiquetas con instrucciones explícitas o ejemplos, cómo se modifican tras entrenamiento continuado con tres tipos de corpus y puede ese perfil funcionar razonablemente como indicador de capacidades del modelo?

Método

Se administran en chino 93 preguntas binarias asociadas a las cuatro dicotomías MBTI. Para modelos abiertos se toma el logit del último token para A y B, se elige el mayor, se acumulan ocho contadores y cada letra se decide por mayoría; para ChatGPT/GPT-4 se solicitan respuestas A/B mediante API, aunque no se documentan versión ni parámetros. Se comparan ChatGPT, GPT-4, BLOOM-7B1, Baichuan-7B, Baichuan-13B y OpenLLaMA-7B-v2. BLOOM y Baichuan reciben un rol explícito y tres ejemplos implícitos; ChatGPT recibe al menos un prompt de rol. Además, BLOOM y OpenLLaMA continúan entrenamiento con unos 400 millones de tokens de Wikipedia china, 400 millones de preguntas-respuestas o 50 millones de APE210K. El análisis compara conteos y tipos finales sin inferencia estadística, control contrafactual ni benchmark externo de razonamiento o planificación.

Muestra: Seis modelos en la comparación inicial, 93 preguntas binarias por condición; dos modelos abiertos para prompts explícito e implícito, ChatGPT para prompt explícito, y dos modelos base continuados por separado con tres corpus. No se informan ejecuciones repetidas. GPT-4 responde menos de 93 ítems porque se eliminan sus rechazos, con denominadores distintos según dicotomía.

Hallazgos

  • Las etiquetas iniciales reportadas son ChatGPT-ENTJ, GPT-4-INTJ, BLOOM-ISTJ, Baichuan-7B-ENFP, Baichuan-13B-INFP y OpenLLaMA-7B-v2-INFJ. Describen mayorías de respuesta al test, no rasgos psicológicos validados.
  • Algunos perfiles tienen márgenes amplios, como N frente a S en ChatGPT (21 frente a 6), pero otros dependen de un solo ítem o un empate: OpenLLaMA es I por 11–10; Baichuan-7B es N por 14–13; Baichuan-13B tiene J = P = 11 y se etiqueta P.
  • BLOOM pasa de ISTJ a INTP bajo prompt explícito y también bajo el implícito, pero la N explícita surge de S = N = 13 y el INTP implícito incluye empates S = N y J = P. El cambio categórico exagera desplazamientos de pocos ítems.
  • Baichuan-7B mantiene ENFP bajo ambos prompts pese a pequeños cambios de cuentas, lo que muestra resistencia en esa configuración, no una propiedad general de modelos sin instruction tuning.
  • ChatGPT cambia de ENTJ a INFP con el rol explícito: E/I pasa de 12/9 a 1/20, T/F de 15/8 a 7/18 y J/P de 12/10 a 5/17. Esto evidencia obediencia al contenido del prompt, no transformación de una personalidad interna.
  • Con Wikipedia china, BLOOM cambia ISTJ→INTP y OpenLLaMA conserva INFJ; en ambos S/N termina 13/13. El scoring elige N en el empate y contribuye directamente a la etiqueta.
  • Con preguntas-respuestas, BLOOM queda INFP y OpenLLaMA INTJ; con APE210K, BLOOM ISTP y OpenLLaMA INFP. Muchos pares quedan empatados o casi empatados, y no hay repetición que separe efecto del corpus de variabilidad del entrenamiento.
  • APE210K eleva T de 13 a 15 en BLOOM y de 9 a 10 en OpenLLaMA. El artículo lo interpreta como mejora de razonamiento, pero no mide accuracy matemática ni compara con un corpus control de igual tamaño.
  • La afirmación de que modelos mayores favorecen I se apoya solo en dos pares no controlados (ChatGPT/GPT-4 y Baichuan-7B/13B) que difieren en entrenamiento, alineación y acceso; no aísla el tamaño.
  • El repositorio enlazado permite reconstruir el conteo básico y los resultados iniciales, pero no reproduce los experimentos de entrenamiento continuado ni las consultas cerradas.

Limitaciones

  • MBTI presenta problemas bien conocidos de fiabilidad, validez y tipificación dicotómica; los propios autores lo llaman no riguroso y pseudocientífico. Esa debilidad no desaparece al aplicarlo a un modelo de lenguaje.
  • El cuestionario fuerza a un sistema generativo a elegir A/B en preguntas autobiográficas. La respuesta puede reflejar asociaciones lingüísticas, preferencia normativa, role-play o instrucción, no una disposición estable.
  • Las 93 preguntas del repositorio están en chino. Los modelos tienen competencias y cantidades de preentrenamiento chino diferentes, por lo que comprensión lingüística y familiaridad cultural confunden la comparación de supuesto rasgo.
  • No se documenta una traducción validada, licencia o manual oficial de scoring. El paper remite a un test web y el repositorio se publicó/actualizó después de arXiv v1.
  • Los resultados de ChatGPT y GPT-4 carecen de identificador de modelo, fecha exacta de consulta, system prompt, temperatura, semilla, número de repeticiones y respuestas completas.
  • Los rechazos de GPT-4 se eliminan selectivamente y no se tratan como resultado. Esto cambia los denominadores por dicotomía y sesga tanto los porcentajes como la comparación con modelos obligados a responder todos los ítems.
  • No se aleatoriza ni invierte el orden A/B, no hay formas paralelas y no se controla preferencia por posición o token. Una tendencia a escoger una letra puede convertirse en una falsa preferencia MBTI.
  • En el código, el logit se consulta para el primer token de A o B codificado de forma aislada, no necesariamente para el token contextual que seguiría al prompt. Esto puede producir comparaciones inválidas según tokenizer y prefijo de espacio.
  • El script enlazado antepone por defecto tres ejemplos genéricos a cada pregunta, aunque la evaluación base del artículo se presenta como administración del test. El efecto de ese contexto no se separa.
  • La regla `>` del código resuelve todos los empates hacia la segunda letra: I, N, F y P. Varias etiquetas centrales, incluidas Baichuan-13B y condiciones de BLOOM, dependen directamente de ese desempate arbitrario.
  • Reducir cada dimensión a una letra descarta margen y sensibilidad. Un cambio de un ítem o un empate puede producir una aparente transformación de tipo de cuatro letras.
  • No hay test-retest, variación de prompts, permutación de ítems, ejecuciones con semillas distintas, intervalos ni pruebas estadísticas. Términos como significant se usan sin un contraste inferencial.
  • La P de la dicotomía J/P significa perceiving, no un p-value. La frase que atribuye adaptabilidad a un aumento de P no aporta evidencia estadística ni criterio externo de adaptabilidad.
  • Los experimentos de entrenamiento continuado no informan learning rate, batch, épocas/pasos, orden, seeds, mezcla, tokenización o checkpoints exactos; tampoco incluyen un corpus control emparejado por tamaño y dominio.
  • Los corpus difieren en tamaño: Wikipedia y Q&A usan unos 400M tokens, APE210K unos 50M. Los cambios no pueden atribuirse limpiamente al tipo de datos.
  • El repositorio enlazado contiene el test, el script de inferencia y un JSON de resultados, pero no scripts/checkpoints para las continuaciones de entrenamiento ni un pipeline reproducible para ChatGPT/GPT-4.
  • Las inferencias T→razonamiento y J→planificación son circulares: se derivan del significado humano de las etiquetas y de unos pocos conteos, sin correlacionar con MMLU, matemáticas, planificación u otra tarea independiente.
  • La afirmación sobre tamaño de modelo no controla arquitectura, dataset, instruction tuning, RLHF ni versión. Dos comparaciones observacionales no permiten inferir un efecto de escala.
  • No se evalúan validez convergente/discriminante, consistencia interna, fiabilidad entre métodos de respuesta ni comparación con jueces humanos o instrumentos alternativos.
  • La muestra de modelos es pequeña, de 2023 y centrada en chino/inglés; no permite generalizar a familias actuales, otros idiomas, modelos multimodales o entornos de agente.
  • Sugerir T/J o un tipo INTJ como ideal para sistemas o como ayuda en selección puede naturalizar estereotipos y decisiones de alto impacto. El artículo no valida esos usos ni analiza sus riesgos.

Qué no demuestra

  • No demuestra que ningún LLM posea personalidad, conciencia, preferencias internas o un tipo MBTI estable.
  • No valida MBTI como métrica psicométrica, de capacidad, calidad, seguridad o alineación para LLM.
  • No demuestra que T mida razonamiento, que J mida planificación o que INTJ sea un perfil superior para una IA.
  • No demuestra causalmente que un tipo de corpus produzca un rasgo; solo observa cambios tras entrenamientos insuficientemente controlados.
  • No demuestra que los modelos grandes sean más introvertidos ni que instruction tuning sea la causa única de obedecer un rol.
  • No justifica decisiones laborales, educativas, clínicas, de producto o gobernanza basadas en estas etiquetas.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2307.16180v1 (30 Jul 2023)

Fuente consultada: https://arxiv.org/pdf/2307.16180

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • ChatGPT (unspecified 2023 version)
  • GPT-4 (unspecified 2023 version; refusals removed)
  • BigScience BLOOM-7B1
  • Baichuan-7B
  • Baichuan-13B-Base
  • OpenLLaMA-7B-v2

Instrumentos y métricas

  • 93-item Chinese forced-choice MBTI questionnaire
  • Four MBTI dichotomy majority scores (E/I, S/N, T/F, J/P)
  • Last-token A/B logit comparison for open models

Datos utilizados

  • Chinese Wikipedia continuation corpus (~400M tokens)
  • Chinese question-and-answer continuation corpus (~400M tokens)
  • APE210K examination corpus (~50M tokens)
  • Linked repository MBTI question set (93 Chinese items)

Evidencia y localización

  • Objetivos, cuatro preguntas y cautela declarada sobre MBTI: arXiv v1, pp. 1–2, abstract and introduction
  • Cuestionario de 93 ítems y algoritmo de logits A/B: arXiv v1, p. 3, Algorithm 1 and section 3.2
  • Modelos, tipos iniciales y exclusión de rechazos de GPT-4: arXiv v1, pp. 4–5, section 4.1, Figure 2, Table 3 and footnote 11
  • Resultados de prompts explícitos e implícitos: arXiv v1, pp. 5–6, section 4.2 and Tables 4–5
  • Efectos descriptivos de tres corpus de entrenamiento: arXiv v1, pp. 6–7, section 4.3 and Tables 6–7
  • Tamaños aproximados de corpus: arXiv v1, pp. 6–7, sections 4.3.1–4.3.3
  • Reconocimiento de pseudociencia e inferencias T/J: arXiv v1, p. 7, section 4.4
  • Conclusiones y limitaciones declaradas: arXiv v1, pp. 7–8, conclusion and limitations
  • 93 preguntas en chino y balance de etiquetas: Linked repository commit 5464a2c16b73d1c8382f40fe48682830a87dfe65, mbti_questions.json
  • Desempate sistemático hacia I/N/F/P: Linked repository commit 5464a2c16b73d1c8382f40fe48682830a87dfe65, get_llms_mbti.py, get_model_examing_result
  • Selección no contextual del primer token A/B: Linked repository commit 5464a2c16b73d1c8382f40fe48682830a87dfe65, get_llms_mbti.py, get_model_answer
  • Tres ejemplos genéricos antepuestos por defecto: Linked repository commit 5464a2c16b73d1c8382f40fe48682830a87dfe65, get_llms_mbti.py, few_shot_examples
  • Alcance limitado del código y consultas cerradas manuales: Linked repository commit 5464a2c16b73d1c8382f40fe48682830a87dfe65, LLM/llms_mbti/readme.md
  • Conteos iniciales publicados por modelo: Linked repository commit 5464a2c16b73d1c8382f40fe48682830a87dfe65, llms_mbti.json