Identifying Multiple Personalities in Large Language Models with External Evaluation

Evaluación y validez psicométrica2024arXivRevisión editorial aprobada

Autores: Xiaoyang Song, Yuta Adachi, Jessie Feng, Mouwei Lin, Linhao Yu, Frank Li, Akshat Gupta, Gopala Anumanchipalli, Simerjot Kaur

Palabras clave: Computation and Language, Artificial Intelligence, Large Language Models, Personality Assessment, Machine Learning

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

9
Autores
10
Hallazgos
23
Limitaciones
13
Evidencias

Resumen editorial

Español

El preprint propone una evaluación «externa»: en vez de pedir a un LLM que conteste un cuestionario, entrena un Llama2-7B con LoRA para predecir una de 16 etiquetas MBTI a partir de 50 textos y aplica ese clasificador a publicaciones y comentarios generados por ChatGPT y tres Llama2-chat. El predictor alcanza 81,0% de accuracy al agregar cuatro clasificadores binarios y 81,7% como clasificador directo de 16 clases en un split interno del dataset Kaggle PersonalityCafe. Para cada modelo y rol se remuestrean 100 conjuntos de 50 textos con reemplazo. En los resultados, Llama2-7B y 13B pasan de una moda ESTJ en posts a INFP en comentarios, Llama2-70B de ESTJ a INFJ, y ChatGPT mantiene INFJ como moda pero cambia mucho su distribución. Ocho celebridades sirven como contraste: siete conservan la moda entre posts/comentarios, pero solo seis conservan también la segunda moda. El estudio muestra que un clasificador de estilo/tema asigna distribuciones MBTI distintas a dos tipos de salida. No demuestra que los LLM tengan múltiples personalidades: rol, prompt, contenido y acto discursivo cambian a la vez; el detector se traslada de un foro de personalidad a Twitter y texto sintético sin validación fuera de dominio; las 100 muestras se solapan; no hay test estadístico, verdad MBTI de celebridades ni control por tema/longitud. La conclusión más sólida es metodológica: las etiquetas de personalidad inferidas desde texto dependen fuertemente del dominio y la situación, por lo que deben interpretarse como patrones de salida del clasificador, no como rasgos internos.

English

The preprint proposes an “external” evaluation: rather than asking an LLM to complete a questionnaire, it LoRA-fine-tunes Llama2-7B to predict one of 16 MBTI labels from 50 texts and applies that classifier to posts and comments generated by ChatGPT and three Llama2-chat models. The detector reaches 81.0% accuracy when aggregating four binary classifiers and 81.7% as a direct 16-class classifier on an internal split of the Kaggle PersonalityCafe dataset. For each model and role, the study resamples 100 sets of 50 texts with replacement. Llama2-7B and 13B shift from a modal ESTJ label on posts to INFP on comments, Llama2-70B from ESTJ to INFJ, while ChatGPT remains modally INFJ but has a substantially different distribution. Eight celebrities form a human comparison: seven retain the modal label across posts/comments, but only six retain the second-most-frequent label as well. The study shows that a style/topic classifier assigns different MBTI distributions to two output types. It does not demonstrate multiple LLM personalities: role, prompt, content, and discourse act change together; the detector is transferred from a personality forum to Twitter and synthetic text without out-of-domain validation; the 100 samples overlap; and there is no statistical test, celebrity MBTI ground truth, or control for topic and length. The strongest conclusion is methodological: text-inferred personality labels depend strongly on domain and situation and should be treated as classifier output patterns, not internal traits.

Pregunta de investigación

¿Puede un clasificador de MBTI entrenado sobre conjuntos de 50 textos humanos servir como evaluador externo de salidas abiertas de LLM, y cambian las distribuciones de etiquetas cuando el mismo modelo genera publicaciones frente a comentarios en Twitter en comparación con autores humanos?

Método

Se divide el dataset Kaggle MBTI de 8.675 usuarios de PersonalityCafe en 81% entrenamiento, 9% validación y 10% test. Cada entrada contiene 50 posts/comentarios y una etiqueta MBTI. Se afinan con LoRA cuatro Llama2-7B binarios y un Llama2-7B de 16 clases durante cinco épocas (r = 16, learning rate 1e-4, batch 8, warm-up 100 pasos, decay lineal). Para el estudio externo, se resumen noticias de noviembre de 2023 y se recopilan 5.000 tuits en diez temas; ChatGPT y Llama2-chat 7B/13B/70B generan 4.500 posts a partir de noticias y 5.000 comentarios a tuits con dos system/user prompts distintos, temperatura 0,2, top_p 0,95 y máximo 200. Para cada modelo y rol se extraen con reemplazo 100 muestras de 50 salidas y se clasifican. Se repite el remuestreo con posts y comentarios reales de ocho celebridades anónimas como contraste humano.

Muestra: 8.675 entradas para entrenar/evaluar el detector, con split 81:9:10. Para cada combinación de cuatro LLM y dos roles se muestran 100 remuestreos de 50 textos con reemplazo desde los pools generados. El contraste humano usa ocho celebridades y 100 remuestreos de 50 posts o comentarios por persona. Las identidades y etiquetas MBTI verdaderas de las celebridades no se proporcionan.

Hallazgos

  • El detector binario agregado obtiene 93,3% de accuracy media por eje pero 81,0% en la etiqueta completa de 16 clases; el detector directo obtiene 93,5% por eje y 81,7% en 16 clases. La diferencia ilustra que promediar ejes sobrestima el rendimiento del tipo completo.
  • Los baselines citados caen de 61,0–78,2% de accuracy media por eje a 14,0–37,6% en 16 clases. Sin embargo, sus resultados se toman de trabajos previos y no se informa una reevaluación homogénea en el mismo split.
  • En posts, ESTJ domina en Llama2-7B (73%), Llama2-13B (43%) y Llama2-70B (53%). En comentarios, INFP domina en 7B y 13B (80% cada uno), mientras 70B se reparte principalmente entre INFJ (45%) e INFP (37%).
  • ChatGPT mantiene INFJ como moda tanto en posts como en comentarios, pero la distribución cambia: en posts INFJ/INFP/ISTJ representan aproximadamente 30/29/19%, mientras en comentarios INFJ alcanza 73,7%.
  • El cambio de moda no es universal: ChatGPT conserva INFJ. Por ello el resultado general es un cambio de distribución asignada por rol, no necesariamente un cambio categórico para todos los modelos.
  • Entre las ocho celebridades, siete conservan el tipo más frecuente; Celebrity VI cambia INFJ→ENTJ. Seis conservan también el segundo tipo; Celebrity VIII mantiene INFJ pero cambia ISFJ→ENFJ como segunda moda.
  • Las distribuciones humanas tampoco son idénticas: por ejemplo, Celebrity II pasa de 67% a 56% INFJ y Celebrity III de 79% a 54%. La mayor estabilidad relativa no equivale a invariancia.
  • Las diferencias LLM post/comentario son mayores que las observadas para la mayoría de celebridades bajo este detector, pero el diseño no separa efecto del rol de efecto de tema, prompt, longitud o dominio.
  • Los autores reconocen que la definición humana de personalidad no debe transferirse ingenuamente a LLM y que el trabajo no ofrece una definición o medida alternativa validada.
  • El trabajo muestra la utilidad de informar la distribución completa: una moda igual, como en ChatGPT, puede ocultar cambios grandes, y una etiqueta única pierde la incertidumbre del clasificador.

Limitaciones

  • El detector se valida dentro de PersonalityCafe y luego se aplica sin validación a Twitter, celebridades y texto generado por LLM. El cambio de dominio, plataforma, longitud, audiencia y autoría puede alterar las predicciones.
  • PersonalityCafe es un foro sobre tipos de personalidad. El artículo no documenta eliminar menciones de MBTI, nombres de tipos, firmas, URLs u otras pistas directas, por lo que existe riesgo de fuga de etiqueta.
  • No se presenta distribución de las 16 clases, matriz de confusión, rendimiento por clase ni definición de si F1/precision/recall son macro, micro o weighted. Una accuracy alta puede ocultar clases minoritarias.
  • La afirmación de superar significativamente al estado del arte no incluye test estadístico. Los baselines se citan desde sus trabajos originales en lugar de reentrenarse con exactamente el mismo split, preprocesado y protocolo.
  • Una etiqueta MBTI de un usuario de PersonalityCafe es autodeclarada y categórica; no se verifica con un instrumento administrado, no se mide fiabilidad y MBTI tiene limitaciones psicométricas propias.
  • El clasificador puede aprender tema, vocabulario comunitario y estilo de plataforma en vez de personalidad. La propia selección de diez temas y los prompts inducen señales de ese tipo.
  • Posts y comentarios no constituyen una manipulación aislada: usan system prompts distintos, inputs distintos (resúmenes de noticias frente a tuits), actos discursivos distintos y probablemente longitudes/temas diferentes.
  • El estudio no empareja un mismo contenido expresado como post y comentario, no contrabalancea prompts ni usa un clasificador ciego al rol. Por tanto no puede atribuir causalmente la diferencia a una personalidad dependiente del rol.
  • Las 100 observaciones son muestras de 50 con reemplazo de los mismos pools. Se solapan intensamente y no son 100 ejecuciones independientes del modelo ni 100 autores; los gráficos no aportan intervalos ajustados a esa dependencia.
  • El muestreo con reemplazo puede duplicar textos dentro de un conjunto de 50, mientras el detector se entrenó con 50 posts distintos de una persona. Esta discrepancia puede aumentar la confianza en rasgos repetidos.
  • El texto usa «significantly different» para las distribuciones post/comentario, pero no informa distancia, chi-cuadrado, divergencia, permutación, intervalo o p-value.
  • La clasificación usa un Llama2-7B para evaluar salidas de la misma familia Llama2. Artefactos compartidos de tokenizer, preentrenamiento o estilo pueden afectar de forma distinta a ChatGPT y Llama2.
  • No se especifica el snapshot de ChatGPT, fecha exacta de API ni semilla. La afirmación de que el contenido de noviembre de 2023 no estaba en entrenamiento no puede verificarse para un alias de API cambiante.
  • El pipeline que resume miles de noticias no identifica el sistema de resumen ni evalúa fidelidad. Posibles sesgos del resumen pasan al prompt y a la etiqueta posterior.
  • No se aclara de forma inequívoca si las cifras 4.500 posts y 5.000 comentarios corresponden a cada modelo o al total, ni se publican los pools generados, noticias, tuits o código.
  • No se documenta cómo se concatenan y truncan 50 textos para Llama2-7B, cuya ventana puede ser menor que 50 salidas de hasta 200 tokens. El orden y truncación podrían dominar la clasificación.
  • La validación humana no conoce la personalidad verdadera de las celebridades. Obtener etiquetas parecidas en dos tipos de texto prueba consistencia del detector, no exactitud ni validez sobre personas.
  • Ocho celebridades son una muestra pequeña, selectiva y anónima. No hay información sobre número total de posts por rol, periodo, idioma, actividad automatizada o criterios de inclusión.
  • Los resultados humanos no son completamente estables: una celebridad cambia la moda y otra la segunda moda; varias cambian mucho sus proporciones. La afirmación de que la personalidad humana es consistente se apoya en un umbral descriptivo no definido.
  • Comparar publicaciones y comentarios de celebridades puede mezclar escritura propia, equipos de comunicación, contenido promocional y gestión profesional. La autoría no se verifica.
  • No se discuten consentimiento, privacidad, términos de plataforma o tratamiento ético de tuits y celebridades, y las identidades se ocultan por razones propietarias, impidiendo auditoría independiente.
  • Solo se estudia inglés, Twitter, cuatro modelos de 2023 y MBTI. No hay generalización a conversación multi-turn, otros idiomas/plataformas, Big Five, modelos actuales o tareas de alto impacto.
  • Incluso una clasificación textual perfectamente precisa no demostraría un estado interno: puede reflejar el comportamiento condicionado por el prompt, que es precisamente lo que el modelo fue diseñado para adaptar.

Qué no demuestra

  • No demuestra que ChatGPT o Llama2 posean una personalidad humana ni múltiples personalidades internas.
  • No demuestra que el rol cause el cambio observado, porque prompt, contenido, tema y formato también cambian.
  • No valida el detector MBTI fuera de PersonalityCafe ni demuestra exactitud sobre Twitter, celebridades o texto sintético.
  • No demuestra que los humanos mantengan un MBTI verdadero e invariable entre posts y comentarios; solo observa mayor similitud de predicciones en ocho casos.
  • No proporciona una definición validada de personalidad de LLM ni una medida apta para decisiones clínicas, laborales o de seguridad.
  • No permite inferir rasgos, intenciones, motivaciones o estabilidad futura a partir de una etiqueta modal del clasificador.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2402.14805v1 (22 Feb 2024)

Fuente consultada: https://arxiv.org/pdf/2402.14805

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • Llama2-7B base fine-tuned as MBTI detector
  • ChatGPT (unspecified API snapshot)
  • Llama2-7B-chat
  • Llama2-13B-chat
  • Llama2-70B-chat

Instrumentos y métricas

  • Myers-Briggs Type Indicator (16 categorical types)
  • Four binary Llama2-7B MBTI classifiers
  • Direct 16-class Llama2-7B MBTI classifier
  • Accuracy, F1, precision and recall
  • Modal and resampled MBTI label distributions

Datos utilizados

  • Kaggle MBTI / PersonalityCafe dataset (8,675 users, 50 texts each)
  • November 2023 news-derived topics
  • 5,000 collected tweets across Bitcoin, NFL, Music, Oscars, Travel, Fashion, Food, Fitness, Gaming and Technology
  • 4,500 LLM-generated posts and 5,000 LLM-generated comments reported
  • Posts and comments from eight anonymized celebrities

Evidencia y localización

  • Motivación, evaluación externa y conclusión declarada: arXiv v1, pp. 1–2, abstract and introduction
  • Dataset PersonalityCafe y baselines previos: arXiv v1, pp. 3–4, sections 2.3 and 3.1
  • Arquitectura, LoRA e hiperparámetros del detector: arXiv v1, p. 4, section 3.1
  • Rendimiento por eje y en 16 clases: arXiv v1, pp. 4–5, Tables 1–2
  • News/tweets, dos roles y prompts distintos: arXiv v1, pp. 5–6, section 3.2 and Table 3
  • Tamaños de pools y remuestreo de 50 con reemplazo: arXiv v1, p. 6, sections 3.2–3.3
  • Distribuciones LLM por rol: arXiv v1, pp. 6–7, Figure 3 and Table 4
  • Contraste con ocho celebridades: arXiv v1, pp. 7–8, Figure 4, Table 5 and Validation with Human Counterpart
  • Cautela conceptual y límite del clasificador: arXiv v1, p. 8, Conclusions and Limitation
  • Split 81:9:10 y resultados completos por eje: arXiv v1, p. 11, Appendix A.3, Tables 6–7
  • Generación, temas, temperatura, top_p y longitud: arXiv v1, p. 11, Appendix A.4
  • Distribuciones de las ocho celebridades y excepciones: arXiv v1, pp. 11–12, Appendix A.5 and Figure 5
  • Ejemplos y posible contenido identificador de PersonalityCafe: arXiv v1, p. 12, Table 8