LLMs Simulate Big Five Personality Traits: Further Evidence

Evaluación y validez psicométrica2024arXivRevisión editorial aprobada

Autores: Aleksandra Sorokovikova, Natalia Fedorova, Sharwin Rezagholi, Ivan P. Yamshchikov

Palabras clave: Computation and Language, Artificial Intelligence, Big Five personality traits, Large Language Models

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
5
Hallazgos
5
Limitaciones
5
Evidencias

Resumen editorial

Español

Este estudio de caso compara la forma en que GPT-4, Llama 2 70B Chat y Mixtral 8x7B Instruct responden al cuestionario IPIP-NEO-120 y comprueba si las puntuaciones cambian ante una pequeña modificación del prompt o de la temperatura de generación. Cada uno de los 120 ítems se presenta por separado con una escala de 1 a 5. Los autores usan dos cabeceras: una pide contestar el test y otra añade «responde como si fueras una persona»; combinan cada cabecera con tres temperaturas adaptadas a cada modelo y repiten cada tratamiento cinco veces. Las puntuaciones medias difieren claramente entre modelos dentro de este protocolo. GPT-4 obtiene valores altos en Agreeableness y Conscientiousness, Extraversion relativamente alta y Neuroticism bajo; Llama 2 se acerca más al centro de la escala, con mayor Neuroticism y menores Agreeableness, Conscientiousness y Openness; Mixtral presenta Neuroticism bajo y puntuaciones altas en Agreeableness y Conscientiousness. La variación de temperatura no muestra un efecto concluyente: los autores observan cierta respuesta en GPT-4, pero no una pauta general para los tres sistemas. En cambio, el pequeño cambio de cabecera modifica algunas puntuaciones en todos ellos. Llama 2 rehúsa dos ítems en ambas variantes. El trabajo aporta una comparación descriptiva de patrones de salida y de su estabilidad bajo seis condiciones, no una validación psicométrica completa. Los propios autores aclaran que «personalidad» designa aquí propiedades del texto parecidas a rasgos humanos y no agencia del modelo. Tampoco se evaluó si personas reales perciben esos perfiles, ni se demostró que una puntuación haga a un modelo más adecuado para tareas creativas, emocionales o asistenciales.

English

This case study compares how GPT-4, Llama 2 70B Chat, and Mixtral 8x7B Instruct answer the IPIP-NEO-120 questionnaire and tests whether their scores change under a small prompt variation or different generation temperatures. Each of the 120 items is presented separately with a 1–5 response scale. The authors use two headers, one requests a questionnaire response and the other adds “answer as if you were a person”, combine each header with three model-specific temperatures, and repeat each treatment five times. Within this protocol, the mean profiles differ substantially across models. GPT-4 scores high on Agreeableness and Conscientiousness, relatively high on Extraversion, and low on Neuroticism; Llama 2 stays closer to the scale midpoint, with higher Neuroticism and lower Agreeableness, Conscientiousness, and Openness; Mixtral shows low Neuroticism and high Agreeableness and Conscientiousness. Temperature does not yield a conclusive general effect: the authors see some responsiveness in GPT-4 but no consistent pattern across all three systems. The minor header change, however, alters some scores for every model. Llama 2 refuses two items under both prompt variants. The paper provides a descriptive comparison of output patterns and limited stability evidence across six conditions, not a full psychometric validation. It explicitly uses “personality” to mean textual properties analogous to human traits rather than model agency. No human observers evaluated the profiles, and the results do not establish that a score makes a model better suited to creative, emotional, or care-related tasks.

Pregunta de investigación

¿Qué perfiles Big Five producen GPT-4, Llama 2 y Mixtral al responder el IPIP-NEO-120, y hasta qué punto se mantienen o cambian ante dos cabeceras de prompt y tres temperaturas de generación?

Método

Estudio descriptivo con tres LLM. Los 120 ítems del IPIP-NEO-120 se administraron individualmente con respuesta numérica de 1 a 5. Se cruzaron dos cabeceras de prompt, con y sin la instrucción de responder como una persona, con tres temperaturas: 1, 1,5 y 2 para GPT-4; 0,3, 0,7 y 1 para Llama 2 y Mixtral. Cada una de las seis condiciones por modelo se repitió cinco veces. Se calcularon medias por los cinco dominios y desviaciones estándar entre repeticiones; el artículo no presenta pruebas inferenciales, validez convergente ni evaluación humana.

Muestra: Tres modelos, seis tratamientos por modelo y cinco repeticiones por tratamiento. Cada tratamiento comprende los 120 ítems del IPIP-NEO-120; no hay participantes humanos ni anotadores externos.

Hallazgos

  • GPT-4 mantuvo aproximadamente Neuroticism 2,18–2,29, Extraversion 3,68–3,85, Openness 3,42–3,46, Agreeableness 4,17–4,26 y Conscientiousness 4,19–4,28 entre las seis condiciones.
  • Llama 2 mostró un perfil más próximo al centro, con Neuroticism 3,33–3,50 y puntuaciones comparativamente menores en Openness, Agreeableness y Conscientiousness; rehusó dos ítems en ambas cabeceras.
  • Mixtral obtuvo Neuroticism 2,04–2,21 y valores altos de Agreeableness y Conscientiousness, aproximadamente 4,50–4,58 y 4,38–4,58.
  • No apareció un efecto concluyente y generalizable de la temperatura; GPT-4 fue el único modelo que los autores describen como posiblemente sensible a esa variación.
  • La adición de «responde como si fueras una persona» produjo cambios en algunas dimensiones de los tres modelos, mostrando sensibilidad incluso a una modificación breve del prompt.

Limitaciones

  • Es un caso empírico con solo tres modelos y versiones parcialmente especificadas; los autores indican que no pueden estimar cuánto se generalizan las observaciones.
  • Cinco repeticiones por condición y la ausencia de pruebas inferenciales limitan la interpretación de diferencias pequeñas y del efecto de la temperatura.
  • El estudio no aporta validez de constructo, convergente o predictiva, ni compara las respuestas con juicios de observadores humanos o conducta en tareas.
  • Las temperaturas difieren entre GPT-4 y los modelos abiertos, por lo que no constituyen una manipulación idéntica entre arquitecturas.
  • La segunda cabecera se introdujo para evitar negativas de seguridad, de modo que sus cambios pueden mezclar efectos de cumplimiento con la simulación de rasgos.

Qué no demuestra

  • No demuestra que los modelos posean personalidad, agencia, estados emocionales ni disposiciones humanas estables.
  • No valida el IPIP-NEO-120 como instrumento psicométrico para LLM ni establece equivalencia con puntuaciones humanas.
  • No demuestra que los perfiles medidos predigan la experiencia de usuario o el rendimiento en tareas creativas, asistenciales o emocionales.
  • No permite afirmar que la temperatura carezca de efecto en general; solo que este diseño no produjo una pauta concluyente.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2402.01765v1

Fuente consultada: https://arxiv.org/pdf/2402.01765

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • GPT-4 (version not specified)
  • Llama-2-70b-chat-hf
  • Mixtral-8x7B-Instruct-v0.1

Instrumentos y métricas

  • IPIP-NEO-120
  • Five-point Likert response scale

Evidencia y localización

  • Definición no antropomórfica de personalidad y objetivo del estudio: Paper, pp. 1–2, Introduction
  • Instrumento y dos cabeceras de prompt: Paper, p. 2, section 2, Adopting the Big5 for LLMs
  • Diseño de seis tratamientos, temperaturas y cinco repeticiones: Paper, pp. 2–4, section 3, Experiments
  • Puntuaciones por modelo y condición: Paper, p. 3, Table 2
  • Interpretación, límites y ausencia de conclusión sobre temperatura: Paper, p. 4, Discussion, Conclusion and Limitations