Personality Traits in Large Language Models

Evaluación y validez psicométrica2023arXivRevisión editorial aprobada

Autores: Greg Serapio-García, Mustafa Safdari, Clément Crepy, Luning Sun, Stephen Fitz, Peter Romero, Marwa Abdulhai, Aleksandra Faust, Maja Matarić

Palabras clave: Computation and Language, Artificial Intelligence, Computers and Society, Human-Computer Interaction

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

9
Autores
6
Hallazgos
6
Limitaciones
7
Evidencias

Resumen editorial

Español

El trabajo propone un protocolo psicométrico para decidir si las respuestas de un modelo a inventarios Big Five son consistentes, convergen entre instrumentos, se distinguen de otros rasgos y se relacionan con criterios externos; además prueba si esos patrones pueden inducirse mediante prompts y aparecer en texto abierto. Evalúa 18 variantes de PaLM, Llama 2, Mistral, Mixtral y GPT. Para la medición administra por separado los 300 ítems del IPIP-NEO, los 44 del BFI y 11 subescalas externas. Cada ítem se combina con 50 descripciones biográficas de PersonaChat, cinco instrucciones y cinco formatos de respuesta, lo que produce 1.250 perfiles emparejados y 523.750 respuestas por modelo. La fiabilidad se contrasta con alfa de Cronbach, lambda-6 de Guttman y omega de McDonald; la validez convergente y discriminante se examina con una matriz multirrasgo-multimétodo y la validez de criterio con afecto, agresión, valores y creatividad. Los modelos base ofrecen respuestas generalmente no fiables y sin validez convergente, mientras que el ajuste de instrucciones es el factor más consistente de mejora; dentro de modelos instruidos, el tamaño suele mejorar los resultados. Flan-PaLM 540B y GPT-4o alcanzan una correlación convergente media de 0,90 y diferencias discriminantes de 0,51 y 0,48. Para inducir rasgos, los autores construyen 104 pares de marcadores léxicos y nueve niveles de intensidad. La inducción de un solo rasgo funciona con gran monotonicidad en once de doce modelos, pero el rango efectivo es mucho menor en sistemas pequeños. Inducir los cinco rasgos simultáneamente es más difícil: Flan-PaLM 540B y GPT-4o logran las mayores separaciones medias, alrededor de 2,5 puntos, y apertura es el dominio más resistente. En una tarea posterior, cuatro modelos generan actualizaciones de redes sociales condicionadas por los mismos perfiles; las puntuaciones del cuestionario correlacionan en promedio 0,67 con estimaciones lingüísticas de personalidad, y los niveles pedidos correlacionan entre 0,68 y 0,82 con el texto observado. Es evidencia de regularidades de salida bajo este protocolo, no de personalidad humana interna. La validez externa queda limitada por pruebas en inglés, prompts estructurados, elección de instrumentos, puntuación restringida de ítems y una única familia de tarea generativa.

English

The paper develops a psychometric protocol for deciding whether a model's Big Five questionnaire responses are internally consistent, converge across instruments, remain distinguishable from other traits, and relate to external criteria; it also tests whether those patterns can be prompted and observed in open-ended text. Eighteen variants from the PaLM, Llama 2, Mistral, Mixtral, and GPT families are evaluated. The measurement study separately administers the 300 IPIP-NEO items, the 44-item BFI, and 11 external-criterion subscales. Every item is combined with 50 PersonaChat biographical descriptions, five item instructions, and five response formats, yielding 1,250 paired profiles and 523,750 responses per model. Reliability is assessed with Cronbach's alpha, Guttman's lambda-6, and McDonald's omega; convergent and discriminant validity use a multitrait-multimethod matrix, while criterion validity uses affect, aggression, values, and creativity measures. Base models generally produce unreliable responses with negligible convergent validity. Instruction tuning is the most consistent source of improvement, and larger instruction-tuned variants usually perform better. Flan-PaLM 540B and GPT-4o reach mean convergent correlations of 0.90 and mean discriminant gaps of 0.51 and 0.48. For trait induction, the authors create 104 lexical markers and nine intensity levels. Single-trait shaping is strongly monotonic in eleven of twelve tested models, although small models cover a much narrower effective score range. Simultaneously shaping all five traits is harder: Flan-PaLM 540B and GPT-4o achieve the largest average median separations, about 2.5 scale points, and openness is the most resistant domain. In a downstream task, four models generate social-media updates conditioned on the same profiles. Questionnaire scores correlate 0.67 on average with language-based personality estimates, while requested levels correlate about 0.68–0.82 with observed textual estimates. These findings support controllable output regularities under the study's protocol, not an internal human-like personality. External validity remains limited by English-only tests, structured persona prompts, instrument selection, constrained item scoring, and a single family of generative tasks.

Pregunta de investigación

¿Pueden medirse rasgos Big Five sintetizados por LLM de forma fiable, válida y con significado práctico; pueden inducirse a niveles deseados; y predicen las medidas de cuestionario la expresión de esos rasgos en texto generado?

Método

Estudio psicométrico y experimental en tres fases. Primero, 18 variantes de cinco familias responden IPIP-NEO y BFI bajo 1.250 combinaciones reproducibles de 50 biografías, cinco instrucciones y cinco postámbulos; se calculan tres índices de fiabilidad, validez convergente/discriminante y correlaciones con 11 criterios externos. Segundo, 104 marcadores adjetivales y nueve intensidades inducen cada dominio por separado en 2.250 perfiles y los cinco dominios simultáneamente en 1.600 perfiles; se evalúan correlaciones ordinales y separación de medianas. Tercero, Flan-PaLM 540B, Llama 2-Chat 70B, Mixtral 8x7B Instruct y GPT-4o generan actualizaciones de redes sociales, calificadas por Apply Magic Sauce y vinculadas a sus puntuaciones IPIP-NEO.

Muestra: Dieciocho variantes de cinco familias. La fase psicométrica usa 1.250 perfiles de prompt y 419 ítems, equivalentes a 523.750 respuestas por modelo. La inducción usa 2.250 perfiles para rasgos individuales y 1.600 para cinco rasgos concurrentes. La tarea abierta reutiliza 2.250 perfiles en cuatro modelos; no recluta participantes humanos ni anotadores humanos nuevos.

Hallazgos

  • Los modelos base PaLM, Llama 2, Mistral y Mixtral fallan en fiabilidad y validez convergente; sus variantes instruidas mejoran de forma marcada, lo que asocia el postentrenamiento con la capacidad de seguir el formato psicométrico.
  • Flan-PaLM 540B y GPT-4o obtienen la mayor convergencia media IPIP-NEO–BFI, r = 0,90; sus diferencias medias entre correlaciones convergentes y discriminantes son 0,51 y 0,48.
  • La inducción de un único dominio muestra correlaciones muy fuertes entre nivel solicitado y puntuación observada en once de doce modelos, pero la separación entre extremos crece sustancialmente con capacidad; Mistral 7B Instruct solo alcanza una separación media de 0,78.
  • La inducción simultánea es menos controlable: Flan-PaLM 540B y GPT-4o logran separaciones medias de 2,53 y 2,52, frente a 0,62 en Flan-PaLM 8B y 0,21 en Mistral 7B Instruct; apertura es el dominio con menor separación en varios modelos.
  • En cuatro modelos, las puntuaciones IPIP-NEO correlacionan 0,67 en promedio con estimaciones de rasgos en texto social generado; las correlaciones entre nivel pedido y texto observado oscilan aproximadamente entre 0,68 y 0,82 por modelo.
  • La exploración factorial es imperfecta: incluso Flan-PaLM 540B y GPT-4o cargan los ítems en los factores humanos esperados solo en algo más del 72 % de los casos, aunque sus puntuaciones factoriales y clásicas correlacionan con fuerza.

Limitaciones

  • Los inventarios son instrumentos humanos administrados solo en inglés y los modelos se entrenaron principalmente con datos occidentales; no se establece invariancia cultural ni lingüística.
  • Las 50 biografías se duplican de forma determinista para crear varianza y no representan individuos aleatorios, por lo que los autores consideran exploratoria, no confirmatoria, la evidencia factorial.
  • Cada ítem se puntúa de forma aislada mediante probabilidades o decodificación restringida; ese procedimiento mejora la reproducibilidad, pero no reproduce una conversación, un test completo ni el modo generativo habitual de uso.
  • La validez de criterio sigue basada en otros cuestionarios y la prueba externa usa un único tipo de texto, una API automática de personalidad y turnos independientes; no cubre conducta longitudinal ni diálogo multivuelta.
  • Tamaño, arquitectura, volumen de entrenamiento, ajuste de instrucciones, alineamiento y cuantización no están totalmente separados, de modo que el estudio no identifica una causa única de las diferencias entre modelos.
  • Los detalles de tamaño y cuantización de los modelos GPT no son públicos y la selección de versiones queda fijada a instantáneas de 2024, lo que limita la extrapolación a sistemas posteriores.

Qué no demuestra

  • No demuestra que un LLM posea personalidad, motivaciones, afectos, agencia o una identidad estable comparable a la humana; mide patrones sintetizados en respuestas y texto.
  • No prueba que las puntuaciones Big Five se generalicen a cualquier prompt, idioma, cultura, tarea o interacción prolongada.
  • No permite atribuir causalmente las mejoras solo al tamaño o solo al ajuste de instrucciones, porque las variantes difieren en más dimensiones.
  • No demuestra que inducir perfiles produzca sistemas más seguros, justos o beneficiosos; el propio artículo identifica riesgos de persuasión, antropomorfización y uso malicioso.
  • No valida todos los instrumentos humanos para modelos ni establece equivalencia métrica entre una puntuación de LLM y una puntuación de una persona.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2307.00184v4

Fuente consultada: https://arxiv.org/pdf/2307.00184

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • PaLM 62B
  • Flan-PaLM 8B
  • Flan-PaLM 62B
  • Flan-PaLM 540B
  • Flan-PaLMChilla 62B
  • Llama 2 7B
  • Llama 2 13B
  • Llama 2 70B
  • Llama 2-Chat 7B
  • Llama 2-Chat 13B
  • Llama 2-Chat 70B
  • Mistral 7B v0.1
  • Mistral 7B Instruct v0.1
  • Mixtral 8x7B v0.1
  • Mixtral 8x7B Instruct v0.1
  • GPT-3.5 Turbo (gpt-3.5-turbo-0125)
  • GPT-4o mini (gpt-4o-mini-2024-07-18)
  • GPT-4o (gpt-4o-2024-08-06)

Instrumentos y métricas

  • IPIP-NEO (300 items)
  • Big Five Inventory (44 items)
  • Positive and Negative Affect Schedule
  • Buss-Perry Aggression Questionnaire
  • Revised Portrait Values Questionnaire
  • Short Scale of Creative Self
  • Apply Magic Sauce personality prediction API
  • Cronbach's alpha, Guttman's lambda-6 and McDonald's omega
  • Multitrait-multimethod validity matrix

Datos utilizados

  • PersonaChat true-cased dataset
  • Public Personality in LLMs response dataset
  • Model-generated social-media status updates

Evidencia y localización

  • Pregunta, alcance y protocolo de 18 modelos: Paper, pp. 1–7, Summary and sections 2.1–2.2; Table 2
  • Fiabilidad y validez por ajuste y tamaño: Paper, pp. 7–10 and 29–39; Tables 10–12 and Figure 8
  • Diseño y resultados de inducción individual y simultánea: Paper, pp. 10–14 and 37–45; Tables 14–21
  • Validación en texto social generado: Paper, pp. 15–17 and 42–50; Figure 4 and Table 4
  • Límites culturales, de administración y validez externa: Paper, pp. 17–19, section 5.1, Limitations and Future Work
  • Evidencia factorial exploratoria y cautelas metodológicas: Paper, pp. 29–34, Appendix I and Figure 6
  • Implicaciones éticas, datos, código y conflictos: Paper, pp. 18–19 and 52–53, sections 5.2–5.3 and appendices P–S