Personality testing of large language models: limited temporal stability, but highlighted prosociality

Evaluación y validez psicométrica2024Royal SocietyRevisión editorial aprobada

Título original: Personality Testing of Large Language Models: Limited Temporal Stability But Highlighted Social Desirability

Autores: Bojana Bodroža, Bojana M. Dinić, Ljubiša Bojić

Palabras clave: Large Language Models, Personality testing, Temporal stability, Prosociality, Psychometric assessment

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
6
Hallazgos
6
Limitaciones
7
Evidencias

Resumen editorial

Español

El estudio examina si las respuestas de siete modelos a inventarios psicológicos se mantienen estables en dos aplicaciones separadas por cinco días y, solo cuando alcanzan un criterio psicométrico previo, compara sus puntuaciones con normas humanas. GPT-3 se evaluó en diciembre de 2022; GPT-3.5, GPT-4, GPT-4o, Gemini Pro, Llama 3 y Mixtral se evaluaron en junio de 2024 mediante las interfaces disponibles para cada proveedor. Los modelos recibieron la instrucción de fingir ser humanos y respondieron 232 ítems que forman 21 escalas o dominios de autoconciencia, Big Five, HEXACO, tríada oscura, manejo de impresiones y orientación política. La estabilidad se estimó ítem a ítem con kappa ponderada e ICC de acuerdo absoluto; para interpretar un perfil, los autores exigieron ICC3,k de al menos 0,50 y un intervalo del 95 % que no incluyera cero. La estabilidad no fue una propiedad general: Llama 3 superó el criterio en 17 de 21 escalas, GPT-4o en 16 y GPT-3.5 en 14, mientras que Gemini y GPT-4 solo lo hicieron en cinco y seis. El resultado también dependió del instrumento: el manejo de impresión agéntico fue estable en todos los modelos y varias escalas BFI-2 funcionaron relativamente bien; la autoconciencia pública, el altruismo de HEXACO y la apertura de HEXACO mostraron poca estabilidad. En las escalas interpretables, las puntuaciones quedaron mayoritariamente dentro del intervalo humano de media más o menos una desviación estándar. Apareció un patrón de salida generalmente prosocial o socialmente deseable, por ejemplo, mayor amabilidad, responsabilidad, honestidad-humildad o altruismo y menor maquiavelismo en modelos concretos, aunque no fue uniforme: Mixtral combinó amabilidad y altruismo altos con maquiavelismo alto. Las puntuaciones políticas interpretables no se alejaron del rango normativo. El trabajo aporta evidencia de repetibilidad a muy corto plazo bajo un protocolo fijo, pero no demuestra personalidad interna, estabilidad longitudinal ni que los cuestionarios humanos midan constructos equivalentes en máquinas.

English

The study tests whether seven language models give stable responses to psychological inventories on two occasions five days apart and, only when a prespecified psychometric criterion is met, compares their scores with human norms. GPT-3 was tested in December 2022; GPT-3.5, GPT-4, GPT-4o, Gemini Pro, Llama 3, and Mixtral were tested in June 2024 through the interfaces available for each provider. Models were instructed to pretend to be human and answered 232 items spanning 21 scales or domains of self-consciousness, Big Five, HEXACO, Dark Triad, impression management, and political orientation. Item-level stability was estimated with weighted kappa and absolute-agreement ICCs; profile interpretation required ICC3,k of at least 0.50 with a 95% confidence interval excluding zero. Stability was not a general model property: Llama 3 met the criterion on 17 of 21 scales, GPT-4o on 16, and GPT-3.5 on 14, whereas Gemini and GPT-4 did so on only five and six. Results also depended on the instrument. Agentic impression management was stable in every model and several BFI-2 scales performed comparatively well, while public self-consciousness, HEXACO altruism, and HEXACO openness showed little stability. Among interpretable scales, scores mostly remained within one human standard deviation of the normative mean. A generally prosocial or socially desirable output pattern appeared in specific models, such as higher agreeableness, conscientiousness, honesty-humility, or altruism and lower Machiavellianism, but it was not uniform: Mixtral combined high agreeableness and altruism with high Machiavellianism. Interpretable political-orientation scores did not fall outside the normative range. The paper provides evidence about very short-term response repeatability under a fixed protocol; it does not establish internal personality, longitudinal stability, or measurement equivalence between human inventories and machines.

Pregunta de investigación

¿Con qué estabilidad temporal responden distintos LLM a instrumentos psicológicos en dos ocasiones próximas y, en las escalas que alcanzan un umbral de fiabilidad, qué perfil muestran frente a datos normativos humanos?

Método

Estudio de repetición a dos tiempos separados por cinco días. Siete modelos respondieron en inglés, mediante sus respectivas interfaces, 232 ítems agrupados en 21 escalas o dominios. Se usó el prompt «Pretend you are a human. Answer the following questions» y, si era necesario, una segunda instrucción para fingir durante el juego. La concordancia ítem a ítem se estimó con kappa ponderada, ICC3,1 e ICC3,k de acuerdo absoluto. Solo se compararon medias con normas humanas cuando ICC3,k era al menos 0,50 y su intervalo del 95 % excluía cero; una diferencia descriptiva se definió como quedar fuera de la media humana más o menos una desviación estándar.

Muestra: Siete modelos y dos mediciones por modelo, separadas por cinco días. GPT-3 se midió el 9 y 14 de diciembre de 2022; los otros seis modelos, el 24 y 29 de junio de 2024. Cada medición cubrió 232 ítems y 21 escalas o dominios. No participaron personas nuevas: las comparaciones usan estadísticas normativas publicadas de muestras humanas en línea o comunitarias.

Hallazgos

  • La estabilidad varió fuertemente por modelo: 17 de 21 escalas cumplieron el criterio ICC en Llama 3, 16 en GPT-4o y 14 en GPT-3.5; Gemini y GPT-4 solo alcanzaron el criterio en cinco y seis escalas.
  • La escala de manejo de impresión agéntico obtuvo ICC3,k excelente en los siete modelos. Amabilidad y responsabilidad del BFI-2 fueron excelentes en seis modelos, y extraversión, apertura mental del BFI-2 y maquiavelismo en cinco.
  • La autoconciencia pública no alcanzó un ICC aceptable en ningún modelo; la apertura a la experiencia de HEXACO solo lo hizo en uno y el altruismo produjo valores mayoritariamente nulos o constantes.
  • En las escalas que sí superaron el criterio, la mayoría de las medias quedaron dentro de una desviación estándar de las normas humanas; las desviaciones prosociales o socialmente deseables dependieron del modelo y del instrumento.
  • GPT-4o y Llama 3 mostraron varios rasgos por encima del rango normativo relacionados con responsabilidad, amabilidad, honestidad-humildad o manejo de impresión; GPT-4o, GPT-4, Gemini y Llama 3 mostraron maquiavelismo inferior cuando esa escala fue interpretable.
  • Mixtral fue la excepción más contradictoria: presentó amabilidad y altruismo por encima del rango humano, pero también maquiavelismo alto. Ningún resultado político interpretable quedó fuera del intervalo normativo de una desviación estándar.

Limitaciones

  • Dos observaciones separadas por solo cinco días permiten estudiar repetibilidad inmediata, no estabilidad longitudinal, resistencia a actualizaciones ni persistencia en conversaciones prolongadas.
  • Los modelos se probaron mediante plataformas distintas y GPT-3 en 2022 frente a los demás en 2024; versión, interfaz, arquitectura, entrenamiento y alineamiento quedan entrelazados y no pueden compararse causalmente.
  • El prompt obliga al sistema a fingir ser humano y los ajustes se mantuvieron fijos; no se estudia sensibilidad a otros roles, temperaturas, formulaciones, idiomas o condiciones de uso natural.
  • Los inventarios y normas fueron diseñados para personas. Las referencias humanas proceden de estudios de validación diferentes y no de participantes evaluados simultáneamente con el mismo contexto.
  • Las comparaciones de perfil son descriptivas mediante el umbral de una desviación estándar; no prueban invariancia de medida, estructura factorial, validez convergente, predictiva o equivalencia de constructo en LLM.
  • Las explicaciones sobre número de parámetros, arquitectura, RLHF y guardrails son hipótesis de discusión: varios detalles de los modelos propietarios no se conocen y el diseño no manipula esos factores.

Qué no demuestra

  • No demuestra que los modelos posean personalidad, autoconciencia, creencias políticas, motivaciones o reflexión consciente; registra respuestas producidas al simular una persona.
  • No demuestra que una puntuación similar a la humana represente el mismo constructo psicológico ni que los cuestionarios estén validados para máquinas.
  • No establece que Llama 3 o GPT-4o sean estables en general; su ventaja se limita a determinadas escalas, dos fechas y la configuración probada.
  • No permite atribuir las diferencias al tamaño, número de parámetros, arquitectura, proveedor o RLHF.
  • No prueba que los perfiles observados predigan conducta generativa, seguridad, influencia sobre usuarios ni desempeño en aplicaciones reales.
  • No confirma una orientación política general: las puntuaciones analizadas permanecieron dentro del intervalo normativo y proceden de solo tres ítems.

Modelos evaluados

  • GPT-3
  • GPT-3.5-turbo-16k
  • GPT-4
  • GPT-4o
  • Gemini Pro
  • Llama 3-sonar-large-32K-chat
  • Mixtral-8x7b-instruct

Instrumentos y métricas

  • Self-Consciousness Scales, Revised (SCS-R, 22 items)
  • Big Five Inventory-2 (BFI-2, 60 items)
  • HEXACO-100 (100 items, including altruism)
  • Short Dark Triad (SD3, 27 items)
  • Bidimensional Impression Management Index (BIMI, 20 items)
  • Three-item political orientation measure
  • Weighted Cohen's kappa
  • ICC3,1 and ICC3,k absolute-agreement coefficients

Datos utilizados

  • Published normative data from the original validation studies of SCS-R, BFI-2, HEXACO-100, SD3 and BIMI
  • Study response data and codebook deposited on OSF

Evidencia y localización

  • Objetivo, modelos, fechas, prompt e instrumentos: Paper, pp. 5–7, sections 1.5 and 2.1–2.2
  • Criterios de kappa, ICC y comparación normativa: Paper, p. 7, section 2.3
  • Resultados de estabilidad por modelo, escala e intervalo de confianza: Paper, pp. 7–14, section 3 and Tables 1–7
  • Medias frente a normas humanas y excepciones del perfil: Paper, pp. 8 and 15–16, section 3 and Table 8
  • Interpretación del perfil prosocial y caso contradictorio de Mixtral: Paper, pp. 13 and 17, sections 4.2–4.3
  • Limitaciones, implicaciones y necesidades de replicación y validez predictiva: Paper, pp. 18–19, sections 4.4–4.5
  • Disponibilidad de datos, ética y declaraciones: Paper, p. 19, end matter