A psychometric framework for evaluating and shaping personality traits in large language models

Evaluación y validez psicométrica2025NatureRevisión editorial aprobada

Autores: Gregory Serapio-García, Mustafa Safdari, Clément Crepy, Luning Sun, Stephen Fitz, Peter Romero, Marwa Abdulhai, Aleksandra Faust, Maja Matarić

Palabras clave: Large Language Models, Synthetic Personality, Big Five, IPIP-NEO, Big Five Inventory, Psychometric Reliability, Construct Validity, Convergent Validity, Discriminant Validity, Criterion Validity, Personality Shaping, Prompt-conditioned Measurement, Instruction Tuning

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

9
Autores
10
Hallazgos
15
Limitaciones
11
Evidencias

Resumen editorial

Español

Este trabajo desarrolla uno de los marcos empíricos más completos disponibles para evaluar personalidad sintética en salidas de LLM. En lugar de interpretar un cuestionario aislado como prueba de personalidad, administra dos inventarios Big Five, IPIP-NEO de 300 ítems y BFI de 44, a 18 variantes de PaLM, Llama 2, Mistral, Mixtral y GPT. Para cada modelo cruza 50 biografías ficticias de PersonaChat con cinco instrucciones de ítem y cinco postámbulos, creando 1.250 perfiles de prompt emparejados. Evalúa consistencia interna con alfa de Cronbach, lambda-6 de Guttman y omega de McDonald; convergencia entre ambos inventarios; discriminación entre rasgos; relaciones con once escalas criterio; y, de forma exploratoria, estructura factorial. El resultado central es condicional: varios modelos base fallan, mientras las variantes grandes e instruction-tuned, especialmente Flan-PaLM 540B y GPT-4o, muestran patrones mucho más fiables y convergentes. El estudio también induce nueve niveles de rasgo mediante 104 adjetivos y observa que once modelos previamente seleccionados por su fiabilidad siguen bien las instrucciones de rasgo. En cuatro modelos grandes, el nivel indicado también se refleja en textos sintéticos de redes sociales puntuados por Apply Magic Sauce. Es una contribución importante porque aplica estándares psicométricos más exigentes, explicita limitaciones y publica código y datos. Pero su alcance debe expresarse con precisión. Las 1.250 filas no son personas independientes: son el cruce determinista de solo 50 biografías reutilizadas con variantes fijas del prompt, aunque los p-valores usan n=1.250 sin corrección por clúster o factores cruzados. Toda medición ordena seguir una biografía, por lo que valida una distribución condicionada por el prompt, no una personalidad autónoma o persistente del modelo. El shaping nombra directamente rasgos Big Five y tanto el cuestionario como el clasificador textual premian lenguaje semánticamente alineado; además, encuesta y posts comparten la misma manipulación. Por eso las correlaciones prueban instrucción y transferencia léxica fuertes, pero no que un estado latente de personalidad cause conducta real. La estructura factorial solo es parcial, no hay test-retest, invariancia cultural, usuarios reales ni evaluación cuantitativa de seguridad. La auditoría del artefacto reprodujo 17 de las 18 filas de convergencia y discriminación publicadas. Llama-2-Chat 70B no coincide: el pickle actual produce aproximadamente 0,82/0,43/0,39, frente a 0,80/0,39/0,42 en la tabla. El repositorio permite comprobar análisis agregados, pero carece de entorno bloqueado, CI y una ejecución integral; el bucket ocupa unos 43,74 GiB en grandes pickles sin checksums. La conclusión defendible es que algunos LLM instruction-tuned producen respuestas Big Five coherentes y dirigibles bajo configuraciones de prompt concretas. No demuestra que posean personalidades humanas estables ni que los textos sintéticos sean comportamiento real.

English

This study develops one of the most comprehensive empirical frameworks available for evaluating synthetic personality in LLM outputs. Rather than treating one questionnaire as proof of personality, it administers two Big Five inventories, the 300-item IPIP-NEO and 44-item BFI, to 18 PaLM, Llama 2, Mistral, Mixtral, and GPT variants. For each model, 50 fictional PersonaChat biographies are crossed with five item instructions and five postambles to create 1,250 paired prompt profiles. The framework assesses internal consistency with Cronbach's alpha, Guttman's lambda-6, and McDonald's omega; convergence between inventories; discrimination among traits; relations with eleven criterion scales; and exploratory factor structure. Its central result is conditional: many base models fail, while larger instruction-tuned variants, especially Flan-PaLM 540B and GPT-4o, show much stronger reliability and convergence. The study also induces nine trait levels using 104 adjectives and finds that eleven models preselected for measurement quality generally follow single-trait instructions well. In four large models, instructed levels are also reflected in synthetic social-media text scored by Apply Magic Sauce. This is an important contribution because it applies substantially stronger psychometric standards, states limitations, and releases extensive code and data. Its scope nevertheless requires precision. The 1,250 rows are not independent people: they deterministically cross only 50 reused biographies with fixed prompt variants, yet reported p-values use n=1,250 without clustered or crossed-factor correction. Every measurement tells the model to follow a biography, so the study validates a prompt-conditioned response distribution rather than an autonomous or persistent model personality. Shaping explicitly names Big Five traits, and both questionnaires and the text classifier reward semantically aligned language; survey scores and posts also share the same manipulation. The correlations therefore demonstrate strong instruction following and lexical transfer, but do not show that a latent personality state causes real behavior. Factor structure is only partial, and test-retest stability, cultural invariance, live users, and quantitative safety evaluation are absent. The artifact audit reproduced 17 of the 18 published convergence/discrimination rows. Llama-2-Chat 70B differs: the current public pickle yields about 0.82/0.43/0.39, versus 0.80/0.39/0.42 in the table. The repository supports meaningful aggregate checks, but has no locked environment, CI, or single end-to-end run; its public bucket is about 43.74 GiB of large checksum-free pickles. The defensible conclusion is that some instruction-tuned LLMs generate coherent and steerable Big Five response patterns under specific prompt configurations. It does not establish stable human personalities in models or that synthetic posts constitute real-world behavior.

Pregunta de investigación

¿Pueden medirse rasgos Big Five sintéticos en salidas de LLM con fiabilidad y validez psicométricas, qué propiedades del modelo favorecen esa medición y hasta qué punto pueden moldearse los rasgos expresados y trasladarse a otra tarea textual?

Método

El estudio evalúa 18 variantes de cinco familias. Cada ítem del IPIP-NEO y BFI se presenta de forma independiente bajo un prompt que combina una instrucción fija para seguir una biografía, una de 50 biografías de PersonaChat, una de cinco instrucciones de ítem y uno de cinco postámbulos. Las 1.250 combinaciones por modelo generan puntuaciones emparejadas para fiabilidad interna, convergencia, discriminación y relaciones con once escalas criterio. Un análisis factorial exploratorio comprueba estructura. Después, once modelos que alcanzan al menos fiabilidad neutral reciben prompts con 104 adjetivos Big Five en nueve niveles: 2.250 perfiles para shaping individual y 1.600 para configuraciones extremas concurrentes. Los cuatro modelos mayores generan posts sintéticos desde los mismos perfiles y Apply Magic Sauce estima rasgos en esos textos. La auditoría leyó y revisó visualmente las 30 páginas principales y 34 suplementarias, examinó el commit oficial c3fea44, reconstruyó el entorno mínimo de tests, inventarió los 43,74 GiB publicados y recalculó convergencia y discriminación desde los 18 ficheros agregados.

Muestra: Por modelo, 1.250 perfiles resultan del cruce 50 biografías x 5 instrucciones de ítem x 5 postámbulos; en 18 modelos son 22.500 pares IPIP-NEO/BFI. Son condiciones deterministas reutilizadas, no participantes independientes. El shaping individual usa 45 perfiles de nivel/rasgo x 50 biografías = 2.250 por modelo; el shaping concurrente usa 32 configuraciones extremas x 50 = 1.600. El artículo informa 523.750 puntuaciones prompt-continuation en validez, 675.000 en shaping individual, 480.000 en concurrente y 56.250 registros downstream; esos conteos tampoco equivalen a personas.

Hallazgos

  • Las variantes base fallan con frecuencia los umbrales de fiabilidad y validez; instruction tuning es el predictor más claro y el tamaño ayuda dentro de familias afinadas.
  • Flan-PaLM 540B y GPT-4o presentan algunos de los patrones más fuertes de consistencia y convergencia entre IPIP-NEO y BFI.
  • Siete configuraciones publicadas alcanzan una diferencia media convergente-discriminante de al menos 0,40, aunque esa validez es específica de modelo y prompt.
  • Solo 13 datasets pasan los requisitos Bartlett/KMO del análisis factorial exploratorio; los ítems con carga esperada superan 72 % en Flan-PaLM 540B y GPT-4o, pero quedan por debajo de 45 % en Llama-2-Chat 7B y Mixtral 8x7B Instruct.
  • En los once modelos seleccionados, todos salvo uno logran correlaciones Spearman medias superiores a 0,80 entre nivel indicado y rasgo medido en shaping individual; el control concurrente es más difícil.
  • En la tarea de posts, la convergencia media encuesta-texto es r=0,67 y la asociación nivel indicado-texto promedia rho=0,68-0,82; Flan-PaLM openness baja a 0,47.
  • Los 18 pickles agregados contienen 1.250 filas y 27 columnas consistentes; 17 reproducen la tabla publicada de convergencia/discriminación al redondear.
  • Llama-2-Chat 70B no reproduce la tabla: los datos públicos actuales recalculan 0,822 de convergencia, 0,434 de discriminación absoluta y 0,388 de delta, no 0,80/0,39/0,42.
  • Los dos tests Python incluidos pasan tras combinar manualmente dependencias, pero el entorno declarado de PsyBORGS omite tqdm y no es instalable de forma autosuficiente.
  • El artefacto ofrece datos y análisis valiosos, pero no una reproducción integral fijada: no hay lockfile, CI, release de publicación ni checksums de datos.

Limitaciones

  • Las 1.250 observaciones por modelo reutilizan 50 biografías en un diseño factorial determinista; p-valores con n=1.250 sin modelar clústeres o factores cruzados sobrestiman la independencia y precisión.
  • Toda medición contiene la orden de seguir una biografía; no hay condición neutral que demuestre personalidad estable sin esa inducción.
  • Alfa, lambda-6 y omega evalúan consistencia interna, no test-retest, estabilidad entre sesiones, paráfrasis, actualizaciones del proveedor o contextos.
  • Las escalas criterio también son respuestas de LLM bajo el mismo método; comparten semántica y formato, y los efectos humanos provienen de muestras bibliográficas distintas.
  • El shaping usa adjetivos Big Five y se evalúa con instrumentos y un clasificador léxico conceptualmente alineados, lo que permite circularidad o propagación del vocabulario.
  • Encuesta y posts reciben la misma manipulación explícita; su correlación no identifica un efecto causal de una personalidad latente medida sobre el texto posterior.
  • Los posts son generaciones sintéticas de un turno puntuadas por una API, no conducta real, longitudinal, multi-turno ni validada por jueces humanos independientes.
  • La estructura factorial no coincide plenamente con Big Five y el propio suplemento advierte que las biografías deterministas no ofrecen la varianza individual aleatoria convencional.
  • El shaping se evalúa solo en once modelos preseleccionados por fiabilidad, por lo que no generaliza a los 18.
  • El estudio es solo en inglés, con 50 biografías ficticias principalmente norteamericanas o europeas; no hay invariancia cultural, lingüística o demográfica.
  • Los ejemplos extremos incluyen odio, sexismo, violencia, depresión y autolesión, pero no hay métricas cuantitativas de toxicidad, refusals, seguridad o daño por subgrupo.
  • PaLM, snapshots históricos de GPT y Apply Magic Sauce son dependencias propietarias que limitan la reproducción exacta actual.
  • El bucket ocupa aproximadamente 43,74 GiB y usa pickles ejecutables de hasta 4,27 GiB sin checksums, un formato inseguro y poco portable para usuarios no confiados.
  • La mayoría de notebooks no conserva ejecuciones ni outputs, contiene rutas de plantilla e instalaciones ad hoc; el análisis R instala paquetes dinámicamente.
  • Solo hay dos tests estrechos; no se prueban inferencia, estadística, tablas ni concordancia paper-datos, y el README conserva el título antiguo del preprint.

Qué no demuestra

  • No demuestra una personalidad autónoma, persistente o equivalente a la humana dentro del modelo.
  • No convierte 1.250 combinaciones de prompt en 1.250 personas independientes ni justifica inferencia poblacional sin estructura de dependencia.
  • No demuestra estabilidad test-retest entre sesiones, prompts, snapshots o despliegues.
  • No prueba que la estructura latente Big Five humana se recupere uniformemente en los 18 modelos.
  • No distingue completamente un cambio de personalidad latente de obediencia a instrucciones y repetición de vocabulario de rasgos.
  • No establece que la personalidad medida cause el texto downstream; ambos resultados comparten el mismo prompt de shaping.
  • No valida posts sintéticos como conducta real ni como efecto sobre usuarios.
  • No establece generalización cultural, lingüística, demográfica o multi-turno.
  • No demuestra que inducir extremos de rasgo sea seguro, justo o beneficioso.
  • No ofrece una reproducción exacta e integral desde un entorno versionado; un resultado tabular tampoco coincide con el artefacto público actual.

Trazabilidad

Alcance: Texto completo

Versión: Nature Machine Intelligence 7, 2063-2073 (2025), DOI 10.1038/s42256-025-01115-6; 30-page article plus 34-page supplement

Fuente consultada: https://www.nature.com/articles/s42256-025-01115-6

Revisión: Codex complete bilingual fidelity pass using the published article and supplement, all-64-page visual inspection, official repository and commit audit, isolated dependency and unit-test reconstruction, complete public-bucket inventory, independent recalculation of all 18 aggregate score files, psychometric design and construct-boundary review, causal-interpretation and safety analysis; summaries written from full evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • PaLM 62B
  • Flan-PaLM 8B
  • Flan-PaLM 62B
  • Flan-PaLM 540B
  • Flan-PaLMChilla 62B
  • Llama 2 7B
  • Llama 2 13B
  • Llama 2 70B
  • Llama 2 Chat 7B
  • Llama 2 Chat 13B
  • Llama 2 Chat 70B
  • Mistral 7B
  • Mistral 7B Instruct
  • Mixtral 8x7B
  • Mixtral 8x7B Instruct
  • GPT-3.5 Turbo
  • GPT-4o mini
  • GPT-4o

Instrumentos y métricas

  • 300-item IPIP-NEO
  • 44-item Big Five Inventory
  • Cronbach alpha
  • Guttman lambda-6
  • McDonald omega
  • Multitrait-multimethod convergent and discriminant analysis
  • Exploratory factor analysis
  • Positive and Negative Affect Schedule
  • Buss-Perry Aggression Questionnaire
  • Portrait Values Questionnaire
  • Creative Self-Efficacy and Creative Personal Identity scales
  • Apply Magic Sauce personality estimates

Datos utilizados

  • PersonaChat biographies
  • 22,500 paired model-level construct-validity profiles
  • Public personality_in_llms Google Cloud Storage bucket
  • 18 public scores_joined_pr01 aggregate files
  • Synthetic social-media status updates
  • Official google-deepmind/personality_in_llms repository at commit c3fea44

Evidencia y localización

  • Pregunta, alcance, resultados principales y límites declarados: Main PDF pages 1-11, Abstract, Main, Results, Discussion and Methods
  • Modelos, snapshots, cuantizaciones y conteos experimentales: Main PDF pages 12-18, Methods and Table 1
  • Fiabilidad, convergencia, discriminación y criterio: Main PDF pages 4-7 and 14-18; Supplement pages 10-13; Extended Data Tables 1-4
  • Shaping individual, concurrente y downstream: Main PDF pages 7-10 and 18-22; Supplement pages 19-31; Extended Data Tables 5-7
  • Estructura factorial exploratoria y advertencia sobre varianza determinista: Supplement pages 11-18, Supplementary Note A.5 and Supplementary Tables 5-6
  • Ejemplos de contenido extremo y consideraciones éticas: Main PDF pages 10-11 and 22; Supplement pages 28-31
  • Repositorio, dependencias, tests e inferencia: Official repository commit c3fea44, complete 44-file audit, requirements files, nine notebooks, three inference scripts and two tests
  • Inventario del bucket y reproducción de 18 ficheros: Official public Google Cloud Storage bucket audited 15 July 2026; all 18 scores_joined_pr01 files recalculated
  • Discrepancia de Llama-2-Chat 70B: Public scores_joined_pr01_Llama-2-70b-chat-hf.pkl versus published Extended Data Table 3
  • Auditoría integral de validez y artefacto: reports/verification/article-197-psychometric-validity-and-artifact-audit.json
  • Inspección visual completa: All 30 main-PDF and 34 supplement pages rendered and visually inspected on 15 July 2026