The Power of Personality: A Human Simulation Perspective to Investigate Large Language Model Agents

Personas, identidad y agentes2025arXivRevisión editorial aprobada

Autores: Yifan Duan, Yihong Tang, Xuefeng Bai, Kehai Chen, Juntao Li, Min Zhang

Palabras clave: Computation and Language

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
16
Hallazgos
39
Limitaciones
20
Evidencias

Resumen editorial

Español

El estudio crea, para cada uno de tres modelos abiertos, 32 agentes que cubren las 2^5 combinaciones binarias de los rasgos Big Five. Cada agente recibe un prompt formado por frases de una escala asociadas al polo alto o bajo de neuroticismo, amabilidad, responsabilidad, extraversión y apertura, y después responde el BFI-2 de 60 ítems. Qwen2.5-32B-Instruct, Qwen2.5-14B-Instruct y Llama 3.1-8B-Instruct se ejecutan con vLLM y temperatura 0. Los contrastes emparejados entre polos del rasgo muestran p<0,001 en las 15 combinaciones modelo-rasgo y tamaños d de Cohen de 1,49 a 23,17. Esto confirma que el prompt cambia las respuestas del cuestionario, pero la validación es semánticamente circular: se instruye al modelo con descripciones que expresan directamente los mismos constructos que luego se preguntan. No hay condición con instrucciones conductuales equivalentes pero sin etiqueta de personalidad, ni test-retest, ni evaluación humana de personalidad. Para tareas cerradas, los mismos 32 prompts se aplican a MMLU, MMLU-Pro, SciQ, ARC-Challenge y ARC-Easy. El promedio máximo y mínimo difieren 4,85 puntos en Qwen-32B (86,23 frente a 81,38), 2,77 en Qwen-14B (80,96 frente a 78,19) y 3,75 en Llama-8B (71,45 frente a 67,70). Los autores correlacionan los scores BFI-2 de los 32 agentes con su exactitud y encuentran patrones dependientes del modelo: en Qwen-32B apertura correlaciona 0,50–0,65 con los cinco benchmarks; en Qwen-14B no lo hace de forma estable, y en Llama sólo aparece 0,52 en MMLU-Pro. Neuroticismo es generalmente negativo, pero en Llama correlaciona +0,50 con MMLU-Pro. Las frases usadas para inducir rasgos incluyen «comprendo rápido», «me gusta resolver problemas complejos», «no me interesan los problemas de otros» o «desperdicio mi tiempo»; por ello el tratamiento altera de manera directa capacidad declarada, esfuerzo y cooperación. El diseño no permite atribuir los cambios a personalidad en lugar de a seguimiento de esas órdenes. Para creatividad, cada perfil responde AUT, INSTANCES, SCIENTIFIC y SIMILARITIES. GPT-4o-mini, sin snapshot declarado y con temperatura 0, asigna originalidad y elaboración de 1 a 10 y cuenta fluidez y flexibilidad. Se publican medias y desviaciones, pero no el número de ítems por tarea, resultados crudos, validación humana, fiabilidad del juez ni análisis de sensibilidad. Se calculan al menos 120 correlaciones rasgo-creatividad además de 75 rasgo-exactitud, sin corrección por multiplicidad. Apertura y amabilidad correlacionan frecuentemente con las puntuaciones del mismo juez, neuroticismo de forma negativa y extraversión de forma inconsistente; no se prueba creatividad humana ni transferencia fuera de esos prompts. La parte multiagente selecciona sólo nueve equipos manuales de tres miembros: seis homogéneos, dos diversos y uno con un único perfil +---- calificado de extremo. Tras respuesta inicial, discusión y revisión, se promedia la exactitud o creatividad de las tres respuestas finales. No hay permutaciones de posición, réplicas, equipos de control con las mismas capacidades y sin persona, ni inferencia estadística. En Qwen-32B, por ejemplo, Team 7 obtiene 47,25 en GPQA frente a 44,93 de Team 4, pero en MMLU y MMLU-Pro ambos difieren sólo −0,05 y −0,12. La tabla de creatividad multiagente repite exactamente las columnas SIMILARITIES de Teams 1–9 en los tres modelos, lo que exige datos o código para descartar un error de copia. Tampoco evalúa una decisión colectiva separada: el protocolo puntúa a cada miembro y promedia. Por tanto, no establece inteligencia colectiva distinta de la capacidad individual. El PDF arXiv v2 presenta además fallos visibles: tablas del apéndice pierden encabezados, signos, columnas o casi todo el cuerpo en las páginas 18, 22, 24, 28 y 30. No se enlazan código, outputs, prompts completos por perfil ni datos de evaluación. La conclusión defendible es más estrecha: instrucciones semánticamente ligadas a Big Five cambian respuestas BFI-2 y, en algunos modelos, también exactitud y scores automáticos de creatividad; nueve composiciones de debate producen diferencias descriptivas pequeñas o variables. No se demuestra que el modelo simule psicológicamente a humanos ni que la personalidad sea el mecanismo causal.

English

For each of three open models, the study creates 32 agents covering all 2^5 high/low combinations of the Big Five traits. Each agent receives a prompt built from scale phrases associated with high or low neuroticism, agreeableness, conscientiousness, extraversion, and openness, then answers the 60-item BFI-2. Qwen2.5-32B-Instruct, Qwen2.5-14B-Instruct, and Llama 3.1-8B-Instruct run through vLLM at temperature zero. Paired high/low tests report p<.001 for all 15 model-trait combinations and Cohen’s d from 1.49 to 23.17. This confirms that the prompt changes questionnaire answers, but the validation is semantically circular: models are instructed with descriptions that directly express the same constructs later queried. There is no behavior-matched non-personality control, test-retest analysis, or human personality rating. On closed tasks, the same 32 prompts are applied to MMLU, MMLU-Pro, SciQ, ARC-Challenge, and ARC-Easy. The gap between the highest and lowest mean profile is 4.85 points for Qwen-32B (86.23 vs 81.38), 2.77 for Qwen-14B (80.96 vs 78.19), and 3.75 for Llama-8B (71.45 vs 67.70). The authors correlate the 32 BFI-2 scores with accuracy and find model-dependent patterns: Qwen-32B openness correlates .50–.65 with all five benchmarks; Qwen-14B does not show a stable pattern, and Llama only reaches .52 on MMLU-Pro. Neuroticism is usually negative, but correlates +.50 with Llama MMLU-Pro. The induction phrases include “am quick to understand,” “like to solve complex problems,” “am not interested in other people’s problems,” and “waste my time,” directly altering claimed ability, effort, and cooperation. The design therefore cannot attribute performance changes to personality rather than obedience to those instructions. For creativity, each profile answers AUT, INSTANCES, SCIENTIFIC, and SIMILARITIES. GPT-4o-mini, without an exact snapshot and at temperature zero, assigns 1–10 originality/elaboration scores and counts fluency/flexibility. Means and standard deviations are published, but not item counts per task, raw outputs, human validation, judge reliability, or sensitivity analysis. At least 120 trait-creativity correlations are added to 75 trait-accuracy correlations without multiplicity correction. Openness and agreeableness often correlate positively with the same judge’s scores, neuroticism negatively, and extraversion inconsistently; this does not establish human creativity or transfer beyond those prompts. The multi-agent section manually selects only nine three-member teams: six homogeneous, two diverse, and one containing a single +---- profile labeled extreme. After initial answers, discussion, and revision, accuracy or creativity is averaged across the three final member responses. There are no position permutations, repeated teams, same-capability non-persona controls, or inferential tests. For Qwen-32B, for example, Team 7 scores 47.25 on GPQA versus 44.93 for Team 4, but their MMLU and MMLU-Pro differences are only −.05 and −.12. The multi-agent creativity table repeats exactly the Teams 1–9 SIMILARITIES columns across all three models, which requires data or code to rule out a copy error. No separate collective decision is evaluated: members are scored and averaged. The results therefore do not establish collective intelligence distinct from individual ability. The arXiv v2 PDF also has visible publication failures: appendix tables lose headers, profile signs, columns, or nearly their entire body on pages 18, 22, 24, 28, and 30. No code, outputs, full per-profile prompts, or evaluation data are linked. The defensible conclusion is narrower: Big Five-linked instructions change BFI-2 answers and, for some models, accuracy and automated creativity scores; nine debate compositions yield small or variable descriptive differences. The study does not show psychological human simulation or identify personality as the causal mechanism.

Pregunta de investigación

¿Cómo cambian las respuestas BFI-2, la exactitud en benchmarks, las puntuaciones automáticas de creatividad y los resultados de debate cuando tres LLM reciben combinaciones binarias de instrucciones asociadas a los cinco rasgos Big Five?

Método

Diseño factorial completo 2^5 de 32 prompts por modelo. Las frases de los polos alto/bajo se toman de ítems vinculados a Big Five y se insertan en el contexto; el BFI-2 evalúa si las respuestas siguen el perfil. Los 32 agentes se ejecutan en cinco benchmarks cerrados y cuatro tareas abiertas, con correlaciones Pearson entre scores BFI-2 y resultados. GPT-4o-mini juzga creatividad. Nueve equipos seleccionados de tres agentes realizan respuesta inicial, discusión y revisión; se promedian las respuestas finales de los miembros. Los modelos generadores usan vLLM y temperatura 0.

Muestra: Treinta y dos configuraciones binarias por cada uno de tres modelos, con una administración BFI-2 y una ejecución de cada benchmark por configuración. Los análisis de correlación usan n=32 perfiles por modelo. La colaboración usa nueve equipos preseleccionados de tres miembros por modelo. No se informan réplicas de generación, seeds ni el número de ítems/estímulos aplicado en cada tarea creativa.

Hallazgos

  • Los 15 contrastes modelo-rasgo del BFI-2 dan p<0,001 y d de Cohen entre 1,49 y 23,17, evidenciando fuerte obediencia semántica al prompt.
  • Para neuroticismo, d es 23,17 en Qwen-32B, 18,47 en Qwen-14B y 3,37 en Llama-8B; magnitudes extraordinarias que reflejan la proximidad entre inducción y cuestionario.
  • Qwen-32B pasa de una media cerrada mínima de 81,38 para +---- a 86,23 para -++++, una amplitud de 4,85 puntos.
  • Qwen-14B cubre 78,19–80,96 y Llama-8B 67,70–71,45; el perfil óptimo de Llama es ++--+, no -++++.
  • En Qwen-32B, apertura correlaciona 0,62 con MMLU, 0,60 con MMLU-Pro, 0,50 con ARC-Challenge, 0,65 con ARC-Easy y 0,51 con SciQ.
  • En Qwen-14B, apertura va de −0,23 a 0,32 y ninguna de esas cinco correlaciones llega a p<0,05.
  • En Llama-8B, neuroticismo correlaciona +0,50 con MMLU-Pro pero −0,70 con ARC-Easy, mostrando dependencia de tarea.
  • La responsabilidad de Llama-8B permanece cerca de cero en los cinco benchmarks, pese a las analogías humanas propuestas.
  • Apertura y amabilidad correlacionan con frecuencia de forma positiva con originalidad y elaboración puntuadas por GPT-4o-mini; extraversión es pequeña e inconsistente.
  • Las correlaciones creativas se calculan sobre scores de un único tipo de juez automático y no se validan contra humanos.
  • Entre equipos Qwen-32B, Team 7 obtiene el máximo GPQA de 47,25, pero no mejora MMLU o MMLU-Pro frente a Team 4.
  • Los nueve equipos Qwen-14B sólo cubren 77,89–78,25 en MMLU y 60,24–61,73 en MMLU-Pro.
  • Team 9 no queda siempre por debajo de Team 4: en Qwen-14B supera ligeramente MMLU y MMLU-Pro, y en Llama supera GPQA.
  • En la tabla multiagente de creatividad, los dieciocho valores SIMILARITIES de Teams 1–9 son idénticos para Qwen-32B, Qwen-14B y Llama-8B.
  • La inspección visual confirma que cinco páginas del apéndice no muestran completos los resultados que la capa textual pretende contener.
  • No se encontró repositorio oficial, código, outputs ni datos crudos enlazados desde arXiv, PDF, OpenReview o búsquedas dirigidas por título y prompts.

Limitaciones

  • Los prompts no manipulan sólo personalidad: incluyen declaraciones explícitas de comprensión, interés por problemas, esfuerzo, orden, distancia social y capacidad para resolver tareas complejas.
  • La inducción de apertura alta dice al modelo que comprende rápido y disfruta problemas complejos, confundiéndola directamente con capacidad y motivación.
  • La amabilidad baja ordena desinterés por problemas ajenos, lo que puede reducir la cooperación con el usuario por definición.
  • La validación BFI-2 es semánticamente circular porque el prompt contiene descripciones del mismo constructo que luego se mide mediante autoinforme.
  • No existe una condición placebo con igual longitud, tono y dificultad pero sin contenido Big Five.
  • No hay comparación con perfiles narrativos independientes, evaluación ciega humana ni conducta externa no sugerida por las frases de inducción.
  • Los rasgos se discretizan en sólo dos polos, aunque el propio paper reconoce su continuidad y complejidad multidimensional.
  • La notación positivo/negativo puede confundirse con deseable/indeseable; para neuroticismo el signo positivo representa más neuroticismo.
  • No se informa si las 32 condiciones se ejecutan en orden aleatorio ni si comparten cachés o contexto.
  • Temperatura 0 no garantiza por sí sola determinismo bit a bit; no se publican seeds, versiones exactas de vLLM, kernels, cuantización o réplicas.
  • Se hace una sola administración por perfil y modelo, sin test-retest ni incertidumbre de generación.
  • Las pruebas t del BFI-2 tratan 16 pares de configuraciones como unidades, pero no discuten independencia, normalidad o corrección múltiple.
  • Los tamaños d extremos se interpretan como capacidad de simulación, aunque la variable independiente incluye directamente los contenidos que predice el cuestionario.
  • Las correlaciones de rendimiento usan n=32 perfiles y muchas variables derivadas de la misma manipulación factorial.
  • No se estima un modelo factorial o regresión que separe efectos principales, interacciones entre rasgos y colinealidad entre scores BFI-2 realizados.
  • Hay al menos 75 pruebas rasgo-benchmark y 120 rasgo-creatividad, sin corrección FDR/Bonferroni ni preregistro.
  • Se comparan patrones seleccionados con literatura humana heterogénea sin meta-análisis, matching de tareas o test formal de equivalencia.
  • Los benchmarks pueden estar presentes en datos de entrenamiento y no se evalúa contaminación.
  • No se detallan versiones, splits, subconjuntos, prompts por benchmark, parsing, límites de contexto ni manejo de respuestas inválidas.
  • No se publica exactitud de una condición sin personalidad comparable para los 32 perfiles de tarea cerrada.
  • El formato obliga a emitir todo el razonamiento, lo que puede alterar rendimiento y no es comparable con protocolos estándar de todos los modelos.
  • No se informa el snapshot de GPT-4o-mini, fecha API, repetición, seed o estabilidad del juez.
  • Un único juez automático puntúa originalidad y elaboración sin humanos, segundo juez, acuerdo, calibración ni análisis de sesgo por estilo o longitud.
  • Las métricas de creatividad favorecen volumen y elaboración textual; los prompts de apertura/amabilidad pueden cambiar precisamente esos rasgos superficiales.
  • No se informa el número de estímulos creativos ni se publican respuestas individuales, por lo que las desviaciones no tienen una unidad de análisis verificable.
  • Los nueve equipos multiagente son selecciones manuales y no una muestra sistemática del enorme espacio de composiciones posibles.
  • Sólo hay un equipo por hipótesis, sin réplicas, permutación de posiciones o selección aleatoria de miembros.
  • Team 9 usa un único perfil +---- como sinónimo de personalidad extrema; no se prueban otros perfiles extremos ni posiciones.
  • Teams 7 y 8 no bastan para identificar un efecto general de diversidad.
  • No hay control de debate con los mismos tres modelos y prompts neutros, ni control de mera generación múltiple sin discusión.
  • La puntuación del equipo es un promedio de resultados individuales posteriores a discusión, no una decisión colectiva independiente.
  • No se reportan intervalos o tests para las diferencias de equipos; términos como significativo se usan sin estadística en esa sección.
  • Las diferencias cerradas entre equipos son a menudo inferiores a un punto y pueden depender de pocos ítems en GPQA.
  • Los valores SIMILARITIES exactamente repetidos entre tres modelos en Table 4 son una anomalía no explicada.
  • No hay código ni datos crudos para comprobar tablas, correlaciones, errores de copia o parsing.
  • El PDF v2 presenta errores graves de composición: páginas 18, 22, 24, 28 y 30 cortan o hacen desaparecer partes de tablas.
  • Figure 3 se titula por error como correlación con Closed Tasks aunque muestra métricas de creatividad.
  • El encabezado Limitations y sus primeras líneas aparecen duplicados en la capa textual del PDF.
  • La ética sólo afirma usar datasets públicos no sensibles; no considera riesgos de antropomorfización, uso de rasgos para selección, estigmatización o inferencias psicológicas inválidas.

Qué no demuestra

  • No demuestra que los modelos tengan personalidad humana, estados psicológicos o inteligencia humana simulada.
  • No separa causalmente personalidad de instrucciones directas sobre capacidad, motivación, esfuerzo y cooperación.
  • No valida el BFI-2 como instrumento psicométrico para LLM.
  • No demuestra estabilidad temporal o entre ejecuciones de los perfiles.
  • No muestra que los rasgos se expresen sin que sus descripciones estén presentes en el contexto.
  • No establece equivalencia entre correlaciones de modelos y relaciones psicológicas humanas.
  • No demuestra creatividad humana; reporta scores de un juez LLM sobre tareas textuales.
  • No prueba que la temperatura 0 haga determinista todo el pipeline.
  • No establece que los rasgos predigan rendimiento en modelos, tareas o prompts no evaluados.
  • No identifica interacciones fiables entre los cinco rasgos.
  • No demuestra un beneficio general de diversidad de personalidad en equipos.
  • No demuestra que un miembro con personalidad extrema perjudique generalmente al equipo.
  • No demuestra inteligencia colectiva distinta de capacidades individuales.
  • No evalúa usuarios humanos, percepción de personalidad, confianza, seguridad, equidad o utilidad de producto.
  • No permite reproducir los resultados completos con los artefactos publicados.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2502.20859v2, revised 27 May 2025, 31 pages

Fuente consultada: https://arxiv.org/pdf/2502.20859v2

Revisión: Codex full-text, bilingual-fidelity, visual, construct-validity, semantic-circularity, treatment-contamination, factorial-design, test-retest, multiplicity, correlation, automated-judge, creativity, multi-agent, collective-outcome, table-integrity, reproducibility, ethics and evidence-level audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Qwen2.5-32B-Instruct
  • Qwen2.5-14B-Instruct; also written Qwen-14B-Instruct in the appendix
  • Llama 3.1-8B-Instruct
  • GPT-4o-mini automated creativity judge; exact snapshot not reported
  • GPT-4 used by the authors to modify evaluation prompts; exact snapshot not reported

Instrumentos y métricas

  • Big Five high/low prompt phrases based on DeYoung et al. scale items
  • BFI-2, 60 items, five domains and 15 facets
  • Paired t-tests and Cohen d for high/low BFI-2 scores
  • Pearson correlations between BFI-2 domain scores and benchmark outcomes
  • TTCT-inspired originality, elaboration, fluency and flexibility rubric
  • GPT-4o-mini automated creativity scoring
  • Three-stage multi-agent debate: initial response, discussion, final response
  • Mean of three member-level final results as team score

Datos utilizados

  • MMLU
  • MMLU-Pro
  • SciQ
  • ARC-Challenge
  • ARC-Easy
  • GPQA for multi-agent closed-task evaluation
  • Alternative Uses Task (AUT)
  • INSTANCES
  • SCIENTIFIC
  • SIMILARITIES

Evidencia y localización

  • Identidad, autores, versión y abstract completo: arXiv:2502.20859v2 metadata and PDF p. 1
  • Treinta y dos combinaciones binarias de rasgos: PDF p. 3, section 3.1 and equation y_k
  • BFI-2 de 60 ítems: PDF pp. 3, 15, sections 3.2 and C.1
  • Modelos, vLLM, L20 y temperatura: PDF pp. 4, 13, sections 3.5 and B.3
  • Contrastes BFI-2, p y d: PDF pp. 4–5, section 4.1 and Table 1
  • Correlaciones de exactitud: PDF pp. 5–6, section 4.2 and Figure 2
  • Correlaciones y evaluación de creatividad: PDF pp. 5–7, section 4.3 and Figure 3
  • Nueve equipos y perfiles seleccionados: PDF pp. 6–7, section 5.1 and Table 2
  • Resultados cerrados multiagente: PDF p. 7, Table 3 and section 5.2
  • Resultados abiertos multiagente y columnas repetidas: PDF p. 8, Table 4 and section 5.3
  • Limitaciones y ética declaradas: PDF p. 9, Limitations and Ethics Statement
  • Frases exactas de inducción y contaminación del tratamiento: PDF p. 12, Appendix B.1
  • Cálculo de equipo como media de miembros: PDF p. 13, Appendix B.3
  • Rubricas completas del juez automático: PDF pp. 13–14, Appendix B.5 and Table 5
  • Scores BFI-2 por perfil y modelo: PDF pp. 15–16, Tables 6–7
  • Exactitud completa de los 32 perfiles: PDF pp. 17–19, Tables 8–10
  • Resultados creativos por perfil: PDF pp. 20–31, Tables 11–22
  • Inspección visual y fallos de maquetación: All 31 pages of arXiv v2 rendered and visually inspected; pages 18, 22, 24, 28 and 30 visibly lose table content; checked 15 Jul 2026
  • Estado de publicación: arXiv v2, OpenReview forum/PDF and author publication page checked; OpenReview is an anonymous submission and no final proceedings record was found; checked 15 Jul 2026
  • Ausencia de artefactos reproducibles: arXiv abstract/PDF, OpenReview record and targeted GitHub searches by exact title, arXiv ID and distinctive prompt checked; no official code or data repository found; checked 15 Jul 2026