Can LLMs Truly Embody Human Personality? Analyzing AI and Human Behavior Alignment in Dispute Resolution

Personas, identidad y agentes2026arXivRevisión editorial aprobada

Autores: Deuksin Kwon, Kaleen Shrestha, Bin Han, Spencer Lin, James Hale, Jonathan Gratch, Maja Matarić, Gale M. Lucas

Palabras clave: Large Language Models, Personality, Big Five, Persona, Personality Control

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

8
Autores
7
Hallazgos
34
Limitaciones
13
Evidencias

Resumen editorial

Español

Este trabajo pregunta si agentes LLM condicionados con rasgos Big Five reproducen las relaciones entre personalidad y conducta observadas en personas durante un conflicto. Compara una submuestra declarada de 248 diálogos humano-humano de KODIS con 1.000 negociaciones entre dos instancias del mismo modelo: 500 con GPT-4o-mini y 250 con Claude 3.7 Sonnet y Gemini 2.0 Flash. Todos negocian el mismo conflicto comprador-vendedor por una camiseta, con cinco decisiones sobre reembolso, reseñas y disculpas. Los resultados finales son puntuación, quién acepta y si se evita abandonar; las estrategias se clasifican con el marco Interests-Rights-Power en cooperación, neutralidad, competición y residual, además de reciprocidad, escalada y desescalada.

Los agentes reciben 15 adjetivos, tres por rasgo, elegidos de 70 pares bipolares y modificados para representar seis niveles. Sus distribuciones de rasgos imitan marginalmente la muestra humana, pero la medición no es equivalente: las personas contestan diez ítems BFI y los LLM reciben etiquetas discretas en un prompt. Además, el diseño introduce de antemano una asociación humana: el peso de la disculpa se hace depender de la agradabilidad usando una regresión de KODIS (B=2,13; p=.02), mientras los demás pesos se sortean. Por tanto, cualquier efecto de agradabilidad sobre resultados mezcla el supuesto mecanismo psicológico con una preferencia de utilidad programada por los autores.

En KODIS, la puntuación no presenta efectos de personalidad; para aceptar, mayor neuroticismo propio se asocia negativamente (B=-0,26; p=.026) y el de la pareja positivamente (B=0,27; p=.025); evitar abandonar tampoco presenta efectos. Los LLM muestran conjuntos distintos de coeficientes significativos según modelo y resultado. En estrategia, las personas usan sobre todo hechos y cambian de fase durante la conversación; los LLM recurren más a propuestas y concesiones, siguen trayectorias más planas y se comportan de modo específico al modelo. Claude es el más parecido descriptivamente al patrón humano, Gemini el más sesgado hacia propuesta, poder y residual, y GPT-4o-mini usa más poder y derechos. La reciprocidad cooperativa es 88,5–98,2 % en LLM frente a 73,7 % en personas; GPT-4o-mini también eleva la reciprocidad competitiva a 48,8 % frente a 13,1 %. Estos contrastes apoyan la conclusión cauta de que los prompts de personalidad no convierten a estos modelos en sustitutos conductuales fiables.

Sin embargo, “alineación” se decide principalmente comparando qué coeficientes cruzan p<.05 en regresiones separadas. Compartir ausencia de significación no demuestra equivalencia, y que un efecto sea significativo en un grupo y no en otro no demuestra que ambos efectos difieran. No se ajusta un modelo conjunto con interacción sistema×rasgo, no se aportan diferencias de coeficientes con intervalos ni pruebas de equivalencia, y no hay corrección por los cientos de contrastes. Tampoco se documenta agrupamiento por díada, pese a que cada conversación aporta dos participantes relacionados. Los tamaños 500/250/250/248 producen potencias distintas y la temperatura 1 sin semillas ni repeticiones no cuantifica variabilidad de simulación.

La anotación IRP usa GPT-4o-2024-08-06 a temperatura 1. Tres anotadores, uno autor, dejan de clasificar directamente tras obtener bajo acuerdo y pasan a juzgar las predicciones de GPT como correctas o incorrectas en 25 conversaciones humanas. El sistema alcanza 81 % de accuracy, F1 macro .79 y F1 ponderado .81; Positive Expectations queda en .69. Esa validación parcial solo cubre texto humano y puede no transferirse por igual a los estilos de GPT-4o-mini, Claude y Gemini; usar un anotador de la misma familia que uno de los generadores también admite sesgo de estilo.

La auditoría del repositorio oficial, commit 811840284ae06b689655bfa71a2da72bf00403e1, impide reproducir las tablas. No publica las 1.000 simulaciones, sus anotaciones, resultados, semillas ni el CSV humano bruto. El único CSV procesado contiene 440 observaciones, 220 díadas, no las 248 declaradas, y 58 valores ausentes para aceptación. Faltan el módulo src/llm_api/base.py, statsmodels en requirements y el paquete google-genai que exige el código; tampoco hay tests, CI, lockfile o licencia, aunque el README afirma MIT. Varias rutas y pasos descritos no existen, los argumentos y defaults discrepan, y el apéndice atribuye por error los datasets Gemini y GPT a dos Claude. El artefacto sirve para inspeccionar parte del diseño, no para ejecutar de extremo a extremo ni verificar los resultados publicados.

English

This paper asks whether Big Five-prompted LLM agents reproduce the personality-behavior relationships observed in people during conflict. It compares a reported subset of 248 human-human KODIS dialogues with 1,000 same-model LLM negotiations: 500 GPT-4o-mini and 250 each for Claude 3.7 Sonnet and Gemini 2.0 Flash. All negotiate the same buyer-seller jersey dispute across five refund, review, and apology decisions. Final outcomes are payoff, acceptance, and not walking away; strategies are classified under the Interests-Rights-Power framework as cooperative, neutral, competitive, or residual, with additional reciprocity, escalation, and de-escalation metrics.

Agents receive 15 adjectives, three per trait, selected from 70 bipolar pairs and modified to encode six levels. Their marginal trait distributions imitate the human sample, but measurement is not equivalent: people answer ten BFI items whereas LLMs receive discretized labels in a prompt. The design also inserts a human association in advance: apology importance is made dependent on agreeableness using a KODIS regression (B=2.13, p=.02), while other issue weights are random. Any agreeableness effect on outcomes therefore combines the proposed psychological mechanism with an author-programmed utility preference.

In KODIS, score has no personality effects; acceptance is negatively associated with self-neuroticism (B=-.26, p=.026) and positively with partner neuroticism (B=.27, p=.025); not walking away has none. LLMs produce different sets of significant coefficients across models and outcomes. Humans rely heavily on facts and change strategies over dialogue stages; LLMs favor proposals and concessions, follow flatter trajectories, and display model-specific styles. Claude is descriptively closest to humans, Gemini is most skewed toward proposal, power, and residual behavior, and GPT-4o-mini uses more power and rights. Cooperative reciprocity is 88.5–98.2% for LLMs versus 73.7% for humans; GPT-4o-mini also reaches 48.8% competitive reciprocity versus 13.1%. These contrasts support the cautious conclusion that personality prompts do not make these systems reliable human behavioral proxies.

“Alignment,” however, is assessed mainly by comparing which coefficients cross p<.05 in separate regressions. Shared nonsignificance is not evidence of equivalence, and significance in one group but not another does not establish an effect difference. There is no pooled system-by-trait interaction, coefficient-difference interval, equivalence test, or multiplicity correction across hundreds of comparisons. Dyadic clustering is not documented even though each conversation contributes two related observations. Unequal sample sizes of 500/250/250/248 yield unequal power, and temperature 1 without seeds or repeated runs leaves simulation variance unknown.

IRP annotation uses GPT-4o-2024-08-06 at temperature 1. Three annotators, including an author, abandon direct classification after low agreement and instead judge GPT predictions as correct or incorrect on 25 human conversations. The final system reports 81% accuracy, .79 macro F1, and .81 weighted F1, with Positive Expectations at .69. This partial validation covers human text only and may not transfer equally to GPT-4o-mini, Claude, and Gemini styles; using an annotator from the same model family as one generator also permits style bias.

The official repository at commit 811840284ae06b689655bfa71a2da72bf00403e1 cannot reproduce the tables. It omits the 1,000 simulations, annotations, results, seeds, and raw human CSV. Its only processed CSV has 440 observations, 220 dyads rather than the reported 248, and 58 missing acceptance values. The required src/llm_api/base.py module, statsmodels dependency, and google-genai package used by the code are absent; there are no tests, CI, lockfile, or license despite an MIT claim. Several documented paths and pipeline steps do not exist, arguments and defaults conflict, and the appendix mistakenly describes the Gemini and GPT datasets as generated by two Claude models. The artifact exposes part of the design but is not an end-to-end executable or a verification package for the published results.

Pregunta de investigación

¿Reproducen GPT-4o-mini, Claude 3.7 Sonnet y Gemini 2.0 Flash, cuando reciben perfiles Big Five por adjetivos, las asociaciones entre personalidad propia y de la pareja, resultados de negociación y estrategias de conflicto observadas en diálogos humano-humano comparables?

Método

Se filtran 248 diálogos KODIS con personalidad de ambas partes y se simulan 1.000 diálogos LLM-LLM del mismo escenario. Los perfiles LLM muestrean seis niveles por cada rasgo y 15 adjetivos; la agradabilidad determina el peso de la disculpa y los demás pesos son aleatorios. GPT-4o anota estrategias IRP. OLS o regresión logística relacionan diez predictores de personalidad, cinco propios y cinco de la pareja, y rol con tres resultados y múltiples métricas estratégicas. La comparación entre humanos y modelos se interpreta a partir de patrones descriptivos y significación en modelos separados.

Muestra: El paper parte de 4.061 participantes KODIS y declara seleccionar 248 diálogos humano-humano con personalidad completa para ambas partes, eliminando valores ausentes según cada análisis. Simula 500 díadas GPT-4o-mini y 250 de Claude y Gemini, hasta 25 rondas. La validación IRP cubre 25 diálogos humanos. El release oficial solo contiene un CSV procesado con 440 filas, 220 compradores y 220 vendedores; 58 filas carecen de do_accept_first, por lo que no coincide con los 248 diálogos declarados ni permite reconstruir filtros.

Hallazgos

  • En KODIS, score y not-walk-away no muestran efectos de personalidad significativos; aceptar se asocia con neuroticismo propio negativo (B=-0,26; p=.026) y neuroticismo de la pareja positivo (B=0,27; p=.025).
  • Los coeficientes significativos de personalidad en resultados LLM difieren entre GPT-4o-mini, Claude y Gemini y no replican de forma estable el patrón humano.
  • Las personas usan más hechos y una progresión temporal más marcada; los LLM usan más propuestas y concesiones y mantienen patrones más planos y específicos del modelo.
  • Claude se aproxima descriptivamente más a las estrategias humanas; Gemini presenta más propuesta, poder y residual y no usa Positive Expectations o Procedural; GPT-4o-mini mantiene más poder y derechos.
  • La reciprocidad cooperativa es más alta en los LLM, 88,5–98,2 %, que en KODIS, 73,7 %; la competitiva llega a 48,8 % en GPT-4o-mini frente a 13,1 % en humanos.
  • La anotación IRP validada sobre 25 diálogos humanos obtiene 81 % de accuracy, F1 macro .79 y ponderado .81; Positive Expectations tiene F1 .69.
  • La evidencia apoya precaución frente al uso de agentes con personalidad como proxies humanos, pero no cuantifica directamente una distancia o equivalencia de efectos entre sistemas.

Limitaciones

  • Un único role-play de comercio electrónico no representa mediación legal real, conflicto clínico, laboral, familiar o intercultural, pese al lenguaje de aplicaciones de alto impacto.
  • Las personas responden BFI-10 y los modelos reciben adjetivos discretizados; no hay invariancia de medida ni equivalencia entre el rasgo humano observado y la manipulación por prompt.
  • No existe manipulation check en estos diálogos que confirme que cada agente expresa el perfil asignado o que los cinco rasgos permanezcan distinguibles durante la negociación.
  • Los perfiles LLM reproducen distribuciones marginales, no emparejamientos uno a uno de personas, parejas, prioridades y conversaciones. “Matched” significa escenario y distribución, no réplicas individuales.
  • El diseño hace depender la importancia de la disculpa de la agradabilidad usando una regresión de la misma fuente humana. Esto introduce estructuralmente una vía rasgo→utilidad antes de observar conducta.
  • Las otras prioridades se sortean, por lo que los payoffs humanos y LLM no proceden del mismo mecanismo y la comparación de score no es una validación limpia de personalidad.
  • Los prompts prescriben explícitamente empezar por lo más importante, conceder, reciprocar, cambiar tras estancamiento, negociar al menos tres asuntos y evitar el no acuerdo; estas reglas producen parte de las estrategias evaluadas.
  • Los ejemplos few-shot y las advertencias temporales favorecen propuestas, concesiones y acuerdos, haciendo difícil atribuir esas conductas al modelo o a la personalidad.
  • Los resultados se ajustan por separado. Que un coeficiente sea significativo en un conjunto y no en otro no prueba diferencia; compartir no significación tampoco prueba alineación.
  • No hay modelo conjunto con interacción sistema×rasgo, contraste de coeficientes, intervalo de diferencia, prueba de equivalencia ni métrica agregada de alineación.
  • Se ejecutan cientos de pruebas al 5 % sin corrección de multiplicidad, lo que eleva falsos positivos. P-valores impresos como .000 deberían reportarse como <.001.
  • Los tamaños 500, 250, 250 y 248 implican distinta potencia. La frase de que cada conteo da estimaciones estadísticamente válidas no se respalda con análisis de potencia o precisión.
  • Cada díada aporta dos participantes y turnos relacionados. HC3 corrige heterocedasticidad en parte de los OLS, pero no documenta errores agrupados por conversación ni modelado multinivel.
  • Las regresiones logísticas de resultados no usan errores robustos; los coeficientes log-odds se presentan como B sin odds ratios o efectos marginales, dificultando comparar magnitudes.
  • Diez predictores de personalidad correlacionados se incluyen a la vez sin diagnóstico de multicolinealidad, regularización o estabilidad de coeficientes.
  • Los análisis eliminan valores ausentes según la variable, con N cambiante y sin flujo de exclusión, patrón de missingness o análisis de sensibilidad.
  • Temperatura 1, ausencia de semillas y una sola realización por perfil impiden separar varianza de muestreo del modelo de efectos de rasgo.
  • No se publican snapshots fechados de los tres generadores ni logs completos. El artículo abrevia GPT-4o-mini como GPT-4, creando ambigüedad de identidad.
  • Solo se estudian díadas del mismo modelo. No hay pares entre modelos, humano-LLM, condiciones sin personalidad, perfiles contradictorios ni comparación con instrucciones de estilo simples.
  • La anotación humana deja la clasificación directa tras bajo acuerdo y pasa a validar predicciones de GPT, lo que puede anclar a los jueces y no estima acuerdo independiente sobre etiquetas IRP.
  • Solo se validan 25 conversaciones humanas, no salidas LLM. El desempeño de GPT-4o como anotador puede variar por modelo generador y favorecer el estilo de su propia familia.
  • Una accuracy de 81 % y F1 .69 en Positive Expectations introducen error de medida no propagado a los intervalos o regresiones estratégicas.
  • Las afirmaciones de flexibilidad, rigidez, adaptación o contexto se infieren de frecuencias agregadas; no se contrastan como constructos psicológicos independientes.
  • La mayor similitud descriptiva de Claude no equivale a validez humana: puede reflejar un estilo textual más factual inducido por modelo o prompt.
  • No se evalúa robustez a orden, redacción, intensidad, selección de adjetivos, ejemplos o reglas; el propio paper reconoce esta limitación.
  • El repositorio oficial no contiene simulaciones, anotaciones completas, resultados ni raw KODIS subset; no permite regenerar ninguna tabla principal.
  • El CSV liberado tiene 220 díadas, 28 menos que el paper, y 58 observaciones sin aceptación. No hay IDs o provenance para explicar la diferencia.
  • Falta src/llm_api/base.py, por lo que el pipeline de simulación no importa; requirements omite statsmodels y declara google-generativeai mientras el código usa google.genai de google-genai.
  • El README remite a archivos, scripts y salidas inexistentes; los defaults de n_exp y n_round discrepan y type=bool impide desactivar personalidad correctamente.
  • La condición personality_setting=False falla porque el código sigue usando player1_selected_traits y player2_selected_traits no definidos.
  • prompt_build_v2 evalúa como Python el contenido de las plantillas, una práctica insegura e innecesaria que también fragiliza la reproducción.
  • No hay lockfile, entorno fijado, tests, CI o licencia en el repositorio; afirmar MIT en README no concede por sí solo una licencia verificable.
  • El apéndice contiene errores de copia: describe los datasets de Gemini y GPT-4o-mini como generados por dos Claude Sonnet 3.7.
  • No se documentan consentimiento, aprobación ética o condiciones de reutilización para esta submuestra; el paper depende de la gobernanza del corpus KODIS previo.

Qué no demuestra

  • No demuestra que GPT-4o-mini, Claude o Gemini encarnen una personalidad humana estable; prueba respuestas a perfiles adjetivales en un único guion.
  • No establece equivalencia o divergencia estadística de efectos entre humanos y LLM mediante contrastes directos; compara significación en modelos separados.
  • No demuestra que ausencia compartida de p<.05 sea alineación conductual ni que significación exclusiva de un grupo sea una diferencia entre grupos.
  • No identifica causalmente que la personalidad produzca las diferencias de score, porque parte de la función de utilidad depende explícitamente de agradabilidad.
  • No valida el uso de estos agentes en mediación legal, negociación real o decisiones socialmente sensibles.
  • No demuestra que Claude sea un proxy humano fiable; solo resulta más parecido en algunas distribuciones y trayectorias descriptivas.
  • No prueba generalización a otros escenarios, idiomas, culturas, modelos, prompts, configuraciones o interacciones humano-IA.
  • No permite reproducir las simulaciones, anotaciones o tablas desde el repositorio oficial disponible.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2602.07414v1, submitted 7 February 2026; AAAI 2026 AISI Special Track, 19 pages

Fuente consultada: https://arxiv.org/pdf/2602.07414v1

Revisión: Codex full-text, bilingual-fidelity, 19-page visual, arXiv-v1, AAAI-status, construct-validity, BFI-measurement-equivalence, prompt-intervention, circular-utility, dyadic-dependence, multiple-testing, coefficient-comparison, annotation-transfer, data-release, code-executability, dependency, documentation and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o-mini, 500 same-model L2L dialogues
  • Claude 3.7 Sonnet, 250 same-model L2L dialogues
  • Gemini 2.0 Flash, 250 same-model L2L dialogues
  • GPT-4o-2024-08-06 IRP annotator, run 19 March 2025

Instrumentos y métricas

  • Ten-item Big Five Inventory data in KODIS
  • Six-point polarity-degree LLM personality profile
  • Seventy bipolar adjective pairs, 15 adjectives per agent
  • Interests-Rights-Power strategy framework
  • Outcome score, accept and not-walk-away
  • IRP ratio, reciprocity, escalation and de-escalation
  • OLS and logistic regression with self traits, partner traits and role
  • A-Kappa, accuracy, macro F1 and weighted F1 for annotation

Datos utilizados

  • KODIS human-human subset, reported 248 dyads
  • Official processed KODIS release, 220 dyads and 440 participant rows
  • GPT-4o-mini L2L simulations, 500 reported and unreleased
  • Claude 3.7 Sonnet L2L simulations, 250 reported and unreleased
  • Gemini 2.0 Flash L2L simulations, 250 reported and unreleased
  • Twenty-five-conversation human IRP evaluation subset

Evidencia y localización

  • Metadatos, abstract, pregunta y contribuciones: arXiv:2602.07414v1, pp. 1–2, Abstract and Introduction
  • KODIS, 248 diálogos y medidas: Paper, pp. 3–4, KODIS and Behavioral Measures
  • Perfiles, 70 pares, seis niveles y simulaciones: Paper, pp. 4–5, L2L Dataset Construction and LLM Personality Profile
  • Agradabilidad programada en la importancia de disculpa: Paper, p. 5, LLM Personality Profile; B=2.13, p=.02
  • Modelos estadísticos y efectos de resultados: Paper, pp. 5–6 and supplementary pp. 11–19, regression tables
  • Distribución IRP, reciprocidad y dinámica temporal: Paper, pp. 6–8, Figures 2–4 and Results and Discussion
  • Limitaciones declaradas y conclusión: Paper, p. 8, Conclusion and Limitations and Future Work
  • Validación de anotación IRP: Paper supplementary, pp. 9–11, Tables 8–9; 25 conversations, accuracy .81, macro F1 .79
  • Hiperparámetros, matching y errores de dataset: Paper supplementary, pp. 12–13, Hyperparameters, Personality Matching and Dataset Statements
  • Inspección visual integral: Paper, all 19 rendered pages, including every figure, table, prompt and appendix page
  • Código, datos liberados y reproducibilidad: Official repository commit 811840284ae06b689655bfa71a2da72bf00403e1, all 36 tracked files
  • 220 díadas liberadas y 58 aceptaciones ausentes: Official repository, data/KODIS/KODIS_H2H_processed.csv; 440 rows split equally by role
  • Pipeline incompleto y dependencias inconsistentes: Official repository, requirements.txt, src/llm_api, scripts and README.md at audited commit