How Personality Traits Influence Negotiation Outcomes? A Simulation based on Large Language Models

Sociedad, cultura y comportamiento colectivo2024ACL AnthologyRevisión editorial aprobada

Autores: Yin Jou Huang, Rafik Hadfi

Palabras clave: Personality traits, Large language models, Negotiation simulation, Decision-making, Big Five, Bargaining dialogues

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
13
Hallazgos
46
Limitaciones
14
Evidencias

Resumen editorial

Español

El artículo no mide la personalidad de negociadores humanos ni entrena un agente con rasgos psicológicos observados. Estudia qué ocurre cuando se asignan a dos LLM, comprador y vendedor, perfiles Big Five sintéticos mediante adjetivos incluidos en el prompt. Cada dimensión adopta uno de seis niveles, polaridad positiva o negativa y grado bajo, moderado o alto, y aporta tres adjetivos; los quince se mezclan y se añaden a instrucciones económicas de compra o venta. El experimento principal usa GPT-4 0613, 60 productos declarados de CraigsListBargain, un máximo de 20 turnos y 1.499 diálogos. Un tercer GPT-4 0613 clasifica cada intervención como oferta, reflexión, aceptación, ruptura o charla, extrae el precio y genera una etiqueta libre de estrategia. Los resultados se relacionan con utilidad propia, utilidad conjunta, concesión, éxito y duración mediante correlaciones de Spearman.

En GPT-4, todas las asociaciones significativas de la tabla principal tienen |ρ| < 0,30. La amabilidad del vendedor muestra el patrón más consistente: se asocia con menor utilidad propia (ρ = −0,262), pero mayor utilidad conjunta (0,118), mayor concesión (0,261), una probabilidad de acuerdo apenas superior (0,052) y menos turnos (−0,223). La responsabilidad del vendedor se asocia con más utilidad propia (0,127) y menos concesión (−0,097), mientras la responsabilidad del comprador se relaciona con negociaciones algo más largas (0,083). La extraversión del comprador se asocia débilmente con éxito (0,072) y la del vendedor con utilidad conjunta (0,069). Neuroticismo y apertura presentan efectos todavía menores. Estos datos apoyan que modificar el prompt de personalidad altera ligeramente las trayectorias de negociación simuladas; no muestran efectos psicológicos grandes ni perfiles individuales fiables.

El análisis de estrategias depende enteramente de etiquetas generadas por el LLM evaluador y agrupadas manualmente. La Figura 2 relaciona acomodación (β = 0,125) y concesión (0,093) con más utilidad conjunta, y asertividad con menos (−0,261). Sin embargo, el Apéndice D atribuye a la asertividad un coeficiente conjunto de −0,45, cifra que no coincide con la figura. Los ejemplos cualitativos muestran ofertas fuera de los límites dados y apelaciones emocionales inventadas, pero denominarlas «engaño» o «estrategia» interpreta conducta textual sin validar intención.

La comparación humana es superficial. Los diálogos originales de CraigsListBargain promedian 8,47 turnos y 108,82 palabras, frente a 7,07 turnos y 272,17 palabras en la simulación. El estudio también informa correlaciones positivas entre precio y longitud, r = 0,194 para turnos y 0,242 para palabras. No compara personas y agentes con los mismos perfiles Big Five, no analiza resultados humanos equivalentes ni realiza una prueba de equivalencia conductual. La semejanza consiste en algunos patrones agregados y coincidencias con literatura previa, no en una réplica directa de negociación humana.

Los apéndices añaden GPT-3.5 Turbo 0125 y Meta-Llama-3-70B-Instruct. Llama reproduce varias direcciones de GPT-4. La afirmación textual de que con GPT-3.5 «no se puede identificar ninguna correlación significativa» contradice su Tabla 4, que marca ocho relaciones con p < 0,05 y otras dos con p < 0,10; por ello no puede sostenerse esa comparación de modelos tal como está escrita. En un control IPIP-50 con 300 agentes declarados, las correlaciones diagonales entre nivel instruido y respuesta al cuestionario son 0,73–0,78 para GPT-4, 0,59–0,84 para GPT-3.5 y 0,85–0,92 para Llama. Ese control muestra obediencia y coherencia dentro del mismo marco verbal, no validez de personalidad: el modelo recibe explícitamente los adjetivos y contesta ítems públicos relacionados, con riesgo de demanda y contaminación reconocido por los autores.

La reproducibilidad es insuficiente. El repositorio oficial solo tiene un commit y publica scripts, una lista de estrategias y 161 entradas de negociación, pero no los 1.499 diálogos, los perfiles exactos, los resultados, el subconjunto de 60 productos, los ítems IPIP ni las órdenes utilizadas. No fija semillas; el generador usa temperatura 1. El CSV produciría por defecto 314 configuraciones utilizables, no el experimento descrito. Además, fija openai==0.27.8 mientras llama a la API de la serie 1.x y eval.py importa pandas sin declararlo, por lo que el entorno publicado no ejecuta el flujo sin reparación. La contribución defendible es un marco exploratorio que muestra que instrucciones Big Five pueden modular débilmente negociaciones entre snapshots concretos de LLM. No demuestra personalidad humana, negociación real, intención, paridad con personas ni una base validada para desplegar agentes negociadores.

English

The paper does not measure the personality of human negotiators or train an agent on observed psychological traits. It studies what happens when two LLMs, a buyer and a seller, are assigned synthetic Big Five profiles through adjectives in their prompts. Each dimension takes one of six levels, positive or negative polarity at low, moderate, or high degree, and contributes three adjectives; the fifteen adjectives are shuffled and appended to economic buyer or seller instructions. The main experiment uses GPT-4 0613, 60 stated CraigsListBargain products, a maximum of 20 turns, and 1,499 dialogues. A third GPT-4 0613 classifies each utterance as offer, pondering, acceptance, breakdown, or chit-chat, extracts the price, and produces a free-text strategy label. Outcomes are related to own utility, joint utility, concession, success, and duration through Spearman correlations.

For GPT-4, every significant association in the main table has |ρ| < 0.30. Seller Agreeableness shows the most consistent pattern: it is associated with lower own utility (ρ = −0.262), but higher joint utility (0.118), more concession (0.261), only a slightly higher agreement probability (0.052), and fewer turns (−0.223). Seller Conscientiousness is associated with higher own utility (0.127) and less concession (−0.097), while buyer Conscientiousness is related to somewhat longer negotiations (0.083). Buyer Extraversion is weakly associated with success (0.072), and seller Extraversion with joint utility (0.069). Neuroticism and Openness have still smaller effects. These results support the claim that personality wording in a prompt slightly changes simulated negotiation trajectories. They do not show large psychological effects or reliable individual profiles.

The strategy analysis depends entirely on labels generated by the evaluator LLM and grouped manually. Figure 2 associates accommodating (β = 0.125) and concession (0.093) with higher joint utility, and assertiveness with lower joint utility (−0.261). Appendix D, however, assigns assertiveness a joint coefficient of −0.45, which does not match the figure. The qualitative examples contain offers outside the supplied bounds and invented emotional appeals, but calling them “deception” or “strategy” interprets textual behavior without validating intent.

The human comparison is shallow. Original CraigsListBargain dialogues average 8.47 turns and 108.82 words, versus 7.07 turns and 272.17 words in the simulation. The paper also reports positive correlations between price and length, r = 0.194 for turns and 0.242 for words. It does not compare people and agents with matched Big Five profiles, analyze equivalent human outcomes, or run a behavioral equivalence test. Similarity consists of selected aggregate patterns and agreement with prior literature rather than a direct replication of human negotiation.

The appendices add GPT-3.5 Turbo 0125 and Meta-Llama-3-70B-Instruct. Llama reproduces several GPT-4 directions. The textual claim that GPT-3.5 yields “no significant correlations” contradicts Table 4, which marks eight relationships at p < 0.05 and two more at p < 0.10; the stated model comparison therefore cannot be accepted as written. In an IPIP-50 check with 300 reported agents, diagonal correlations between instructed level and questionnaire response are 0.73–0.78 for GPT-4, 0.59–0.84 for GPT-3.5, and 0.85–0.92 for Llama. This check demonstrates instruction following and internal coherence within the same verbal frame, not personality validity: the model is explicitly given the adjectives and answers related public items, with demand effects and contamination risk acknowledged by the authors.

Reproducibility is inadequate. The official repository has one commit and releases scripts, a strategy list, and 161 negotiation entries, but not the 1,499 dialogues, exact profiles, outputs, the selected 60 products, IPIP items, or executed commands. It sets no seeds, and generation uses temperature 1. The CSV would produce 314 usable configurations by default rather than the reported experiment. It also pins openai==0.27.8 while calling the 1.x API and imports pandas in eval.py without declaring it, so the published environment cannot run the workflow without repair. The defensible contribution is an exploratory framework showing that Big Five instructions can weakly modulate negotiations between specific LLM snapshots. It does not establish human personality, real negotiation behavior, intent, human parity, or a validated basis for deploying negotiation agents.

Pregunta de investigación

¿Cómo cambian los resultados y estrategias de negociaciones bilaterales simuladas cuando se asignan perfiles Big Five sintéticos a agentes LLM compradores y vendedores, y hasta qué punto esos patrones se parecen a tendencias descritas en negociaciones humanas?

Método

Simulación exploratoria de negociación. Comprador y vendedor reciben objetivos opuestos y perfiles Big Five aleatorios con seis niveles por dimensión; cada nivel se expresa mediante tres adjetivos de Goldberg y modificadores de intensidad, quince adjetivos por agente en orden mezclado. El análisis principal genera 1.499 diálogos declarados sobre 60 entradas de CraigsListBargain con GPT-4 0613 y un límite declarado de 20 turnos. Otro GPT-4 0613, mediante function calling, detecta estado, oferta y estrategia. Se calculan utilidad propia y conjunta, concesión, éxito y duración; se correlacionan por separado con cada rasgo y rol. Se agrupan manualmente estrategias frecuentes, se ajustan regresiones lineales descriptivas y se compara longitud agregada con diálogos humanos. Los apéndices repiten asociaciones con GPT-3.5 Turbo 0125 y Llama-3-70B-Instruct y administran IPIP-50 a 300 agentes declarados. La auditoría editorial leyó y renderizó las 16 páginas y revisó el único commit del repositorio oficial.

Muestra: El experimento principal declara 1.499 diálogos GPT-4 construidos a partir de 60 entradas de CraigsListBargain. Cada diálogo enfrenta dos agentes con perfiles aleatorios de cinco dimensiones y seis niveles por dimensión. El artículo no informa cuántos diálogos aporta cada producto, el reparto de perfiles, pérdidas por error, tasa global de éxito ni tamaños de muestra efectivos para cada métrica. Los apéndices no especifican el N de diálogos de GPT-3.5 y Llama. Para IPIP-50 se declaran 300 agentes, sin aclarar con precisión el reparto por modelo, rasgo y nivel.

Hallazgos

  • En la tabla principal de GPT-4, todas las correlaciones significativas tienen magnitud inferior a 0,30, por lo que los efectos observados son pequeños.
  • La amabilidad del vendedor se asocia con menor utilidad propia (ρ = −0,262), pero mayor utilidad conjunta (0,118), concesión (0,261), éxito (0,052) y menos turnos (−0,223).
  • La responsabilidad del vendedor se asocia con más utilidad propia (ρ = 0,127) y menos concesión (−0,097); la del comprador se asocia con más turnos (0,083).
  • La extraversión del comprador se relaciona débilmente con éxito (ρ = 0,072) y la del vendedor con utilidad conjunta (0,069).
  • Neuroticismo y apertura muestran asociaciones significativas de magnitud inferior a 0,10 en el análisis principal, coherentes con un papel menor dentro de esta simulación.
  • La Figura 2 atribuye coeficientes positivos de utilidad conjunta a acomodación (β = 0,125) y concesión (0,093), y uno negativo a asertividad (−0,261), aunque el Apéndice D da otra cifra para esta última.
  • Los diálogos humanos promedian 8,47 turnos y 108,82 palabras; los simulados 7,07 turnos y 272,17 palabras, es decir, menos intercambios pero mucha más verbosidad.
  • El artículo informa r = 0,194 entre precio y número de turnos y r = 0,242 entre precio y palabras, asociaciones positivas pero pequeñas.
  • Los dos casos cualitativos exhiben una oferta superior al precio listado, una apelación inventada a un familiar anciano y comportamiento de ultimátum; son ejemplos seleccionados, no frecuencias poblacionales.
  • Las correlaciones diagonales entre nivel instruido e IPIP son 0,73–0,78 para GPT-4, 0,59–0,84 para GPT-3.5 y 0,85–0,92 para Llama-3-70B.
  • Llama-3-70B reproduce varias direcciones de GPT-4, sobre todo el intercambio entre amabilidad, utilidad propia, concesión, éxito y duración.
  • La Tabla 4 de GPT-3.5 contiene ocho asociaciones marcadas con p < 0,05 y dos con p < 0,10, en contradicción con la frase del apéndice que afirma no hallar ninguna significativa.
  • La auditoría del repositorio confirma que se publica parte del framework y metadatos de productos, pero no los diálogos, perfiles, outputs ni parámetros exactos necesarios para reconstruir las tablas.

Limitaciones

  • El estudio manipula instrucciones de agentes artificiales; no mide rasgos de personalidad ni decisiones de personas.
  • No incluye una condición sin instrucciones de personalidad, por lo que no estima el cambio absoluto frente a un agente neutral.
  • Las cinco dimensiones varían a la vez y se analizan principalmente con correlaciones univariadas; no se aíslan efectos de un rasgo manteniendo constantes los demás.
  • El espacio de perfiles tiene 6^5 combinaciones por agente y es enorme respecto a 1.499 diálogos; no se publican conteos, balance ni cobertura de combinaciones.
  • Sesenta productos se reutilizan para 1.499 diálogos, pero las pruebas tratan los diálogos como observaciones independientes y no agrupan errores por producto o configuración.
  • No se aplican modelos mixtos o controles por categoría, precio, diferencia entre precios objetivo, longitud de descripción o repetición del producto.
  • Cada tabla de resultados de negociación contiene 50 correlaciones y se presentan tres modelos, además de 75 correlaciones IPIP, sin corrección explícita por comparaciones múltiples.
  • Se usa p < 0,10 como categoría destacada y no se publican intervalos de confianza, lo que aumenta el riesgo de sobreinterpretar hallazgos débiles.
  • La significación de coeficientes muy pequeños está impulsada por el N nominal y no implica importancia práctica.
  • No se informan los N efectivos de negociaciones exitosas, de ofertas válidas o de observaciones usadas en cada correlación.
  • Los tamaños de muestra de GPT-3.5 y Llama-3-70B no se publican, impidiendo comparar potencia y estabilidad entre modelos.
  • No hay preregistro, hipótesis direccionales completas ni separación clara entre análisis confirmatorios y exploratorios.
  • La simulación cubre un único juego competitivo de compraventa en inglés y no otros tipos de negociación, culturas, idiomas o relaciones de largo plazo.
  • Los objetivos económicos son lineales y omiten riesgo, tiempo, reputación, información incompleta real, alternativas, costes de ruptura y preferencias no monetarias.
  • El supuesto de que la zona de acuerdo ocupa el 70 % del intervalo entre precios es arbitrario y no se somete a sensibilidad.
  • Aunque las utilidades se definen con codominio [0,1], las ofertas pueden salir de los intervalos. El ejemplo de precio listado 50, objetivo 30 y acuerdo 60 produce utilidad del vendedor superior a 1 y del comprador negativa.
  • La utilidad conjunta puede ser negativa fuera de la zona de acuerdo, de modo que su interpretación como equidad o ganancia mutua deja de ser válida en casos que el propio estudio conserva.
  • La concesión se deriva de una forma funcional propuesta y no se valida contra anotaciones humanas o una medida estándar en estos diálogos.
  • El código modifica extremos de ofertas para la concesión después de calcular parte de los límites, una implementación que no coincide limpiamente con la ecuación publicada y puede generar valores inestables.
  • Un GPT-4 0613 no validado determina aceptación, ruptura, precio y estrategia; cualquier error del evaluador altera éxito, utilidad, duración y análisis estratégico.
  • El mismo snapshot GPT-4 genera y evalúa el experimento principal, creando dependencia compartida entre conducta y medición.
  • GPT-4 también evalúa los diálogos de GPT-3.5 y Llama, por lo que las diferencias entre modelos pueden incluir compatibilidad diferencial con el evaluador.
  • Las estrategias se generan como texto libre, se normalizan con una lista manual de sinónimos y se omiten etiquetas no mapeadas; no se publican cobertura, acuerdo entre anotadores ni validación.
  • Solo se incluyen en las figuras estrategias con más de 20 apariciones, una selección posterior a los datos que puede ocultar patrones raros o inestables.
  • La regresión estratégica trata múltiples intervenciones del mismo diálogo como independientes y asigna a todas la utilidad final, incurriendo en pseudorreplicación y atribución temporal débil.
  • El código usa todas las dummies de estrategia con intercepto, una parametrización colineal; los coeficientes no tienen una categoría de referencia clara y se publican sin errores estándar o pruebas.
  • El chi-cuadrado cuenta múltiples intervenciones y diez indicadores de polaridad por diálogo como si fueran observaciones independientes, incumpliendo la independencia de la prueba.
  • La Figura 2 muestra −0,261 para asertividad y utilidad conjunta, mientras el Apéndice D afirma −0,45; la discrepancia no se explica.
  • La sección de GPT-3.5 afirma que no existen correlaciones significativas, pero la Tabla 4 marca ocho con p < 0,05 y dos con p < 0,10.
  • El comprador y el vendedor reciben prompts asimétricos: el vendedor ve la descripción del producto y el comprador no, lo que puede influir en diferencias atribuidas al rol.
  • Adjetivos como immoral, dishonest, intelligent o socially progressive incluyen valoración moral, capacidad o ideología y pueden cambiar directamente la estrategia sin representar un rasgo latente.
  • La comparación humana no empareja perfiles, condiciones, instrucciones ni resultados; solo contrasta estadísticas agregadas de longitud y referencias previas.
  • No se publican intervalos o pruebas para las diferencias de 8,47 frente a 7,07 turnos y 108,82 frente a 272,17 palabras.
  • No queda claro si las correlaciones precio-longitud de 0,194 y 0,242 corresponden a humanos, LLM, ambos combinados o promedios por categoría; tampoco se dan p-valores o intervalos.
  • El código llama «round» a posiciones de intervención e incluye dos aperturas prefijadas; con el valor por defecto de diez ciclos puede producir 22 entradas, en tensión con el máximo de 20 turnos declarado.
  • Los ejemplos de «engaño» no disponen de verificación de creencias o intención; una oferta inventada puede ser alucinación o actuación inducida por el prompt.
  • El control IPIP vuelve a mostrar al modelo los adjetivos y pregunta por ítems semánticamente relacionados, por lo que tiene fuertes efectos de demanda y circularidad.
  • IPIP-50 es público y los autores reconocen posible contaminación; la correlación no demuestra que el modelo posea el constructo psicológico.
  • El artículo declara 300 agentes para IPIP, pero no aclara los N por modelo, nivel y tabla ni publica respuestas individuales.
  • Los snapshots GPT-4 0613 y GPT-3.5 0125 están retirados y las respuestas a temperatura 1 no pueden regenerarse de forma idéntica sin outputs preservados.
  • El repositorio no contiene los 1.499 diálogos, perfiles generados, outputs IPIP, subconjunto de 60 productos, tablas intermedias ni figuras reproducibles.
  • negotiation_settings.csv contiene 161 entradas analizadas, 157 utilizables por defecto; no hay script o semilla que seleccione las 60 declaradas y el generador produciría 314 configuraciones, no 1.499 diálogos.
  • No se fijan semillas para perfiles, adjetivos o selección y no se documentan las órdenes ni valores de repetición que originaron el experimento.
  • El entorno fija openai==0.27.8, pero el código llama openai.chat.completions y OpenAI, interfaces de la serie 1.x; además eval.py requiere pandas, ausente del Pipfile y lock.
  • El repositorio no incluye tests, licencia, release, historial experimental ni commit citado dentro del paper; solo existe un commit inicial.
  • Los riesgos éticos se discuten, pero no hay usuarios, estudio de daño, privacidad, seguridad o despliegue que valide mitigaciones.

Qué no demuestra

  • No demuestra cómo la personalidad humana causa resultados de negociación.
  • No demuestra que GPT-4, GPT-3.5 o Llama posean rasgos Big Five estables, internos o comparables con los de una persona.
  • No valida los perfiles sintéticos como mediciones psicométricas; muestra respuestas coherentes con adjetivos explícitos.
  • No demuestra que las simulaciones reproduzcan globalmente negociaciones humanas; solo coinciden algunos patrones agregados seleccionados.
  • No demuestra que GPT-4 modele mejor la personalidad que GPT-3.5, porque la afirmación sobre ausencia de significación en GPT-3.5 contradice la tabla y faltan N comparables.
  • No establece que los resultados de Llama generalicen a otros modelos abiertos, tamaños, versiones o decodificadores.
  • No aísla el efecto causal de cada rasgo respecto a los otros cuatro, el producto, el precio y la redacción de los adjetivos.
  • No prueba que las etiquetas automáticas de estrategia, éxito o precio sean correctas.
  • No demuestra que acomodación, concesión o asertividad causen la utilidad final; las regresiones son descriptivas y no respetan la dependencia temporal.
  • No demuestra engaño, intención, emoción, comprensión económica o razonamiento psicológico en los agentes.
  • No demuestra que una mayor utilidad conjunta represente justicia, bienestar o un resultado deseable fuera de las funciones arbitrarias elegidas.
  • No predice rendimiento, seguridad o beneficio de agentes negociadores en mercados, empleo, banca o finanzas reales.
  • No justifica personalizar asistentes con rasgos psicológicos ni utilizar estos perfiles para influir, persuadir o decidir por usuarios.
  • No generaliza a modelos actuales, otros idiomas, negociación multipartita, relaciones repetidas o situaciones de alto riesgo.
  • No ofrece una reproducción independiente completa de las cifras publicadas con los artefactos disponibles.

Trazabilidad

Alcance: Texto completo

Versión: Findings of ACL: EMNLP 2024, pp. 10336–10351; DOI 10.18653/v1/2024.findings-emnlp.605; ACL Anthology ID 2024.findings-emnlp.605; CC BY 4.0

Fuente consultada: https://aclanthology.org/2024.findings-emnlp.605.pdf

Revisión: Codex full-text, visual, appendix, code and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4 (gpt-4-0613) as buyer and seller in the main experiment
  • GPT-4 (gpt-4-0613) as dialogue state, price and strategy detector in every experiment
  • GPT-3.5 Turbo (gpt-3.5-turbo-0125) in Appendix B
  • Meta-Llama-3-70B-Instruct in Appendix B

Instrumentos y métricas

  • Synthetic six-level Big Five profiles from Goldberg bipolar adjective pairs
  • IPIP-50 personality questionnaire
  • Spearman rank correlations
  • Pearson correlations for product price and dialogue length
  • Own and Nash-inspired joint utility functions
  • Estimated concession rate
  • Negotiation success rate and number of turns
  • GPT-4 function-calling dialogue state detector
  • Manually consolidated strategy taxonomy
  • One-hot linear regression for strategy coefficients
  • Pearson chi-square residuals for strategy and trait polarity

Datos utilizados

  • CraigsListBargain bargaining dialogues and product metadata
  • Sixty negotiation entries reported in the paper
  • 1,499 generated negotiation dialogues reported in the paper but not released
  • Official big5-llm-negotiator repository at commit dce8cb231bf99a596aefb6e415165518e03706e4
  • Repository negotiation_settings.csv with 161 parsed entries, 157 usable by the default generator
  • Repository strategy_list.json with 11 manually consolidated strategy categories

Evidencia y localización

  • Metadatos, resumen, DOI, páginas y licencia: ACL Anthology 2024.findings-emnlp.605; final paper p. 10336; CC BY 4.0
  • Marco, perfiles Big Five, seis niveles y quince adjetivos: Final paper, sections 3.1–3.2 and Table 1, pp. 10338–10339
  • Sesenta entradas, 1.499 diálogos, máximo de 20 y detector GPT-4: Final paper, section 4.1, p. 10340
  • Funciones de utilidad, concesión, éxito y duración: Final paper, section 4.2, equations 3–8, pp. 10340–10341
  • Correlaciones de GPT-4 por rasgo y rol: Final paper, Table 2 and section 5.1, pp. 10341–10342
  • Estrategias, regresión y coeficientes conjuntos: Final paper, Figure 2 and section 5.2, pp. 10342–10343; Appendix D and Figure 5, pp. 10349–10351
  • Comparación de longitud humana y simulada y relación con precio: Final paper, section 5.3 and Figure 3, p. 10343
  • Casos de oferta fuera de rango y apelación emocional: Final paper, Table 3 and section 5.4, p. 10344
  • Limitaciones y riesgos éticos declarados: Final paper, Limitations and Ethics Statement, p. 10345
  • GPT-3.5, Llama y contradicción de significación: Final paper, Appendix B and Tables 4–5, pp. 10348–10349
  • IPIP-50, 300 agentes y correlaciones por modelo: Final paper, Appendix C, Figure 4 and Tables 6–8, pp. 10348–10350
  • Scripts, dependencias, prompts y lógica de evaluación: Official big5-llm-negotiator repository commit dce8cb231bf99a596aefb6e415165518e03706e4, Agent.py, Game.py, eval.py, Pipfile and Pipfile.lock, audited 15 Jul 2026
  • Discrepancia entre corpus publicado y diseño declarado: Official repository commit dce8cb2, data/negotiation_settings.csv and agent_profile_generation.py: 161 parsed entries, 157 usable, two default profiles per product; compared with final paper p. 10340
  • Ausencia de outputs y estado del repositorio: Official repository commit dce8cb2: one initial commit dated 2 Nov 2024, no raw dialogues, generated profiles, IPIP data, tests, license or releases; verified 15 Jul 2026