El artículo no mide la personalidad de negociadores humanos ni entrena un agente con rasgos psicológicos observados. Estudia qué ocurre cuando se asignan a dos LLM, comprador y vendedor, perfiles Big Five sintéticos mediante adjetivos incluidos en el prompt. Cada dimensión adopta uno de seis niveles, polaridad positiva o negativa y grado bajo, moderado o alto, y aporta tres adjetivos; los quince se mezclan y se añaden a instrucciones económicas de compra o venta. El experimento principal usa GPT-4 0613, 60 productos declarados de CraigsListBargain, un máximo de 20 turnos y 1.499 diálogos. Un tercer GPT-4 0613 clasifica cada intervención como oferta, reflexión, aceptación, ruptura o charla, extrae el precio y genera una etiqueta libre de estrategia. Los resultados se relacionan con utilidad propia, utilidad conjunta, concesión, éxito y duración mediante correlaciones de Spearman.
En GPT-4, todas las asociaciones significativas de la tabla principal tienen |ρ| < 0,30. La amabilidad del vendedor muestra el patrón más consistente: se asocia con menor utilidad propia (ρ = −0,262), pero mayor utilidad conjunta (0,118), mayor concesión (0,261), una probabilidad de acuerdo apenas superior (0,052) y menos turnos (−0,223). La responsabilidad del vendedor se asocia con más utilidad propia (0,127) y menos concesión (−0,097), mientras la responsabilidad del comprador se relaciona con negociaciones algo más largas (0,083). La extraversión del comprador se asocia débilmente con éxito (0,072) y la del vendedor con utilidad conjunta (0,069). Neuroticismo y apertura presentan efectos todavía menores. Estos datos apoyan que modificar el prompt de personalidad altera ligeramente las trayectorias de negociación simuladas; no muestran efectos psicológicos grandes ni perfiles individuales fiables.
El análisis de estrategias depende enteramente de etiquetas generadas por el LLM evaluador y agrupadas manualmente. La Figura 2 relaciona acomodación (β = 0,125) y concesión (0,093) con más utilidad conjunta, y asertividad con menos (−0,261). Sin embargo, el Apéndice D atribuye a la asertividad un coeficiente conjunto de −0,45, cifra que no coincide con la figura. Los ejemplos cualitativos muestran ofertas fuera de los límites dados y apelaciones emocionales inventadas, pero denominarlas «engaño» o «estrategia» interpreta conducta textual sin validar intención.
La comparación humana es superficial. Los diálogos originales de CraigsListBargain promedian 8,47 turnos y 108,82 palabras, frente a 7,07 turnos y 272,17 palabras en la simulación. El estudio también informa correlaciones positivas entre precio y longitud, r = 0,194 para turnos y 0,242 para palabras. No compara personas y agentes con los mismos perfiles Big Five, no analiza resultados humanos equivalentes ni realiza una prueba de equivalencia conductual. La semejanza consiste en algunos patrones agregados y coincidencias con literatura previa, no en una réplica directa de negociación humana.
Los apéndices añaden GPT-3.5 Turbo 0125 y Meta-Llama-3-70B-Instruct. Llama reproduce varias direcciones de GPT-4. La afirmación textual de que con GPT-3.5 «no se puede identificar ninguna correlación significativa» contradice su Tabla 4, que marca ocho relaciones con p < 0,05 y otras dos con p < 0,10; por ello no puede sostenerse esa comparación de modelos tal como está escrita. En un control IPIP-50 con 300 agentes declarados, las correlaciones diagonales entre nivel instruido y respuesta al cuestionario son 0,73–0,78 para GPT-4, 0,59–0,84 para GPT-3.5 y 0,85–0,92 para Llama. Ese control muestra obediencia y coherencia dentro del mismo marco verbal, no validez de personalidad: el modelo recibe explícitamente los adjetivos y contesta ítems públicos relacionados, con riesgo de demanda y contaminación reconocido por los autores.
La reproducibilidad es insuficiente. El repositorio oficial solo tiene un commit y publica scripts, una lista de estrategias y 161 entradas de negociación, pero no los 1.499 diálogos, los perfiles exactos, los resultados, el subconjunto de 60 productos, los ítems IPIP ni las órdenes utilizadas. No fija semillas; el generador usa temperatura 1. El CSV produciría por defecto 314 configuraciones utilizables, no el experimento descrito. Además, fija openai==0.27.8 mientras llama a la API de la serie 1.x y eval.py importa pandas sin declararlo, por lo que el entorno publicado no ejecuta el flujo sin reparación. La contribución defendible es un marco exploratorio que muestra que instrucciones Big Five pueden modular débilmente negociaciones entre snapshots concretos de LLM. No demuestra personalidad humana, negociación real, intención, paridad con personas ni una base validada para desplegar agentes negociadores.