Este trabajo pregunta si agentes LLM condicionados con rasgos Big Five reproducen las relaciones entre personalidad y conducta observadas en personas durante un conflicto. Compara una submuestra declarada de 248 diálogos humano-humano de KODIS con 1.000 negociaciones entre dos instancias del mismo modelo: 500 con GPT-4o-mini y 250 con Claude 3.7 Sonnet y Gemini 2.0 Flash. Todos negocian el mismo conflicto comprador-vendedor por una camiseta, con cinco decisiones sobre reembolso, reseñas y disculpas. Los resultados finales son puntuación, quién acepta y si se evita abandonar; las estrategias se clasifican con el marco Interests-Rights-Power en cooperación, neutralidad, competición y residual, además de reciprocidad, escalada y desescalada.
Los agentes reciben 15 adjetivos, tres por rasgo, elegidos de 70 pares bipolares y modificados para representar seis niveles. Sus distribuciones de rasgos imitan marginalmente la muestra humana, pero la medición no es equivalente: las personas contestan diez ítems BFI y los LLM reciben etiquetas discretas en un prompt. Además, el diseño introduce de antemano una asociación humana: el peso de la disculpa se hace depender de la agradabilidad usando una regresión de KODIS (B=2,13; p=.02), mientras los demás pesos se sortean. Por tanto, cualquier efecto de agradabilidad sobre resultados mezcla el supuesto mecanismo psicológico con una preferencia de utilidad programada por los autores.
En KODIS, la puntuación no presenta efectos de personalidad; para aceptar, mayor neuroticismo propio se asocia negativamente (B=-0,26; p=.026) y el de la pareja positivamente (B=0,27; p=.025); evitar abandonar tampoco presenta efectos. Los LLM muestran conjuntos distintos de coeficientes significativos según modelo y resultado. En estrategia, las personas usan sobre todo hechos y cambian de fase durante la conversación; los LLM recurren más a propuestas y concesiones, siguen trayectorias más planas y se comportan de modo específico al modelo. Claude es el más parecido descriptivamente al patrón humano, Gemini el más sesgado hacia propuesta, poder y residual, y GPT-4o-mini usa más poder y derechos. La reciprocidad cooperativa es 88,5–98,2 % en LLM frente a 73,7 % en personas; GPT-4o-mini también eleva la reciprocidad competitiva a 48,8 % frente a 13,1 %. Estos contrastes apoyan la conclusión cauta de que los prompts de personalidad no convierten a estos modelos en sustitutos conductuales fiables.
Sin embargo, “alineación” se decide principalmente comparando qué coeficientes cruzan p<.05 en regresiones separadas. Compartir ausencia de significación no demuestra equivalencia, y que un efecto sea significativo en un grupo y no en otro no demuestra que ambos efectos difieran. No se ajusta un modelo conjunto con interacción sistema×rasgo, no se aportan diferencias de coeficientes con intervalos ni pruebas de equivalencia, y no hay corrección por los cientos de contrastes. Tampoco se documenta agrupamiento por díada, pese a que cada conversación aporta dos participantes relacionados. Los tamaños 500/250/250/248 producen potencias distintas y la temperatura 1 sin semillas ni repeticiones no cuantifica variabilidad de simulación.
La anotación IRP usa GPT-4o-2024-08-06 a temperatura 1. Tres anotadores, uno autor, dejan de clasificar directamente tras obtener bajo acuerdo y pasan a juzgar las predicciones de GPT como correctas o incorrectas en 25 conversaciones humanas. El sistema alcanza 81 % de accuracy, F1 macro .79 y F1 ponderado .81; Positive Expectations queda en .69. Esa validación parcial solo cubre texto humano y puede no transferirse por igual a los estilos de GPT-4o-mini, Claude y Gemini; usar un anotador de la misma familia que uno de los generadores también admite sesgo de estilo.
La auditoría del repositorio oficial, commit 811840284ae06b689655bfa71a2da72bf00403e1, impide reproducir las tablas. No publica las 1.000 simulaciones, sus anotaciones, resultados, semillas ni el CSV humano bruto. El único CSV procesado contiene 440 observaciones, 220 díadas, no las 248 declaradas, y 58 valores ausentes para aceptación. Faltan el módulo src/llm_api/base.py, statsmodels en requirements y el paquete google-genai que exige el código; tampoco hay tests, CI, lockfile o licencia, aunque el README afirma MIT. Varias rutas y pasos descritos no existen, los argumentos y defaults discrepan, y el apéndice atribuye por error los datasets Gemini y GPT a dos Claude. El artefacto sirve para inspeccionar parte del diseño, no para ejecutar de extremo a extremo ni verificar los resultados publicados.