El artículo estudia si describir a un agente LLM mediante los Big Five cambia su cooperación en un dilema del prisionero repetido. Esta revisión usa la versión aceptada y publicada como Article in Press en Scientific Reports el 2 de junio de 2026, no solo el preprint: 21 páginas de artículo, 15 de suplemento, el ZIP público de Zenodo y el repositorio de código en el commit 467ad9831ea7e5fbd4a3092d747e411e3af8e77c.
El trabajo tiene tres experimentos. En el primero, GPT-3.5-turbo, GPT-4o y GPT-5 contestan el BFI-44 veinte veces cada uno. Los promedios publicados son, en el orden apertura, responsabilidad, extraversión, amabilidad y neuroticismo: GPT-3.5 4,58, 4,06, 3,78, 4,24 y 1,96; GPT-4o 4,68, 4,12, 3,15, 4,27 y 1,98; GPT-5 4,69, 4,69, 3,10, 4,27 y 2,11. La tabla compara estos valores con una muestra humana reescalada y destaca que las desviaciones de las veinte ejecuciones del mismo modelo son menores que las desviaciones entre personas.
Esa comparación no permite concluir que el LLM tenga una personalidad interna estable o una medición psicométrica más fiable. La varianza del modelo es variación de muestreo al repetir un único sistema bajo un prompt, mientras que la humana es variación entre individuos distintos; son unidades de variación diferentes. Tampoco se informan consistencia interna por escala, test-retest con prompts alternativos, validez factorial, aquiescencia, validez convergente o criterio externo. Los scores altos en apertura, responsabilidad y amabilidad y bajos en neuroticismo pueden reflejar respuesta socialmente deseable o alineamiento del modelo, no rasgos psicológicos.
En el experimento 2, cada modelo juega contra ALLC, ALLD, RANDOM al 50 %, GRIM y TFT. Para cada oponente y condición se ejecutan 100 partidas independientes de diez rondas. Se compara un baseline sin perfil con una condición que inserta los cinco scores medidos y descripciones naturales. Son 10.000 decisiones por modelo, 30.000 en total. Las sesiones se reinician por partida, el horizonte de diez rondas se declara y la matriz de pago es T=5, R=3, P=1 y S=0.
Los datos y el suplemento reproducen el resultado principal del experimento 2. En GPT-3.5, la cooperación sube significativamente frente a ALLD de 0,602 a 0,774 y frente a RANDOM de 0,745 a 0,879, pero no cambia de forma significativa frente a ALLC, GRIM o TFT. En GPT-4o sube frente a ALLD de 0,100 a 0,216 y frente a RANDOM de 0,206 a 0,743. En GPT-5 aumenta en las cinco estrategias: ALLC 0,828 a 0,937, ALLD 0,093 a 0,100, RANDOM 0,231 a 0,410, GRIM 0,828 a 0,952 y TFT 0,827 a 0,962. Los ANOVA por modelo reportan efectos de estrategia, condición e interacción con p<0,001; los contrastes simples se corrigen con Holm dentro de cada conjunto. Aumentar cooperación frente a ALLD o RANDOM puede reducir el payoff por mayor exposición a explotación.
GPT-5 muestra además un efecto de horizonte: coopera con frecuencia durante la partida y defrauda mucho más en la décima ronda. En el ZIP, su cooperación final del baseline es aproximadamente 0,8 % agregada sobre estrategias, frente a 56,14 % en todas las rondas. Dado que el agente conoce que la ronda 10 es la última, ese patrón es compatible con optimización de final de juego. No demuestra por sí solo una capacidad de razonamiento superior ni una diferencia generacional causada por la arquitectura: los tres modelos son sistemas distintos, ejecutados con APIs y controles distintos y sin un diseño que aísle generación, razonamiento, entrenamiento o fecha.
El experimento 3 sustituye, de una en una, cada dimensión por 1 o por 5 y conserva los otros cuatro promedios. Las diez condiciones repiten 100 partidas de diez rondas contra cinco estrategias: 50.000 decisiones por modelo y 150.000 en total. La amabilidad es la manipulación con mayor diferencia. Con A=1, GPT-4o y GPT-5 defraudan en el 100 % de las 5.000 decisiones de sus cinco oponentes; con A=5, la cooperación media sobre estrategias pasa a aproximadamente 0,846 en GPT-4o y 0,777 en GPT-5. GPT-3.5 también baja con A=1 y sube con A=5, aunque no llega al patrón todo-o-nada. Otras dimensiones producen efectos más pequeños y dependientes del modelo y del oponente; varias comparaciones son estadísticamente significativas, especialmente en GPT-5.
El principal problema de identificación está en el tratamiento. El prompt no cambia solo un número ni induce un rasgo latente de forma independiente: añade una traducción natural de cada score. Para A=1 dice que el agente es “highly competitive and skeptical”, que prioriza fuertemente el interés propio y es confrontacional; para A=5 dice que es “highly cooperative and trusting” y prioriza fuertemente la armonía y el bienestar ajeno. “Cooperative” y “competitive/self-interest” son instrucciones directamente relevantes para elegir Cooperate o Defect en el juego. Por tanto, el resultado demuestra una fuerte sensibilidad conductual a ese paquete de instrucciones, pero no separa amabilidad psicométrica, obediencia léxica, framing moral y estrategia.
El artículo argumenta que la adaptación al oponente descarta un simple pattern matching. No lo descarta: un modelo puede seguir una instrucción explícita de ser cooperativo o competitivo y, a la vez, condicionar la respuesta al historial y al payoff. Faltan controles decisivos, como presentar solo números sin glosa, usar descripciones de amabilidad que no incluyan cooperación, aplicar paráfrasis contrabalanceadas, enmascarar los nombres de acción, separar el objetivo de maximizar puntos de las instrucciones sociales y verificar mediación entre texto, score y conducta.
La estadística publicada usa como observación la tasa de cooperación de cada partida de diez rondas, lo que evita tratar cada ronda secuencial como independiente. Sin embargo, los ANOVA y t-tests lineales operan sobre proporciones acotadas con fuertes techos, suelos y muchas celdas de varianza cero; el suplemento llega a t infinito en comparaciones todo-cero contra todo-uno. No se publican diagnósticos de normalidad u homocedasticidad, intervalos robustos ni un modelo binomial o jerárquico. En el experimento 3 se realizan 30 ANOVA de manipulación y numerosos efectos simples; Holm se aplica por bloques de cinco estrategias, no como corrección global de toda la familia de decisiones. Valores marginales como p=0,0496 deben interpretarse con cautela.
La auditoría completa del ZIP de Zenodo verifica 180.000 filas de ronda: 30.000 del experimento 2 y 150.000 del experimento 3. Todas tienen acciones binarias válidas y pagos que coinciden con la matriz, y RANDOM coopera en 49,90 % de 36.000 acciones. Las 60 respuestas BFI únicas contienen las 44 respuestas requeridas. Las 180.000 decisiones únicas del juego son parseables; las únicas variantes no estrictas observadas son comillas o punto alrededor de Cooperate/Defect. Por ello, el fallback del código a Cooperate ante error o respuesta ilegible no alteró las decisiones publicadas según los logs disponibles.
El artefacto no está limpio como paquete de procedencia. Los seis CSV de prompts contienen 345.000 filas de decisión porque cada archivo no_prompt vuelve a incluir las 55.000 decisiones numbers_and_language del mismo modelo: hay 165.000 duplicados exactos y 180.000 decisiones únicas. Además, todas las decisiones, incluidas las manipulaciones, llevan experiment_type=control_pd. Los logs permiten reconstruir inputs y outputs, pero esas etiquetas no distinguen correctamente el tratamiento. El ZIP ocupa 54,1 MB comprimido y 2,49 GB descomprimido principalmente por repetir prompts largos.
El código público compila y sus dependencias declaradas se instalan e importan en un entorno limpio actual. Aun así, no reproduce el paper de forma ejecutable con sus defaults: config.json usa cinco repeticiones BFI y veinte partidas, frente a veinte y cien en el artículo; los nombres gpt-3.5-turbo, gpt-4o y gpt-5 son aliases mutables, no snapshots; las dependencias tienen solo límites inferiores; RANDOM no fija seed; y no hay tests, CI, lockfile o licencia de repositorio. Hay ocho .pyc de Python 3.12 versionados.
El parser del juego busca substrings y dígitos y devuelve Cooperate ante respuesta no reconocida, excepción del modelo o error del oponente. ModelClient también convierte varios fallos transitorios en cadena vacía. Los logs liberados no muestran que ese sesgo afectara este dataset, pero el código no registra una bandera de fallback y podría convertir fallos futuros en cooperación aparente. La reproducibilidad estadística también queda incompleta: los tres notebooks públicos importan f_oneway y ttest_ind, pero no contienen la implementación de los ANOVA factoriales ni de la corrección Holm de la versión aceptada. El repositorio no ofrece un comando único que regenere tablas y figuras desde Zenodo.
El suplemento añade sensibilidad del BFI a temperaturas 0, 0,1, 0,5, 0,7 y 1 para GPT-3.5/GPT-4o y a reasoning effort minimal, low, medium y high para GPT-5. Afirma que cambian más las desviaciones que los promedios, pero publica las curvas sin tablas numéricas. El ZIP principal no contiene esos runs y los resultados Re_BFI versionados en GitHub usan cinco repeticiones, por lo que esa extensión no se puede reconstruir exactamente con los artefactos publicados.
La contribución defendible es un benchmark transparente de sensibilidad de tres APIs de OpenAI a descripciones Big Five en un juego secuencial sencillo, con datos de ronda suficientemente completos para reproducir las tasas publicadas. Demuestra que el framing de personalidad puede cambiar mucho las acciones, sobre todo cuando la descripción de amabilidad nombra directamente cooperación, confianza, competición e interés propio. No demuestra que los LLM posean una personalidad humana estable, que amabilidad sea el mecanismo causal separado del texto de la instrucción, que GPT-5 sea intrínsecamente una generación estratégica superior ni que los efectos generalicen a otros proveedores, snapshots, juegos, horizontes o interacción entre agentes abiertos.