Effects of personality steering on cooperative behavior in Large Language Model agents

Inducción y control de rasgos2026arXivRevisión editorial aprobada

Autores: Mizuki Sakai, Mizuki Yokoyama, Wakaba Tateishi, Genki Ichinose

Palabras clave: Large Language Models, Personality, Big Five, Bias, Persona

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
15
Hallazgos
35
Limitaciones
6
Evidencias

Resumen editorial

Español

El artículo estudia si describir a un agente LLM mediante los Big Five cambia su cooperación en un dilema del prisionero repetido. Esta revisión usa la versión aceptada y publicada como Article in Press en Scientific Reports el 2 de junio de 2026, no solo el preprint: 21 páginas de artículo, 15 de suplemento, el ZIP público de Zenodo y el repositorio de código en el commit 467ad9831ea7e5fbd4a3092d747e411e3af8e77c.

El trabajo tiene tres experimentos. En el primero, GPT-3.5-turbo, GPT-4o y GPT-5 contestan el BFI-44 veinte veces cada uno. Los promedios publicados son, en el orden apertura, responsabilidad, extraversión, amabilidad y neuroticismo: GPT-3.5 4,58, 4,06, 3,78, 4,24 y 1,96; GPT-4o 4,68, 4,12, 3,15, 4,27 y 1,98; GPT-5 4,69, 4,69, 3,10, 4,27 y 2,11. La tabla compara estos valores con una muestra humana reescalada y destaca que las desviaciones de las veinte ejecuciones del mismo modelo son menores que las desviaciones entre personas.

Esa comparación no permite concluir que el LLM tenga una personalidad interna estable o una medición psicométrica más fiable. La varianza del modelo es variación de muestreo al repetir un único sistema bajo un prompt, mientras que la humana es variación entre individuos distintos; son unidades de variación diferentes. Tampoco se informan consistencia interna por escala, test-retest con prompts alternativos, validez factorial, aquiescencia, validez convergente o criterio externo. Los scores altos en apertura, responsabilidad y amabilidad y bajos en neuroticismo pueden reflejar respuesta socialmente deseable o alineamiento del modelo, no rasgos psicológicos.

En el experimento 2, cada modelo juega contra ALLC, ALLD, RANDOM al 50 %, GRIM y TFT. Para cada oponente y condición se ejecutan 100 partidas independientes de diez rondas. Se compara un baseline sin perfil con una condición que inserta los cinco scores medidos y descripciones naturales. Son 10.000 decisiones por modelo, 30.000 en total. Las sesiones se reinician por partida, el horizonte de diez rondas se declara y la matriz de pago es T=5, R=3, P=1 y S=0.

Los datos y el suplemento reproducen el resultado principal del experimento 2. En GPT-3.5, la cooperación sube significativamente frente a ALLD de 0,602 a 0,774 y frente a RANDOM de 0,745 a 0,879, pero no cambia de forma significativa frente a ALLC, GRIM o TFT. En GPT-4o sube frente a ALLD de 0,100 a 0,216 y frente a RANDOM de 0,206 a 0,743. En GPT-5 aumenta en las cinco estrategias: ALLC 0,828 a 0,937, ALLD 0,093 a 0,100, RANDOM 0,231 a 0,410, GRIM 0,828 a 0,952 y TFT 0,827 a 0,962. Los ANOVA por modelo reportan efectos de estrategia, condición e interacción con p<0,001; los contrastes simples se corrigen con Holm dentro de cada conjunto. Aumentar cooperación frente a ALLD o RANDOM puede reducir el payoff por mayor exposición a explotación.

GPT-5 muestra además un efecto de horizonte: coopera con frecuencia durante la partida y defrauda mucho más en la décima ronda. En el ZIP, su cooperación final del baseline es aproximadamente 0,8 % agregada sobre estrategias, frente a 56,14 % en todas las rondas. Dado que el agente conoce que la ronda 10 es la última, ese patrón es compatible con optimización de final de juego. No demuestra por sí solo una capacidad de razonamiento superior ni una diferencia generacional causada por la arquitectura: los tres modelos son sistemas distintos, ejecutados con APIs y controles distintos y sin un diseño que aísle generación, razonamiento, entrenamiento o fecha.

El experimento 3 sustituye, de una en una, cada dimensión por 1 o por 5 y conserva los otros cuatro promedios. Las diez condiciones repiten 100 partidas de diez rondas contra cinco estrategias: 50.000 decisiones por modelo y 150.000 en total. La amabilidad es la manipulación con mayor diferencia. Con A=1, GPT-4o y GPT-5 defraudan en el 100 % de las 5.000 decisiones de sus cinco oponentes; con A=5, la cooperación media sobre estrategias pasa a aproximadamente 0,846 en GPT-4o y 0,777 en GPT-5. GPT-3.5 también baja con A=1 y sube con A=5, aunque no llega al patrón todo-o-nada. Otras dimensiones producen efectos más pequeños y dependientes del modelo y del oponente; varias comparaciones son estadísticamente significativas, especialmente en GPT-5.

El principal problema de identificación está en el tratamiento. El prompt no cambia solo un número ni induce un rasgo latente de forma independiente: añade una traducción natural de cada score. Para A=1 dice que el agente es “highly competitive and skeptical”, que prioriza fuertemente el interés propio y es confrontacional; para A=5 dice que es “highly cooperative and trusting” y prioriza fuertemente la armonía y el bienestar ajeno. “Cooperative” y “competitive/self-interest” son instrucciones directamente relevantes para elegir Cooperate o Defect en el juego. Por tanto, el resultado demuestra una fuerte sensibilidad conductual a ese paquete de instrucciones, pero no separa amabilidad psicométrica, obediencia léxica, framing moral y estrategia.

El artículo argumenta que la adaptación al oponente descarta un simple pattern matching. No lo descarta: un modelo puede seguir una instrucción explícita de ser cooperativo o competitivo y, a la vez, condicionar la respuesta al historial y al payoff. Faltan controles decisivos, como presentar solo números sin glosa, usar descripciones de amabilidad que no incluyan cooperación, aplicar paráfrasis contrabalanceadas, enmascarar los nombres de acción, separar el objetivo de maximizar puntos de las instrucciones sociales y verificar mediación entre texto, score y conducta.

La estadística publicada usa como observación la tasa de cooperación de cada partida de diez rondas, lo que evita tratar cada ronda secuencial como independiente. Sin embargo, los ANOVA y t-tests lineales operan sobre proporciones acotadas con fuertes techos, suelos y muchas celdas de varianza cero; el suplemento llega a t infinito en comparaciones todo-cero contra todo-uno. No se publican diagnósticos de normalidad u homocedasticidad, intervalos robustos ni un modelo binomial o jerárquico. En el experimento 3 se realizan 30 ANOVA de manipulación y numerosos efectos simples; Holm se aplica por bloques de cinco estrategias, no como corrección global de toda la familia de decisiones. Valores marginales como p=0,0496 deben interpretarse con cautela.

La auditoría completa del ZIP de Zenodo verifica 180.000 filas de ronda: 30.000 del experimento 2 y 150.000 del experimento 3. Todas tienen acciones binarias válidas y pagos que coinciden con la matriz, y RANDOM coopera en 49,90 % de 36.000 acciones. Las 60 respuestas BFI únicas contienen las 44 respuestas requeridas. Las 180.000 decisiones únicas del juego son parseables; las únicas variantes no estrictas observadas son comillas o punto alrededor de Cooperate/Defect. Por ello, el fallback del código a Cooperate ante error o respuesta ilegible no alteró las decisiones publicadas según los logs disponibles.

El artefacto no está limpio como paquete de procedencia. Los seis CSV de prompts contienen 345.000 filas de decisión porque cada archivo no_prompt vuelve a incluir las 55.000 decisiones numbers_and_language del mismo modelo: hay 165.000 duplicados exactos y 180.000 decisiones únicas. Además, todas las decisiones, incluidas las manipulaciones, llevan experiment_type=control_pd. Los logs permiten reconstruir inputs y outputs, pero esas etiquetas no distinguen correctamente el tratamiento. El ZIP ocupa 54,1 MB comprimido y 2,49 GB descomprimido principalmente por repetir prompts largos.

El código público compila y sus dependencias declaradas se instalan e importan en un entorno limpio actual. Aun así, no reproduce el paper de forma ejecutable con sus defaults: config.json usa cinco repeticiones BFI y veinte partidas, frente a veinte y cien en el artículo; los nombres gpt-3.5-turbo, gpt-4o y gpt-5 son aliases mutables, no snapshots; las dependencias tienen solo límites inferiores; RANDOM no fija seed; y no hay tests, CI, lockfile o licencia de repositorio. Hay ocho .pyc de Python 3.12 versionados.

El parser del juego busca substrings y dígitos y devuelve Cooperate ante respuesta no reconocida, excepción del modelo o error del oponente. ModelClient también convierte varios fallos transitorios en cadena vacía. Los logs liberados no muestran que ese sesgo afectara este dataset, pero el código no registra una bandera de fallback y podría convertir fallos futuros en cooperación aparente. La reproducibilidad estadística también queda incompleta: los tres notebooks públicos importan f_oneway y ttest_ind, pero no contienen la implementación de los ANOVA factoriales ni de la corrección Holm de la versión aceptada. El repositorio no ofrece un comando único que regenere tablas y figuras desde Zenodo.

El suplemento añade sensibilidad del BFI a temperaturas 0, 0,1, 0,5, 0,7 y 1 para GPT-3.5/GPT-4o y a reasoning effort minimal, low, medium y high para GPT-5. Afirma que cambian más las desviaciones que los promedios, pero publica las curvas sin tablas numéricas. El ZIP principal no contiene esos runs y los resultados Re_BFI versionados en GitHub usan cinco repeticiones, por lo que esa extensión no se puede reconstruir exactamente con los artefactos publicados.

La contribución defendible es un benchmark transparente de sensibilidad de tres APIs de OpenAI a descripciones Big Five en un juego secuencial sencillo, con datos de ronda suficientemente completos para reproducir las tasas publicadas. Demuestra que el framing de personalidad puede cambiar mucho las acciones, sobre todo cuando la descripción de amabilidad nombra directamente cooperación, confianza, competición e interés propio. No demuestra que los LLM posean una personalidad humana estable, que amabilidad sea el mecanismo causal separado del texto de la instrucción, que GPT-5 sea intrínsecamente una generación estratégica superior ni que los efectos generalicen a otros proveedores, snapshots, juegos, horizontes o interacción entre agentes abiertos.

English

The article asks whether describing an LLM agent with Big Five traits changes cooperation in a repeated Prisoner's Dilemma. This review uses the accepted Article in Press published by Scientific Reports on 2 June 2026 rather than only the preprint: the 21-page main article, 15-page supplement, public Zenodo ZIP, and code repository at commit 467ad9831ea7e5fbd4a3092d747e411e3af8e77c.

The study contains three experiments. In Experiment 1, GPT-3.5-turbo, GPT-4o, and GPT-5 each answer the BFI-44 twenty times. Published means, ordered as openness, conscientiousness, extraversion, agreeableness, and neuroticism, are 4.58, 4.06, 3.78, 4.24, and 1.96 for GPT-3.5; 4.68, 4.12, 3.15, 4.27, and 1.98 for GPT-4o; and 4.69, 4.69, 3.10, 4.27, and 2.11 for GPT-5. The table compares these values with a rescaled human sample and emphasizes that standard deviations across twenty runs of one model are smaller than standard deviations across people.

That comparison cannot establish that an LLM has a stable internal personality or a more reliable psychometric measurement. Model variance is sampling variation from repeatedly querying one system under one prompt, whereas human variance is between different people; they are different units of variation. The study does not report scale-level internal consistency, alternate-prompt test-retest reliability, factorial validity, acquiescence, convergent validity, or an external criterion. High openness, conscientiousness, and agreeableness and low neuroticism may reflect socially desirable responding or alignment rather than psychological traits.

In Experiment 2, each model plays ALLC, ALLD, 50% RANDOM, GRIM, and TFT. For every opponent and condition, the study runs 100 independent ten-round games. It compares a baseline without a profile against a condition that inserts all five measured scores and natural-language descriptions. This yields 10,000 decisions per model and 30,000 total. Sessions restart for each game, the ten-round horizon is disclosed, and payoffs are T=5, R=3, P=1, and S=0.

The released data and supplement reproduce the main Experiment 2 result. For GPT-3.5, cooperation significantly rises against ALLD from .602 to .774 and RANDOM from .745 to .879, with no significant change for ALLC, GRIM, or TFT. For GPT-4o, it rises against ALLD from .100 to .216 and RANDOM from .206 to .743. For GPT-5, it increases for every strategy: ALLC .828 to .937, ALLD .093 to .100, RANDOM .231 to .410, GRIM .828 to .952, and TFT .827 to .962. Model-specific ANOVAs report strategy, condition, and interaction effects at p<.001; simple contrasts are Holm-corrected within each set. More cooperation against ALLD or RANDOM can lower payoff by increasing exposure to exploitation.

GPT-5 also shows a horizon effect: it often cooperates during a game and defects much more in round ten. In the ZIP, final-round baseline cooperation is about 0.8% when aggregated across strategies, versus 56.14% across all rounds. Because the prompt states that round ten is final, this is consistent with end-game optimization. It does not by itself establish superior reasoning or a generation effect caused by architecture: the three systems differ in model, date, API controls, and training, and the design does not isolate any of those factors.

Experiment 3 replaces one dimension at a time with 1 or 5 while keeping the other four means fixed. The ten conditions repeat 100 ten-round games against five strategies, producing 50,000 decisions per model and 150,000 total. Agreeableness produces the largest difference. At A=1, GPT-4o and GPT-5 defect on all 5,000 decisions across their five opponents; at A=5, mean cooperation across strategies is about .846 for GPT-4o and .777 for GPT-5. GPT-3.5 also cooperates less at A=1 and more at A=5, without the all-or-nothing pattern. Other traits have smaller, model- and opponent-dependent effects, with several significant comparisons, especially for GPT-5.

The main identification problem is the treatment itself. The prompt does not alter only a number or independently induce a latent trait; it adds a natural-language translation of each score. At A=1, it says the agent is “highly competitive and skeptical,” strongly prioritizes self-interest, and is confrontational. At A=5, it says the agent is “highly cooperative and trusting” and strongly prioritizes harmony and others' well-being. “Cooperative” and “competitive/self-interest” are instructions directly relevant to choosing Cooperate or Defect. The result therefore demonstrates strong behavioral sensitivity to this instruction bundle, but it does not separate psychometric agreeableness, lexical compliance, moral framing, and game strategy.

The paper argues that opponent-sensitive behavior rules out simple pattern matching. It does not: a model can follow an explicit instruction to be cooperative or competitive while also conditioning on history and payoff. Decisive controls are missing, including score-only prompts without glosses, agreeableness descriptions that avoid cooperation terms, counterbalanced paraphrases, masked action labels, separation of point-maximization from social instructions, and mediation tests between wording, score, and action.

The published statistics use each ten-round game's cooperation rate as an observation, avoiding the stronger error of treating sequential rounds as independent. However, linear ANOVAs and t-tests are applied to bounded proportions with severe ceiling, floor, and zero-variance cells; the supplement reports infinite t values for all-zero versus all-one comparisons. It provides no normality or homoscedasticity diagnostics, robust intervals, or binomial/hierarchical model. Experiment 3 runs 30 manipulation ANOVAs and many simple effects. Holm correction is applied in five-strategy blocks rather than globally across the decision family, so marginal results such as p=.0496 warrant caution.

A full streaming audit of the Zenodo ZIP verifies 180,000 round rows: 30,000 from Experiment 2 and 150,000 from Experiment 3. Every row has valid binary actions and payoffs matching the matrix, and RANDOM cooperates on 49.90% of 36,000 actions. All 60 unique BFI outputs contain the required 44 answers. All 180,000 unique game decisions are parseable; the only non-exact variants put quotes or a period around Cooperate/Defect. The code's fallback to Cooperate on errors or unparseable text therefore did not alter the released decisions according to the available logs.

The artifact is not clean as a provenance package. Its six prompt CSVs contain 345,000 decision rows because each no_prompt file repeats the same model's 55,000 numbers_and_language decisions: 165,000 exact duplicates and 180,000 unique decisions. All decisions, including manipulated conditions, are labeled experiment_type=control_pd. The logs preserve inputs and outputs, but those labels do not correctly distinguish treatment. The ZIP is 54.1 MB compressed and 2.49 GB uncompressed, largely because long prompts are repeated.

The public code compiles, and its declared dependencies install and import in a clean current environment. It still does not reproduce the paper from its defaults: config.json uses five BFI repetitions and twenty games versus twenty and one hundred in the article; gpt-3.5-turbo, gpt-4o, and gpt-5 are mutable aliases rather than snapshots; dependencies have only lower bounds; RANDOM has no seed; and there are no tests, CI, lockfile, or repository license. Eight Python 3.12 .pyc files are tracked.

The game parser searches substrings and digits and returns Cooperate after an unrecognized response, model exception, or opponent error. ModelClient also converts several transient failures to an empty string. The released logs do not show this bias affecting the published dataset, but the code records no fallback flag and could turn future failures into apparent cooperation. Statistical reproducibility is also incomplete: the three public notebooks import f_oneway and ttest_ind but do not implement the accepted paper's factorial ANOVAs or Holm procedure. There is no single command that regenerates published tables and figures from Zenodo.

The supplement adds a BFI sensitivity exercise at temperatures 0, .1, .5, .7, and 1 for GPT-3.5/GPT-4o and reasoning effort minimal, low, medium, and high for GPT-5. It says settings affect standard deviations more than means, but presents curves without numerical tables. The main ZIP does not contain these runs, and tracked Re_BFI results on GitHub use five repeats, so the extension cannot be reconstructed exactly from the released artifacts.

The defensible contribution is a transparent benchmark of three OpenAI APIs' sensitivity to Big Five descriptions in a simple sequential game, with round-level data sufficient to reproduce published cooperation rates. It demonstrates that personality framing can substantially change actions, especially when agreeableness text directly names cooperation, trust, competition, and self-interest. It does not establish that LLMs possess stable human-like personality, that agreeableness is a causal mechanism separate from instruction wording, that GPT-5 is intrinsically a superior strategic generation, or that effects generalize to other providers, snapshots, games, horizons, or open-ended agent interactions.

Pregunta de investigación

¿Cómo cambia la cooperación de GPT-3.5-turbo, GPT-4o y GPT-5 en un dilema del prisionero repetido al proporcionar sus scores Big Five medidos o manipular una dimensión a 1 o 5?

Método

Tres experimentos: 20 aplicaciones del BFI-44 por modelo; 100 partidas independientes de 10 rondas contra cinco estrategias en baseline y con perfil; y diez manipulaciones por modelo, una dimensión a 1 o 5, con las mismas 100 partidas por estrategia. La versión publicada usa ANOVA bifactorial por modelo y manipulación, efectos simples con Holm, tasas por partida y payoff acumulado. La auditoría revisa artículo, suplemento, 180.000 rondas únicas, 60 BFI completos, prompts, código y reproducibilidad.

Muestra: Tres modelos. Experimento 1: 20 ejecuciones BFI-44 por modelo, 60 perfiles y 2.640 respuestas de ítem. Experimento 2: 2 condiciones × 5 estrategias × 100 partidas × 10 rondas × 3 modelos = 30.000 decisiones. Experimento 3: 10 manipulaciones × 5 estrategias × 100 partidas × 10 rondas × 3 modelos = 150.000 decisiones. Total de juego publicado y validado: 180.000 rondas únicas.

Hallazgos

  • Los scores BFI medios son altos en apertura, responsabilidad y amabilidad y bajos en neuroticismo en los tres modelos.
  • La menor desviación entre 20 runs del mismo modelo que entre personas no prueba estabilidad psicométrica comparable.
  • El perfil medido eleva cooperación sobre todo frente a ALLD y RANDOM en GPT-3.5 y GPT-4o.
  • En GPT-5, el perfil medido incrementa significativamente cooperación frente a las cinco estrategias.
  • El aumento de cooperación frente a oponentes explotadores puede reducir payoff acumulado.
  • GPT-5 muestra una caída fuerte de cooperación en la última ronda conocida.
  • A=1 produce 0% de cooperación en GPT-4o y GPT-5 para las cinco estrategias.
  • A=5 restaura cooperación alta, con respuesta selectiva frente a ALLD y RANDOM.
  • Otras dimensiones tienen efectos menores pero no nulos y varían por modelo y estrategia.
  • La descripción de amabilidad incluye directamente cooperative, competitive, self-interest y harmony, confundiendo rasgo e instrucción.
  • Las 180.000 filas de ronda tienen acciones binarias y pagos consistentes; RANDOM coopera 49,90%.
  • Las 60 respuestas BFI únicas contienen las 44 contestaciones esperadas.
  • Todas las decisiones liberadas son parseables; no hay evidencia de que el fallback a Cooperate alterara este dataset.
  • Los logs contienen 165.000 decisiones duplicadas y etiquetan todas las condiciones como control_pd.
  • El código instala e importa, pero defaults, seeds, snapshots y pipeline estadístico no reproducen exactamente el artículo.

Limitaciones

  • Solo se prueban tres modelos de un proveedor y no hay comparación con otros laboratorios o modelos abiertos.
  • Los nombres de modelo son aliases mutables y no se fijan snapshots ni fechas exactas de API.
  • GPT-5 usa controles de reasoning distintos de temperatura, por lo que las diferencias entre modelos están confundidas.
  • La comparación de desviación LLM y humana mezcla variación intra-sistema con variación interindividual.
  • No se reportan alfa u omega, estructura factorial, aquiescencia, invariancia, test-retest alternativo o criterio externo del BFI.
  • Los perfiles medidos pueden reflejar alineamiento y deseabilidad social, no personalidad.
  • La condición personality-informed cambia cinco números, cinco glosas e instrucciones generales a la vez.
  • La manipulación de amabilidad nombra de forma explícita cooperación, competición e interés propio.
  • No hay control numérico sin glosa ni descripciones sin vocabulario de la acción.
  • No se contrabalancean paráfrasis ni etiquetas Cooperate/Defect.
  • El objetivo de maximizar puntos puede entrar en conflicto con la glosa de cooperación y no se separa experimentalmente.
  • El horizonte finito de diez rondas se anuncia y favorece efectos de final de juego.
  • Solo hay un juego, una matriz de pagos, un horizonte y cinco oponentes deterministas o aleatorios simples.
  • Las tasas por partida son proporciones discretas acotadas con techos, suelos y celdas de varianza cero.
  • ANOVA y t-tests lineales no incluyen diagnósticos ni alternativas binomiales o jerárquicas.
  • El suplemento reporta t infinito en contrastes degenerados.
  • Holm se aplica por bloques de cinco efectos simples, no globalmente a todos los ANOVA y contrastes del experimento 3.
  • La semilla de RANDOM no se fija; los oponentes aleatorios cambian entre condiciones.
  • El parser busca substrings y dígitos, por lo que respuestas explicativas podrían clasificarse mal.
  • Errores de modelo, respuesta vacía o fallo del oponente se convierten silenciosamente en Cooperate.
  • No se registra un flag de fallback que permita excluir o analizar fallos.
  • Los logs publicados no muestran fallbacks reales, pero no garantizan el comportamiento de una rerun.
  • Todos los prompt logs usan experiment_type=control_pd, incluso en manipulaciones.
  • Los CSV de prompts duplican 165.000 decisiones entre carpetas.
  • El ZIP descomprimido ocupa 2,49 GB por repetición extensa de prompts.
  • config.json usa 5 BFI y 20 partidas, no los 20 y 100 publicados.
  • Las dependencias no están fijadas y no hay lockfile.
  • No hay tests, CI o licencia de código detectada.
  • Hay ocho bytecodes .pyc versionados.
  • El repositorio no contiene el ANOVA factorial ni Holm de la versión aceptada.
  • No existe un comando de reproducción integral desde datos hasta tablas y figuras.
  • Los runs completos de sensibilidad a temperatura y reasoning no están en Zenodo.
  • Las curvas de sensibilidad no incluyen valores numéricos tabulados.
  • No se evalúa robustez a prompts adversariales, instrucciones de sistema, roles o memoria larga.
  • No hay participantes humanos, validez ecológica ni evaluación de decisiones de agentes desplegados.

Qué no demuestra

  • No establece que GPT-3.5, GPT-4o o GPT-5 posean personalidad humana estable.
  • No valida el BFI como medición del estado interno de estos modelos.
  • No demuestra que amabilidad sea el mecanismo causal separado del texto cooperative o competitive.
  • No descarta obediencia de instrucciones o pattern matching condicionado por el contexto.
  • No identifica una diferencia causal entre generaciones de modelos.
  • No prueba que reasoning effort cause la selección estratégica de GPT-5.
  • No demuestra que más cooperación sea siempre mejor o más segura.
  • No generaliza a otros proveedores, snapshots, idiomas, juegos, payoffs u horizontes.
  • No predice interacciones entre dos LLM abiertos o entre LLM y humanos.
  • No permite reproducir exactamente los análisis estadísticos publicados con un pipeline versionado.
  • No garantiza que reruns futuros estén libres de cooperación artificial causada por fallbacks.

Trazabilidad

Alcance: Texto completo

Versión: Scientific Reports Article in Press, DOI 10.1038/s41598-026-56163-8, published 2 June 2026; 21-page main article and 15-page supplement

Fuente consultada: https://www.nature.com/articles/s41598-026-56163-8_reference.pdf

Revisión: Codex full-text, bilingual-fidelity, Scientific-Reports, 36-page visual, Zenodo full-stream, prompt-log, code, configuration, parser, reproducibility and statistical audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-3.5-turbo via OpenAI API; mutable alias, exact snapshot not reported
  • GPT-4o via OpenAI API; mutable alias, exact snapshot not reported
  • GPT-5 via OpenAI API with minimal reasoning effort and low verbosity; mutable alias, exact snapshot not reported

Instrumentos y métricas

  • Big Five Inventory 44-item questionnaire, repeated 20 times per model
  • Ten-round repeated Prisoner's Dilemma with T=5, R=3, P=1, S=0
  • Hard-coded ALLC, ALLD, RANDOM 50%, GRIM, and TFT opponents
  • Baseline prompt without personality information
  • Numbers-and-language Big Five profile prompt
  • Extreme single-trait manipulation to score 1 or 5
  • Per-game cooperation rate and cumulative payoff
  • Two-way ANOVA by model or manipulation
  • Independent-samples simple effects with Holm correction within strategy sets

Datos utilizados

  • Zenodo record 19548190, results.zip, 54,103,858 bytes, MD5 5489ae1928206e38cd5a001781de8fd1, CC BY 4.0
  • 180,000 unique round-level game decisions across three models
  • 60 unique complete BFI-44 response sets in the main experiment
  • 345,000 prompt-log decision rows, including 165,000 exact cross-folder duplicates
  • GitHub igenki/SteeringPersonalityLLMCooperation at commit 467ad9831ea7e5fbd4a3092d747e411e3af8e77c

Evidencia y localización

  • Estado editorial, método, resultados y conclusiones: Scientific Reports DOI 10.1038/s41598-026-56163-8 Article in Press, main PDF, pp. 1–21
  • Prompts completos, sensibilidad y tablas ANOVA/Holm: Scientific Reports supplementary PDF, 15 pages, Sections A–C, Figures S1 and Tables S1–S8
  • BFI, 180,000 rondas, acciones, pagos, prompts y duplicados: Zenodo 10.5281/zenodo.19548190 results.zip, MD5 5489ae1928206e38cd5a001781de8fd1; full streaming audit on 15 July 2026
  • Código, configuración, parser, fallbacks y reproducibilidad: GitHub igenki/SteeringPersonalityLLMCooperation commit 467ad9831ea7e5fbd4a3092d747e411e3af8e77c, audited 15 July 2026
  • Integridad visual: All 21 main-article pages and all 15 supplementary pages rendered and visually reviewed
  • Integridad de artefactos: Main PDF SHA-256 8f8b161f...; supplement SHA-256 f987155d...; repository clean import and compile audit in a temporary environment