When Identity Overrides Incentives: Representational Choices as Governance Decisions in Multi-Agent LLM Systems

Sociedad, cultura y comportamiento colectivo2026arXivRevisión editorial aprobada

Título original: When Personas Override Payoffs: Role Identity Bias in Multi-Agent LLM Decision-Making

Autores: Viswonathan Manoranjan, Snehalkumar `Neil' S. Gaikwad

Palabras clave: Large Language Models, Personality, Bias, Persona, AI Safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
17
Hallazgos
70
Limitaciones
12
Evidencias

Resumen editorial

Español

El trabajo estudia cuánto cambian las decisiones de cuatro agentes LLM cuando se modifica la representación del juego. Esta ficha usa arXiv v6, revisado el 30 de mayo de 2026, que lleva el título definitivo «When Identity Overrides Incentives» y declara aceptación en ACM FAccT 2026. Crossref registra la publicación el 25 de junio de 2026 con DOI 10.1145/3805689.3812218 y páginas 7737–7768. La versión abierta de arXiv es el texto completo accesible; el PDF directo de ACM no fue accesible durante la auditoría. No se encontró un repositorio oficial con código, escenarios, matrices, salidas o scripts estadísticos.

El experimento cruza presencia de persona y visibilidad de payoffs en cuatro modelos instruct: Qwen2.5-7B, Qwen2.5-32B, Llama-3.1-8B y Mistral-7B-Instruct-v0.2. Hay 53 juegos narrativos de cuatro jugadores y acciones binarias: 41 escenarios «Green-dominant», donde el perfil Green Transition es Nash y el perfil Tragedy no lo es, y 12 «Tragedy-dominant», donde ocurre lo contrario. Cada modelo × escenario × condición se repite cinco veces: 205 juegos por celda en el primer estrato y 60 en el segundo, 265 por celda y 4.240 juegos conjuntos en el factorial principal. Los cuatro agentes usan el mismo modelo, deciden de forma independiente y simultánea en una sola ronda y entregan acción más una justificación textual. Los modelos se ejecutan localmente con vLLM, temperatura 0,2, top-p 0,9 y 256 tokens; no se publican seeds, hardware ni versiones del entorno.

El contraste no elimina toda la semántica de rol. Sin persona, el sistema todavía identifica Player i y mantiene acciones cargadas semánticamente, POLLUTE/CLEAN, REGULATE/NOREG, CAMPAIGN/NOCAMPAIGN y BUY_CHEAP/SUPPORT_GREEN, con descripciones normativas como «maximizar beneficio», «proteger el ambiente» o «pagar más por productos verdes». Con persona se añaden motivaciones explícitas del industrialista, gobierno, activista y ciudadanía. En payoffs ocultos se conserva la narrativa, que fue construida para reflejar la estructura de incentivos; en payoffs visibles se muestra la tabla completa y se pide razonar sobre Nash. Por tanto, persona y payoff son manipulaciones reales del prompt, pero «identidad» no queda aislada de etiquetas de acción, objetivo estratégico, información, carga cognitiva y encuadre narrativo.

El resultado descriptivo principal sí es claro dentro de este banco. En los 12 escenarios Tragedy-dominant, Llama y Mistral alcanzan 0 % Nash en las cuatro condiciones. Qwen-32B pasa a 54/60 (90 %) y Qwen-7B a 39/60 (65 %) solo cuando no hay persona y los payoffs son visibles; Qwen-7B alcanza 4/60 (6,7 %) en dos condiciones ocultas. En los 41 escenarios Green-dominant casi todos los modelos obtienen tasas altas con payoffs ocultos o personas, pero mostrar payoffs sin persona reduce la coordinación: Qwen-32B baja a 34/205 (16,6 %), Qwen-7B a 108/205 (52,7 %), Mistral a 103/205 (50,2 %) y Llama a 191/205 (93,2 %). Esto demuestra sensibilidad fuerte y heterogénea al formato de representación; no demuestra por sí solo que una capacidad estratégica latente sea «anulada» causalmente por identidad.

La afirmación de que las personas cambian «qué equilibrio se selecciona» requiere especial cautela. Los dos perfiles canónicos no son dos equilibrios disponibles dentro del mismo juego: cada escenario se construye para que solo uno de ellos sea Nash. El análisis Green frente a Tragedy agrupa 41 juegos Green-dominant con 12 juegos Tragedy-dominant y luego condiciona en haber alcanzado Nash. Que más del 99 % de los Nash agrupados sean Green refleja a la vez el desequilibrio 41:12, la mayor facilidad de los juegos Green y el fracaso en los juegos Tragedy. No identifica una elección entre dos equilibrios bajo incentivos idénticos. «Socialmente preferido» también es una etiqueta normativa fijada por los autores, no una utilidad social medida.

La versión aceptada presenta contradicciones internas que impiden tratar las cifras como un artefacto plenamente reproducible. En la Tabla 5, por ejemplo, Llama-Hidden informa 205 resultados Nash pero 232 Green, aunque el método define Green/Tragedy como subtipos de resultados Nash; Mistral-Hidden muestra 205 Nash y 240 Green. La Tabla 9 dice que varias clases pueden coocurrir y muestra cero resultados Tragedy en todas las filas económicas, mientras las Tablas 8 y 13 atribuyen 54 y 39 Nash Tragedy a Qwen visible-sin-persona y 93 resultados Tragedy agrupados. El texto de Appendix G también afirma que Tragedy está ausente en Tablas 5–10. Además, la Tabla 11 publica Cramér V=0,54 y 0,38 para chi-cuadrado 209,03 y 105,91 con N=240; la fórmula estándar da aproximadamente 0,93 y 0,66, que son los valores usados en el cuerpo. Sin datos y código no puede resolverse qué tablas proceden de qué versión del pipeline.

La inferencia estadística tampoco modela la estructura del diseño. Las cinco repeticiones del mismo escenario y las cuatro condiciones emparejadas se cuentan como juegos «independientes» en chi-cuadrado y Fisher. Eso ignora clustering por escenario, medidas repetidas entre condiciones y dependencia por modelo; p-values extremos pueden reflejar pseudorreplicación. Haría falta un análisis estratificado o multinivel, con escenario como unidad y efectos de condición, interacción y modelo, además de intervalos y seeds. La sensibilidad de siete formulaciones de persona muestra que el wording cambia outputs, pero GPT-5 generó esas variantes, no se publica el procedimiento completo de selección y el test Kruskal–Wallis no establece que la variabilidad sea igual entre modelos porque p=0,27.

El análisis de justificaciones no aporta una explicación mecánica. Cuenta palabras deterministas en racionales solicitadas al propio modelo y etiqueta combinaciones como «identity-driven» o «payoff-optimal». Las categorías se solapan, payoff aparece en más de una, ignoran negación, contexto y número de ocurrencias por respuesta, y no tienen validación humana o semántica. Una frecuencia de 997 menciones por 1.000 racionales se narra como «99,7 % game-theoretic reasoning», aunque no es una tasa validada de razonamiento correcto. Las racionalizaciones post hoc tampoco garantizan fidelidad al proceso generativo. Por ello esta ficha no deriva el resumen de palabras del abstract ni acepta el conteo de keywords como mecanismo.

La contribución defendible es un experimento controlado que alerta de un riesgo real de configuración: prompts de rol, presentación de payoffs, etiquetas y familia de modelo pueden producir resultados radicalmente distintos en una simulación multiagente. Sirve para exigir documentación y análisis de sensibilidad antes de presentar agentes como predictores neutrales. No valida una teoría general de «identidad sobre incentivos», no representa comportamiento humano o institucional, no compara con participantes humanos y no justifica desplegar estos agentes para gobernanza.

English

The paper studies how strongly four-agent LLM decisions change when the representation of a game is modified. This record uses arXiv v6, revised on 30 May 2026, which carries the definitive title “When Identity Overrides Incentives” and reports acceptance at ACM FAccT 2026. Crossref records publication on 25 June 2026 under DOI 10.1145/3805689.3812218, pages 7737–7768. The open arXiv version is the accessible full text; the direct ACM PDF was not accessible during this audit. No official repository containing code, scenarios, payoff matrices, outputs, or statistical scripts was found.

The experiment crosses persona presence and payoff visibility for four instruction-tuned models: Qwen2.5-7B, Qwen2.5-32B, Llama-3.1-8B, and Mistral-7B-Instruct-v0.2. It uses 53 narrative four-player binary-action games: 41 “Green-dominant” scenarios in which the Green Transition profile is Nash and the Tragedy profile is not, and 12 “Tragedy-dominant” scenarios with the reverse structure. Each model × scenario × condition combination is repeated five times, yielding 205 games per cell in the first stratum and 60 in the second, 265 per cell and 4,240 joint games in the main factorial. Four agents use the same model, decide independently and simultaneously in a single round, and return an action plus textual rationale. Models run locally through vLLM with temperature 0.2, top-p 0.9, and 256 output tokens; seeds, hardware, and environment versions are not reported.

The contrast does not remove all role semantics. Without personas, the system still identifies Player i and retains semantically loaded actions, POLLUTE/CLEAN, REGULATE/NOREG, CAMPAIGN/NOCAMPAIGN, and BUY_CHEAP/SUPPORT_GREEN, with normative descriptions such as maximizing profit, protecting the environment, or paying more for green products. Personas add explicit industrialist, government, activist, and citizen motivations. Hidden-payoff prompts retain narratives constructed to reflect the incentive structure; visible-payoff prompts display the complete matrix and request Nash reasoning. Persona and payoff visibility are therefore genuine prompt interventions, but “identity” is not isolated from action labels, strategic objective, information, cognitive load, and narrative framing.

The core descriptive result is clear within this benchmark. In the 12 Tragedy-dominant scenarios, Llama and Mistral attain 0% Nash under all four conditions. Qwen-32B reaches 54/60 (90%) and Qwen-7B 39/60 (65%) only with no persona and visible payoffs; Qwen-7B reaches 4/60 (6.7%) in two hidden conditions. In the 41 Green-dominant scenarios, most models attain high Nash rates with hidden payoffs or personas, but visible payoffs without personas disrupt coordination: Qwen-32B falls to 34/205 (16.6%), Qwen-7B to 108/205 (52.7%), Mistral to 103/205 (50.2%), and Llama to 191/205 (93.2%). This demonstrates strong, model-specific sensitivity to representation format. It does not by itself show that a latent strategic capability is causally overridden by identity.

The claim that personas change “which equilibrium is selected” requires particular caution. The two canonical profiles are not two equilibria available within the same game: each scenario is constructed so that only one of them is Nash. The Green-versus-Tragedy analysis pools 41 Green-dominant games with 12 Tragedy-dominant games and then conditions on Nash attainment. The finding that more than 99% of pooled Nash outcomes are Green simultaneously reflects the 41:12 imbalance, easier Green games, and failure on Tragedy games. It does not identify a choice between two equilibria under identical incentives. “Socially preferred” is also a normative author label rather than a measured social utility.

The accepted version contains internal contradictions that prevent the numbers from being treated as a fully reproducible artifact. Table 5, for example, reports 205 Nash but 232 Green outcomes for Llama-Hidden, even though the method defines Green/Tragedy as subtypes of Nash outcomes; Mistral-Hidden reports 205 Nash and 240 Green. Table 9 says outcome classes can co-occur and reports zero Tragedy outcomes in every economic row, while Tables 8 and 13 attribute 54 and 39 Tragedy Nash outcomes to visible-no-persona Qwen and 93 pooled Tragedy outcomes. Appendix G also states that Tragedy outcomes are absent throughout Tables 5–10. Table 11 reports Cramér's V=0.54 and 0.38 for chi-square values 209.03 and 105.91 at N=240; the standard formula yields approximately 0.93 and 0.66, which are the values used in the main text. Without data and code, it is impossible to determine which tables correspond to which pipeline version.

The inferential tests do not model the experimental structure. Five repetitions of each scenario and matched conditions are counted as “independent games” in chi-square and Fisher tests, ignoring scenario clustering, repeated measures across conditions, and dependence within model. Extremely small p-values may therefore be amplified by pseudoreplication. A stratified or multilevel analysis should use scenario as the unit, model condition interactions, seeds, and uncertainty intervals. Seven persona formulations show output sensitivity to wording, but GPT-5 generated those variants, the full selection procedure is unavailable, and a non-significant Kruskal–Wallis result at p=0.27 does not establish equal sensitivity across models.

The rationale analysis does not establish a mechanism. It deterministically counts words in model-supplied rationales and labels combinations as “identity-driven” or “payoff-optimal.” Categories overlap, ignore negation and context, allow multiple mentions per response, and lack semantic or human validation. A frequency of 997 mentions per 1,000 rationales is described as “99.7% game-theoretic reasoning,” although it is not a validated rate of correct reasoning. Post-hoc rationales are not guaranteed to faithfully reveal the generative process. This record therefore does not derive its summary from abstract keywords or accept keyword counts as mechanistic evidence.

The defensible contribution is a controlled warning about a genuine configuration risk: role prompts, payoff presentation, action labels, and model family can radically change a multi-agent simulation. It supports documenting configurations and running sensitivity analyses before presenting agent outputs as neutral predictions. It does not validate a general theory of identity overriding incentives, represent human or institutional behavior, compare against human participants, or justify deployment for governance decisions.

Pregunta de investigación

¿Cómo interactúan la presencia de descripciones de persona y la visibilidad de una matriz de payoffs para cambiar el logro y el tipo de equilibrio observado en juegos LLM multiagente, y cuánto dependen esos cambios de la familia de modelo y del wording?

Método

Diseño 2×2 persona/no-persona × payoff oculto/visible en 53 juegos narrativos de cuatro agentes y acciones binarias, separados en 41 juegos Green-dominant y 12 Tragedy-dominant. Cuatro modelos instruct deciden simultánea e independientemente; cada celda modelo×escenario×condición se repite cinco veces. Se clasifica el perfil conjunto como Nash/no-Nash y Green/Tragedy/otro, se aplican chi-cuadrado, Fisher-Holm, Kruskal–Wallis y Mann–Whitney-Holm, y se cuentan keywords en racionales CoT. Siete variantes de persona exploran sensibilidad de wording.

Muestra: El factorial principal contiene 4.240 partidas conjuntas: cuatro modelos × cuatro condiciones × 53 escenarios × cinco repeticiones. Cada partida agrega cuatro respuestas del mismo modelo, para 16.960 decisiones/racionales. Las unidades no son iid: cinco repeticiones comparten escenario, payoff y prompt; las cuatro condiciones están emparejadas por escenario; y los agentes de cada partida comparten modelo.

Hallazgos

  • En escenarios Tragedy-dominant, Qwen2.5-32B alcanza Nash en 54/60 ejecuciones (90 %) solo sin persona y con payoff visible.
  • Qwen2.5-7B alcanza 39/60 (65 %) en esa misma condición y 4/60 (6,7 %) en dos condiciones de payoff oculto.
  • Llama-3.1-8B y Mistral-7B obtienen 0/60 Nash en todas las condiciones Tragedy-dominant.
  • En escenarios Green-dominant, Llama mantiene 93,2–100 % Nash entre condiciones.
  • Mistral cae de 100 % con persona/payoff oculto a 50,2 % sin persona/payoff visible.
  • Qwen2.5-32B cae de 96,1 % sin persona/payoff oculto a 16,6 % sin persona/payoff visible en escenarios Green-dominant.
  • Qwen2.5-7B cae de 95,6 % a 52,7 % bajo ese mismo cambio.
  • Los payoffs visibles no mejoran de forma general la coordinación; pueden mejorar Tragedy-dominant y empeorar Green-dominant.
  • Los efectos difieren fuertemente por familia y tamaño de modelo.
  • Siete formulaciones de persona producen de media 2,2–2,4 clasificaciones distintas por escenario, con máximos de cinco.
  • El test Kruskal–Wallis reporta p=0,27 para diferencias de sensibilidad entre modelos; esto es ausencia de evidencia, no equivalencia.
  • Más del 99 % de los Nash agrupados en tres condiciones son Green, pero el análisis mezcla 41 escenarios Green con 12 Tragedy y condiciona en alcanzar Nash.
  • La Tabla 13 registra 93 resultados Tragedy agrupados para Qwen en visible-sin-persona, en conflicto con tablas de desglose que informan cero Tragedy.
  • La Tabla 5 contiene conteos Green mayores que los conteos Nash, contradiciendo la definición de Green como subtipo de Nash.
  • Los Cramér V correctos para los chi-cuadrado económicos de Qwen son aproximadamente 0,93 y 0,66; la Tabla 11 imprime 0,54 y 0,38.
  • Los racionales cambian en vocabulario entre condiciones, pero los conteos deterministas no validan un mecanismo cognitivo.
  • La evidencia sólida es sensibilidad de outputs a configuración, no simulación fiel de actores humanos ni identidad psicológica.

Limitaciones

  • El registro canónico conservaba el título de arXiv v1; la versión definitiva cambió de título y fue publicada en FAccT 2026.
  • El PDF de ACM no fue accesible en la auditoría; se revisó la versión abierta v6 aceptada por los autores.
  • No se encontró repositorio oficial por título actual, título antiguo, arXiv ID o autores.
  • No están disponibles código, 53 escenarios, 53 matrices, outputs, clasificadores ni scripts estadísticos.
  • La ausencia de artefactos impide reproducir las tablas contradictorias y determinar qué pipeline es definitivo.
  • No se informa seed de sampling para ninguna repetición.
  • No se documentan GPU, versión de vLLM, Transformers, tokenizer, CUDA ni precisión numérica.
  • El modelo GPT-5 que ayudó a generar escenarios y variantes no tiene snapshot ni parámetros reportados.
  • Tampoco se publica el prompt exacto ni el historial de selección usado para generar todos los escenarios.
  • El filtrado manual de escenarios no reporta autores/evaluadores, rúbrica, exclusiones o acuerdo.
  • Las narrativas se generan después de fijar el equilibrio y se filtran para alinearse con él, introduciendo señales semánticas deliberadas.
  • Solo se cubre un dominio ambiental/económico construido por los autores.
  • La muestra está desequilibrada: 41 escenarios Green-dominant y 12 Tragedy-dominant.
  • Las conclusiones Tragedy descansan en 12 escenarios y 60 ejecuciones por celda.
  • Cada porcentaje de esos 60 cambia en pasos de 1,67 puntos.
  • Las cinco repeticiones del mismo escenario no son escenarios independientes.
  • Las condiciones comparten escenarios y payoff tables, pero se analizan como observaciones independientes.
  • Los cuatro agentes de una partida usan el mismo modelo y sus acciones forman un único outcome conjunto.
  • Chi-cuadrado y Fisher no modelan clustering por escenario ni medidas repetidas entre condiciones.
  • La denominación «205/60 independent games» es estadísticamente discutible.
  • No se reportan intervalos de confianza o bootstrap por escenario.
  • No se ajusta un modelo factorial que estime persona, payoff e interacción controlando escenario.
  • Las comparaciones por modelo no cuantifican formalmente interacciones entre familias.
  • Los p-values muy pequeños pueden estar inflados por pseudorreplicación.
  • La condición sin persona conserva Player i, action mappings y descripciones con roles normativos.
  • POLLUTE/CLEAN y SUPPORT_GREEN/BUY_CHEAP contienen valencia semántica incluso sin descripción de persona.
  • La instrucción neutral exige actuar estratégicamente y la visible pide Nash, cambiando también el objetivo explícito.
  • Payoff oculto frente a visible cambia cantidad de información y carga cognitiva, no solo visibilidad.
  • En oculto, la narrativa ya codifica el incentivo y puede revelar el perfil deseado mediante palabras de dominio.
  • No hay control con etiquetas abstractas de acciones ni narrativa neutral.
  • No hay ablación separada de role label, action label, motivation, objective y narrative.
  • Los dos perfiles Green y Tragedy no son simultáneamente Nash dentro de un mismo escenario.
  • Cada escenario se clasifica porque un perfil canónico es Nash y el otro no.
  • Agrupar Green y Tragedy no mide selección entre dos equilibrios bajo el mismo juego.
  • El porcentaje Green condicionado en Nash mezcla disponibilidad, dificultad, composición 41:12 y efecto de condición.
  • El análisis agrupado puede inducir una interpretación composicional o tipo Simpson.
  • «Socially preferred» se asigna a Green sin una función de bienestar social o estudio normativo.
  • Nash es estabilidad ante desviación unilateral, no payoff individual máximo, óptimo social ni racionalidad general.
  • Agentes que eligen independientemente sin observar elecciones ajenas pueden fallar coordinación aunque entiendan sus payoffs.
  • No se prueba conocimiento de mejor respuesta individual antes de atribuir el fallo a identidad.
  • No hay baseline de solver, algoritmo aleatorio, estrategia dominante o agente programado.
  • No hay participantes humanos ni datos institucionales para validar realismo conductual.
  • Una ronda simultánea no representa deliberación, negociación, aprendizaje o gobernanza real.
  • El artículo usa prompts de chain-of-thought, pero las justificaciones observadas pueden ser racionalizaciones post hoc.
  • Los diccionarios de keywords son deterministas y no capturan semántica, negación o contexto.
  • Payoff aparece en categorías game-theoretic y payoff-focused, generando solapamiento.
  • Long-term se clasifica como payoff-optimal aunque a menudo expresa sostenibilidad o identidad normativa.
  • Short-term y social-moral se suman como identity-driven sin validación del constructo.
  • Una respuesta puede aportar varias menciones; frecuencia por 1.000 no equivale a porcentaje de racionales.
  • La afirmación «99,7 % game-theoretic reasoning» confunde frecuencia léxica con razonamiento correcto.
  • No hay anotación humana, acuerdo interjuez, clasificador semántico validado ni análisis de errores del conteo.
  • La correlación entre keywords y outcomes no identifica el mecanismo causal de la generación.
  • GPT-5 genera las siete variantes de persona, creando dependencia de un sistema externo no fijado.
  • Las variantes no son una muestra aleatoria o exhaustiva del espacio de prompts.
  • p=0,27 en Kruskal–Wallis no prueba que todos los modelos tengan sensibilidad similar.
  • La Tabla 5 reporta 232 Green con 205 Nash para Llama-Hidden y 240 Green con 205 Nash para Mistral-Hidden.
  • Esos conteos contradicen la definición metodológica de Green/Tragedy como clasificación de outcomes Nash.
  • La Tabla 9 permite coocurrencia de clases y muestra cero Tragedy en todas las filas económicas.
  • Las Tablas 8 y 13 sí atribuyen resultados Nash/Tragedy a Qwen en los mismos brazos.
  • Appendix G afirma que Tragedy está ausente en Tablas 5–10, contradiciendo la narrativa principal y Tabla 13.
  • La Tabla 11 usa valores de Cramér V incompatibles con su propio chi-cuadrado y N.
  • Los odds ratios de la Tabla 14 se imprimen como <1 sin estimación reproducible en varias comparaciones.
  • Algunas figuras y tablas alternan HiddenCoT/Visible, Yes/No y With/WithoutPersona, elevando riesgo de mapeo incorrecto.
  • El texto llama ambientales a los 53 escenarios en algunos puntos aunque 12 se etiquetan economic pressure.
  • No se audita sensibilidad a orden de opciones, orden de filas de payoff, idioma o paráfrasis de narrativa.
  • No se evalúan modelos cerrados contemporáneos ni modelos mayores de 32B.
  • No se estudian arquitecturas heterogéneas donde cada rol use un modelo distinto.
  • No se evalúa contaminación de entrenamiento, memorización de juegos o conocimiento previo del framing.
  • La generalización a otros dominios, más agentes, acciones continuas o interacción repetida permanece abierta.
  • La aceptación por pares no resuelve las contradicciones de tablas ni sustituye la disponibilidad de artefactos.

Qué no demuestra

  • No establece una ley general según la cual la identidad siempre anule incentivos en LLM.
  • No aísla identidad de etiquetas de acción, objetivos, narrativas y carga informativa.
  • No demuestra que los modelos elijan entre Green y Tragedy como dos Nash del mismo juego.
  • No demuestra que Green sea siempre el resultado socialmente óptimo o normativamente correcto.
  • No demuestra que alcanzar Nash equivalga a razonamiento estratégico correcto o deseable.
  • No demuestra que los racionales textuales revelen fielmente el mecanismo interno del modelo.
  • No valida el conteo de keywords como medida de razonamiento identity-driven o payoff-optimal.
  • No establece equivalencia de sensibilidad entre modelos a partir de p=0,27.
  • No permite reproducir los conteos, tests o figuras sin datos y código.
  • No resuelve qué tablas son correctas cuando los apéndices se contradicen.
  • No representa ni predice comportamiento de personas, empresas, gobiernos o activistas reales.
  • No valida simulación de políticas, evaluación regulatoria ni soporte de decisiones públicas.
  • No generaliza fuera de juegos one-shot de cuatro agentes en framing ambiental/económico.
  • No prueba que eliminar personas sea una mitigación general; en juegos Green puede reducir Nash drásticamente.
  • No permite atribuir diferencias a arquitectura, escala o entrenamiento de forma causal.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2601.10102v6, revised 30 May 2026; accepted author version of ACM FAccT 2026, DOI 10.1145/3805689.3812218

Fuente consultada: https://arxiv.org/pdf/2601.10102v6

Revisión: Codex full-text, bilingual-fidelity, definitive-title, FAccT-DOI, 21-page visual, arXiv-source, factorial-design, clustering, equilibrium-definition, pooled-selection, table-consistency, effect-size, CoT-keyword, prompt-confound and artifact-availability audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Qwen/Qwen2.5-7B-Instruct
  • Qwen/Qwen2.5-32B-Instruct
  • meta-llama/Llama-3.1-8B-Instruct
  • mistralai/Mistral-7B-Instruct-v0.2
  • GPT-5, exact snapshot not reported, used to assist scenario generation and generate persona prompt variants
  • ChatGPT, exact model not reported, used for grammar, formatting, and editing

Instrumentos y métricas

  • 2×2 persona-presence × payoff-visibility prompt intervention
  • Four-player, two-action, one-shot simultaneous games with 16 joint profiles
  • Role personas for Industrialist, Government, Environmental Activist, and Citizen Coalition
  • Neutral Player i baseline that retains role-linked action labels and descriptions
  • Narrative-only hidden-payoff condition and complete 16-profile payoff-table condition
  • JSON action plus short rationale generated with explicit chain-of-thought instructions
  • Pure-strategy Nash-equilibrium checker and Green/Tragedy/Other outcome classifier
  • Seven GPT-5-assisted persona wording variants
  • Pearson chi-square and Cramér V omnibus comparisons
  • Pairwise Fisher exact tests with Holm correction and Haldane–Anscombe odds ratios
  • Kruskal–Wallis and pairwise Mann–Whitney U tests for distinct-outcome counts
  • Deterministic overlapping keyword dictionaries over model rationales

Datos utilizados

  • 53 author-constructed environmental-policy narratives paired with payoff tables
  • 41 Green-dominant scenarios, 205 repeated games per factorial cell
  • 12 Tragedy-dominant scenarios, 60 repeated games per factorial cell
  • 4,240 joint games in the main 4-model × 4-condition × 53-scenario × 5-repeat factorial
  • 16,960 role-level action/rationale generations in the main factorial
  • Additional seven-formulation persona sensitivity outputs; exact released dataset unavailable
  • No public official code, scenario, payoff, output, or statistical dataset located as of 15 July 2026

Evidencia y localización

  • Título definitivo, aceptación, versión y DOI: arXiv:2601.10102v6 title page and submission history; Crossref DOI 10.1145/3805689.3812218, published 25 June 2026, pages 7737–7768
  • Diseño 2×2, interacción, juegos y definición de Nash: Accepted author version, Sections 3.1–3.5 and Figure 1
  • Modelos, hiperparámetros y repeticiones: Accepted author version, Section 3.6 and Appendix B.1–B.3
  • Prompts, personas, baseline y action mappings: Accepted author version, Appendix A and C.1–C.4, Figures 5–6
  • Resultados Green-dominant y Tragedy-dominant: Accepted author version, Sections 4.1–4.2, Figures 2–3, Tables 4, 7, and 8
  • Variantes de persona generadas con GPT-5: Accepted author version, Section 4.3 and Appendix F
  • Limitaciones reconocidas: Accepted author version, Section 5.4
  • Contradicciones de conteos Green, Tragedy y Nash: Accepted author version, Appendix G–H, Tables 5, 8, 9, 10, and 13
  • Cramér V inconsistente: Accepted author version, Section 4.1 versus Appendix Table 11; recomputation sqrt(chi-square/N) for a 2×4 table
  • Conteo determinista de keywords y afirmación de mecanismo: Accepted author version, Appendix I–J, Figures 7–10
  • Uso declarado de IA generativa: Accepted author version, Generative AI Usage Statement
  • Ausencia de artefactos oficiales: arXiv v6 source package and targeted GitHub searches by current title, former title, and arXiv ID, checked 15 July 2026