Identifying Cooperative Personalities in Multi-agent Contexts through Personality Steering with Representation Engineering

Inducción y control de rasgos2025arXivRevisión editorial aprobada

Autores: Kenneth J. K. Ong, Lye Jia Jun, Jord Nguyen, Seong Hah Cho, Natalia Pérez-Campanero Antolín

Palabras clave: multi-agent systems, personality traits, cooperation dynamics, Iterated Prisoner's Dilemma, Big Five traits, representation engineering, agent coordination

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
6
Hallazgos
8
Limitaciones
7
Evidencias

Resumen editorial

Español

Este preprint estudia si el steering de representaciones asociadas a los Big Five cambia la cooperación de agentes LLM en tres variantes de un dilema del prisionero iterado. Una comparación preliminar sin steering encuentra medianas de cooperación de 0,70 para Llama-3.1-8B-Instruct, 0,10 para Gemma2-9B-it y 0,50 para Mistral-Nemo-Instruct-2407. Los experimentos principales usan únicamente Mistral-Nemo-Instruct-2407, de 12B parámetros: cada partida dura diez rondas y el número de partidas varía según el oponente, pero el artículo no publica cuántas se ejecutan por condición. Para cada rasgo, los autores contrastan prompts que declaran una personalidad al 100 % o al 0 %, calculan en cada capa la primera componente principal de las diferencias de activación y suman el vector en las capas quinta a vigésima desde el final, con factor 3,5 en cada token. En el primer setup, Player A se enfrenta a oponentes de regla, siempre coopera, siempre traiciona o aleatorio con probabilidades de traición 0,3, 0,5 y 0,7. Steering positivo de Agreeableness, Conscientiousness y Openness reduce a 0 la mediana de troublemaking. Agreeableness, sin embargo, eleva la explotabilidad en 0,44 desde una mediana base de 0; también eleva forgiveness en 0,75 desde 0 y reduce retaliation en 0,75 desde 1. En el segundo setup, la comunicación queda restringida a «cooperate» o «defect» y la tasa de lying es solo la discrepancia observable entre mensaje y acción. Desde una mediana base de 0,70, Agreeableness y Conscientiousness positivos la reducen respectivamente a 0,00 y 0,10 frente al oponente altruista, y a 0,10 y 0,20 frente al egoísta. En el tercer setup ambos jugadores son instancias del mismo Mistral sometidas a steering. La pareja Agreeableness+/Agreeableness+ suma 21 años de prisión frente a 52 del baseline/baseline, aproximadamente un 60 % menos; combinaciones con Agreeableness y Conscientiousness ofrecen resultados colectivos bajos, pero suelen perjudicar el resultado individual del jugador cooperativo. Estos resultados documentan cambios conductuales bajo una intervención concreta, no rasgos psicológicos validados. Los vectores proceden de una oposición lingüística 100 %/0 % que no equivale necesariamente a los polos humanos del Big Five; no hay comprobación psicométrica, baseline de prompting de persona ni ablación de capa o intensidad. El factor y las capas se eligen para maximizar el efecto. Aunque el texto dice que los rasgos influyen «significativamente», no reporta tests, p-valores, intervalos, barras de error ni el número de repeticiones. El único modelo principal, una matriz de pagos, un horizonte de diez rondas y métricas que operacionalizan cooperación limitan la generalización. La menor discrepancia mensaje–acción tampoco demuestra honestidad o intención interna, y el razonamiento solicitado en el prompt no permite inferir cognición privada. La evidencia sostiene un compromiso contextual entre cooperación colectiva y vulnerabilidad a explotación, no una mejora general de seguridad o confiabilidad multiagente.

English

This preprint tests whether representation steering associated with the Big Five changes LLM-agent cooperation in three variants of the iterated Prisoner's Dilemma. An unsteered preliminary comparison reports median cooperation rates of .70 for Llama-3.1-8B-Instruct, .10 for Gemma2-9B-it, and .50 for Mistral-Nemo-Instruct-2407. The main experiments use only the 12B Mistral-Nemo-Instruct-2407: each game lasts ten rounds, and the number of games varies by opponent, but the paper never reports how many are run per condition. For each trait, the authors contrast prompts declaring personality at 100% versus 0%, compute the first principal component of activation differences at each layer, and add the vector to layers five through twenty from the end with a factor of 3.5 at every generated token. In Setup 1, Player A faces rule-based opponents, Always Cooperate, Always Defect, or Random with defection probabilities .3, .5, and .7. Positive Agreeableness, Conscientiousness, and Openness steering lowers median troublemaking to zero. Agreeableness, however, raises exploitability by .44 from a zero median baseline; it also raises forgiveness by .75 from zero and lowers retaliation by .75 from one. In Setup 2, communication is restricted to “cooperate” or “defect,” and lying rate is only the observable mismatch between message and action. From an unsteered median of .70, positive Agreeableness and Conscientiousness lower it to .00 and .10 against the altruistic opponent, and .10 and .20 against the selfish opponent. In Setup 3, both players are steered instances of the same Mistral model. The Agreeableness+/Agreeableness+ pairing accumulates 21 prison years versus 52 for baseline/baseline, about 60% fewer; pairings involving Agreeableness and Conscientiousness achieve low collective costs but often worsen the cooperative player's individual outcome. These findings document behavioral changes under one intervention, not validated psychological traits. The vectors come from a linguistic 100%/0% contrast that need not represent opposite human Big Five poles; there is no psychometric manipulation check, persona-prompting baseline, or layer/intensity ablation. The factor and layers are selected to maximize the steering effect. Although the paper calls the influence “significant,” it reports no tests, p-values, intervals, error bars, or number of repetitions. One main model, one payoff matrix, a ten-round horizon, and metrics that operationalize cooperation limit generalization. A lower message–action mismatch does not demonstrate honesty or internal intent, and prompted chain-of-thought cannot establish private cognition. The evidence supports a contextual trade-off between collective cooperation and exploitability, not a general improvement in multi-agent safety or trustworthiness.

Pregunta de investigación

¿Cómo altera el steering representacional de cada rasgo Big Five la cooperación, la vulnerabilidad a explotación y la correspondencia entre mensaje y acción de agentes LLM en variantes del dilema del prisionero iterado?

Método

Se construyen direcciones por rasgo a partir de prompts contrastivos de personalidad 100 %/0 %, diferencias de activación y la primera componente principal por capa. Con factor 3,5, los vectores se añaden a las capas −5 a −20 de Mistral-Nemo-Instruct-2407 durante cada token. En partidas de diez rondas se comparan ambos sentidos de los cinco rasgos y un baseline sin steering frente a oponentes de regla, oponentes comunicativos altruista/egoísta y otro agente Mistral sometido a steering. Se resumen distribuciones mediante medianas y mapas de calor; no se aporta análisis inferencial.

Muestra: Comparación preliminar de tres modelos abiertos. Los experimentos principales usan un único Mistral-Nemo-Instruct-2407 de 12B en tres setups, diez rondas por partida y once condiciones de Player A, baseline y cinco rasgos en dos direcciones; en el tercer setup se cruzan las once condiciones de ambos jugadores. El número de partidas por condición no se publica. El cómputo declarado es una H100 y aproximadamente 20 días-GPU. No hay participantes ni evaluadores humanos.

Hallazgos

  • Sin steering, las medianas preliminares de cooperación son 0,70 para Llama-3.1-8B-Instruct, 0,10 para Gemma2-9B-it y 0,50 para Mistral-Nemo-Instruct-2407.
  • Agreeableness+, Conscientiousness+ y Openness+ reducen a 0 la mediana de troublemaking en el primer setup.
  • Agreeableness+ eleva la mediana de explotabilidad en 0,44 desde 0, aumenta forgiveness en 0,75 desde 0 y reduce retaliation en 0,75 desde 1.
  • La mediana base de discrepancia mensaje–acción es 0,70; Agreeableness+ y Conscientiousness+ la reducen a 0,00/0,10 ante el oponente altruista y 0,10/0,20 ante el egoísta.
  • Agreeableness+/Agreeableness+ acumula 21 años colectivos frente a 52 para baseline/baseline, pero las configuraciones más cooperativas pueden dejar al jugador cooperativo con peor resultado individual.
  • Los resultados visuales sugieren un compromiso entre cooperación, perdón y resultado colectivo, por un lado, y resistencia a la explotación, por otro; el paper no cuantifica incertidumbre estadística.

Limitaciones

  • Los resultados principales proceden de un solo modelo de 12B, una matriz de pagos y partidas de diez rondas; la comparación de tres modelos solo es preliminar y no evalúa steering.
  • No se informa el número de partidas por condición, semillas, variabilidad entre ejecuciones, tests, p-valores, intervalos o barras de error, aunque el texto usa lenguaje de significación.
  • Las capas −5 a −20 y el factor 3,5 se escogen para maximizar el efecto, sin ablación por capa, curva dosis–respuesta ni análisis de robustez.
  • El contraste textual 100 % frente a 0 % no garantiza polos psicológicos opuestos ni que la primera componente represente exclusivamente el rasgo; no hay validación psicométrica de la intervención.
  • Falta un baseline de instrucciones de persona que permita distinguir el valor añadido del steering representacional.
  • Troublemaking, exploitability, forgiveness y retaliation dependen de oponentes específicos y codifican acciones cooperación/traición; no cubren la pluralidad de cooperación estratégica.
  • La comunicación se reduce a dos palabras y lying se define como una discrepancia de salida, sin evaluar intención, creencia, engaño exitoso o interpretación del interlocutor.
  • Ambos agentes del tercer setup comparten modelo, prompts y mecanismo de steering; no se prueban poblaciones heterogéneas, tareas abiertas, otros horizontes, idiomas ni incentivos.

Qué no demuestra

  • No demuestra que los modelos posean rasgos Big Five humanos, persistentes o internamente separables.
  • No demuestra que una dirección 0 % sea el opuesto psicológico de una dirección 100 % ni que las intensidades sean comparables entre rasgos.
  • No establece honestidad, intención de engaño, teoría de la mente o razonamiento interno a partir de texto solicitado por el prompt.
  • No prueba que Agreeableness o Conscientiousness mejoren de forma general la seguridad, la confiabilidad o la coordinación multiagente.
  • No permite atribuir causalmente los patrones a personalidad en lugar de estereotipos léxicos y requisitos del prompt contrastivo.
  • No aporta evidencia sobre interacción humano-IA, sistemas cerrados, modelos mayores o entornos de consecuencias reales.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2503.12722v1

Fuente consultada: https://arxiv.org/pdf/2503.12722

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • Mistral-Nemo-Instruct-2407 (12B; main experiments)
  • Llama-3.1-8B-Instruct (preliminary comparison)
  • Gemma2-9B-it (preliminary comparison)

Instrumentos y métricas

  • Big Five contrastive representation vectors
  • Iterated Prisoner's Dilemma payoff matrix
  • Troublemaking rate
  • Exploitability rate
  • Forgiveness rate
  • Retaliation rate
  • Message-action mismatch termed lying rate
  • Collective prison years and Player A prison-time difference

Datos utilizados

  • Model-generated ten-round Iterated Prisoner's Dilemma trajectories
  • Neutral truncated prompts prefixed with 100% and 0% Big Five trait statements

Evidencia y localización

  • Preguntas de investigación, modelos preliminares y construcción de vectores: arXiv v1, pp. 1–2, Introduction and sections 2.1.1–2.1.3
  • Setups, matriz de pago y métricas de cooperación: arXiv v1, pp. 2–3 and 6–7, sections 2.1.4–2.1.6 and Appendix B
  • Medianas de cooperación, troublemaking, explotabilidad, perdón y represalia: arXiv v1, p. 3, sections 3.1–3.2 and Figures 1–2
  • Discrepancia mensaje–acción y resultados entre dos agentes: arXiv v1, pp. 3–4, sections 3.3–3.4 and Figures 3–4
  • Interpretación, compromisos y límites declarados: arXiv v1, pp. 4–5, Discussion, Conclusions and Limitations
  • Prompts exactos, historiales y ejemplos de respuestas: arXiv v1, pp. 7–10, Figures 5–8
  • Prompts 100%/0%, PCA, capas y factor de steering: arXiv v1, p. 8, Appendix D