Este preprint estudia si el steering de representaciones asociadas a los Big Five cambia la cooperación de agentes LLM en tres variantes de un dilema del prisionero iterado. Una comparación preliminar sin steering encuentra medianas de cooperación de 0,70 para Llama-3.1-8B-Instruct, 0,10 para Gemma2-9B-it y 0,50 para Mistral-Nemo-Instruct-2407. Los experimentos principales usan únicamente Mistral-Nemo-Instruct-2407, de 12B parámetros: cada partida dura diez rondas y el número de partidas varía según el oponente, pero el artículo no publica cuántas se ejecutan por condición. Para cada rasgo, los autores contrastan prompts que declaran una personalidad al 100 % o al 0 %, calculan en cada capa la primera componente principal de las diferencias de activación y suman el vector en las capas quinta a vigésima desde el final, con factor 3,5 en cada token. En el primer setup, Player A se enfrenta a oponentes de regla, siempre coopera, siempre traiciona o aleatorio con probabilidades de traición 0,3, 0,5 y 0,7. Steering positivo de Agreeableness, Conscientiousness y Openness reduce a 0 la mediana de troublemaking. Agreeableness, sin embargo, eleva la explotabilidad en 0,44 desde una mediana base de 0; también eleva forgiveness en 0,75 desde 0 y reduce retaliation en 0,75 desde 1. En el segundo setup, la comunicación queda restringida a «cooperate» o «defect» y la tasa de lying es solo la discrepancia observable entre mensaje y acción. Desde una mediana base de 0,70, Agreeableness y Conscientiousness positivos la reducen respectivamente a 0,00 y 0,10 frente al oponente altruista, y a 0,10 y 0,20 frente al egoísta. En el tercer setup ambos jugadores son instancias del mismo Mistral sometidas a steering. La pareja Agreeableness+/Agreeableness+ suma 21 años de prisión frente a 52 del baseline/baseline, aproximadamente un 60 % menos; combinaciones con Agreeableness y Conscientiousness ofrecen resultados colectivos bajos, pero suelen perjudicar el resultado individual del jugador cooperativo. Estos resultados documentan cambios conductuales bajo una intervención concreta, no rasgos psicológicos validados. Los vectores proceden de una oposición lingüística 100 %/0 % que no equivale necesariamente a los polos humanos del Big Five; no hay comprobación psicométrica, baseline de prompting de persona ni ablación de capa o intensidad. El factor y las capas se eligen para maximizar el efecto. Aunque el texto dice que los rasgos influyen «significativamente», no reporta tests, p-valores, intervalos, barras de error ni el número de repeticiones. El único modelo principal, una matriz de pagos, un horizonte de diez rondas y métricas que operacionalizan cooperación limitan la generalización. La menor discrepancia mensaje–acción tampoco demuestra honestidad o intención interna, y el razonamiento solicitado en el prompt no permite inferir cognición privada. La evidencia sostiene un compromiso contextual entre cooperación colectiva y vulnerabilidad a explotación, no una mejora general de seguridad o confiabilidad multiagente.
Pregunta de investigación
¿Cómo altera el steering representacional de cada rasgo Big Five la cooperación, la vulnerabilidad a explotación y la correspondencia entre mensaje y acción de agentes LLM en variantes del dilema del prisionero iterado?