An evolutionary model of personality traits related to cooperative behavior using a large language model

Sociedad, cultura y comportamiento colectivo2024Scientific ReportsRevisión editorial aprobada

Autores: Reiji Suzuki, Takaya Arita

Palabras clave: evolutionary computation, personality traits, cooperative behavior, large language models, game theory, evolutionary dynamics, behavioral traits

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
14
Hallazgos
26
Limitaciones
14
Evidencias

Resumen editorial

Español

Este trabajo propone un modelo evolutivo en el que una frase inglesa de unas diez palabras funciona como “gen” de personalidad relacionado con cooperación o egoísmo. Llama-2-13B-Chat-GPTQ no juega cada ronda como agente conversacional: se usa una vez por cada frase única para compilarla en un fenotipo determinista, una tabla de 16 acciones C/D que cubre todas las historias posibles de dos rondas del dilema del prisionero. Si una respuesta no contiene una elección identificable, se regenera hasta diez veces y después se asigna una acción aleatoria. La tabla queda cacheada para todas las apariciones futuras de esa frase. El LLM vuelve a intervenir en la mutación: con probabilidad 0,05, reescribe el gen hacia un tono cooperativo o egoísta elegido al azar. La simulación usa 30 individuos, 1.000 generaciones, torneos round-robin de 20 rondas, ruido de acción 0,05 y payoffs R=4, T=5, S=0 y P=1. Siete genes iniciales generados por GPT-4 cubren una gradación de egoísmo a cooperación. Para comprobar el mapeo inicial, cada gen se compila 50 veces con temperatura 0,9; los extremos producen, en promedio, aproximadamente 0,1 y 0,7 de cooperación, mientras las descripciones intermedias son más variables. Sin embargo, esa variabilidad se omite después: cada gen nuevo conserva una única muestra determinista. En 15 ensayos evolutivos, la cooperación media del modelo lingüístico es 0,31, con una moda cercana a 0,18 y cola hacia valores altos; la distancia coseno media entre genes promedio separados 20 generaciones es 0,05, con fuerte pico alrededor de 0,02. Los autores interpretan esto como largos estancamientos dominados por defección interrumpidos por invasiones cooperativas. Un ensayo ilustrativo pasa de aproximadamente 0,05 de cooperación hasta la generación 300, sube a 0,55, alcanza cerca de 0,75 hacia la 850 y cae a 0,15 hacia la 900. El control codifica directamente las 16 acciones y muta volteando una o dos: logra cooperación media 0,50 y distancia coseno 0,07, con trayectorias más graduales y parecidas entre ensayos. La comparación muestra que introducir una reescritura lingüística crea mutaciones de tamaño irregular y una topología evolutiva distinta; no aísla “personalidad”, porque también cambia simultáneamente representación, operador de mutación y mapeo genotipo-fenotipo. El análisis léxico asocia palabras frecuentes con resultados: “gently”, “fosters”, “establishes” y “harmony” aparecen en genes con cooperación alta; “trampling”, “trumps”, “disregard”, “blatant” y “skepticism” con defección. Son asociaciones entre palabras que coexisten dentro de frases seleccionadas, no efectos causales de tokens individuales; no hay ablación, regresión ni control por contexto. La contribución real es demostrar que un LLM cuantizado puede servir como operador semántico dentro de un modelo de vida artificial y producir dinámicas no triviales. No demuestra evolución de personalidad humana ni que los agentes posean rasgos psicológicos. “Personalidad” se operacionaliza como frases sobre cooperación/beneficio propio, sin instrumento Big Five, validación humana o correspondencia con conducta real; los autores reconocen que esa correspondencia queda sin comprobar. La reproducibilidad es limitada: no se publican código ni datos, solo disponibles a petición, ni semillas, entorno, commit o rama exacta del modelo GPTQ, versión de librerías, prompt de GPT-4 que creó los genes iniciales, fallos de parsing o tasas de fallback. El repositorio de modelo sigue accesible y ofrece múltiples cuantizaciones, pero el artículo no fija cuál usó. Por tanto, los resultados son evidencia exploratoria sobre evolución de representaciones lingüísticas compiladas por un LLM en un juego muy concreto, no evidencia psicológica o social sobre personas.

English

This paper proposes an evolutionary model in which an English sentence of roughly ten words acts as a personality “gene” related to cooperation or selfishness. Llama-2-13B-Chat-GPTQ does not play every round as a conversational agent: it is used once per unique sentence to compile that sentence into a deterministic phenotype, a 16-action C/D lookup table covering all possible two-round histories of the iterated Prisoner's Dilemma. If a response contains no identifiable choice, generation is retried up to ten times and then a random action is assigned. The table is cached for every later occurrence of that exact sentence. The LLM re-enters at mutation: with probability .05 it rewrites the gene toward a randomly selected cooperative or selfish tone. The simulation uses 30 individuals, 1,000 generations, 20-round round-robin games, .05 action noise, and payoffs R=4, T=5, S=0, P=1. Seven initial genes generated by GPT-4 span a selfish-to-cooperative gradient. To examine initial mapping, each gene is compiled 50 times at temperature .9; extremes average roughly .1 and .7 cooperation, while intermediate descriptions vary more. That variability is then omitted: each newly encountered gene retains one deterministic sample. Across 15 evolutionary trials, mean cooperation in the language model is .31, with a mode near .18 and a tail toward higher values; mean cosine distance between population-average genes 20 generations apart is .05, with a strong peak near .02. The authors interpret this as long defection-dominated stagnation interrupted by cooperative invasions. One illustrative run stays near .05 cooperation until generation 300, rises to .55, peaks near .75 around generation 850, and drops to .15 near generation 900. A control directly encodes the 16 actions and mutates by flipping one or two; it reaches .50 mean cooperation and .07 cosine distance, with smoother and more similar trajectories across trials. This comparison shows that linguistic rewriting creates irregular mutation sizes and a different evolutionary topology; it does not isolate “personality,” because representation, mutation operator, and genotype-phenotype mapping all change together. The lexical analysis associates frequent words with outcomes: “gently,” “fosters,” “establishes,” and “harmony” occur in high-cooperation genes; “trampling,” “trumps,” “disregard,” “blatant,” and “skepticism” occur with defection. These are associations among words co-occurring in selected sentences, not causal effects of individual tokens; there is no ablation, regression, or context control. The actual contribution is showing that a quantized LLM can act as a semantic operator inside an artificial-life model and produce nontrivial dynamics. It does not demonstrate the evolution of human personality or psychological traits in agents. “Personality” is operationalized as phrases about cooperation and self-interest, without a Big Five instrument, human validation, or correspondence with real behavior; the authors explicitly acknowledge that this correspondence remains unknown. Reproducibility is limited: code and data are not released, only available on request, and the paper supplies no seeds, environment, exact GPTQ model revision or branch, library versions, GPT-4 prompt used to create the initial genes, parsing-failure rate, or fallback rate. The model repository remains accessible and offers multiple quantizations, but the article does not pin the one used. The findings are therefore exploratory evidence about the evolution of linguistic representations compiled by an LLM in one game, not psychological or social evidence about people.

Pregunta de investigación

¿Puede un LLM mapear descripciones lingüísticas de cooperación y egoísmo a estrategias del dilema del prisionero y actuar como operador de mutación para generar dinámicas evolutivas distintas de una codificación directa de acciones?

Método

Se compila cada gen textual único con Llama-2-13B-Chat-GPTQ en una tabla determinista de 16 acciones. Una población de 30 tablas evoluciona 1.000 generaciones mediante selección roulette-wheel por payoff en torneos de 20 rondas, mutación textual con LLM y ruido de acción. Se ejecutan 15 ensayos y un control con genotipo binario de 16 acciones; embeddings MiniLM, UMAP, cooperación, distancia coseno y asociaciones léxicas describen las trayectorias.

Muestra: Quince ensayos con poblaciones de 30 individuos durante 1.000 generaciones y quince ensayos de control. Cada fitness procede de un torneo round-robin de partidas de 20 rondas. El mapeo inicial se explora con 50 generaciones de fenotipo para cada uno de siete genes, pero la evolución cachea una sola tabla por gen único.

Hallazgos

  • Los siete genes iniciales ordenados de egoísta a cooperativo producen, en promedio, tablas de acción coherentes con esa gradación.
  • Los genes extremos producen estrategias más consistentes que los intermedios en las 50 muestras iniciales.
  • Cada gen único se reduce después a una tabla determinista de 16 acciones y se reutiliza.
  • La cooperación media en los 15 ensayos lingüísticos es 0,31.
  • La distribución lingüística tiene su pico principal cerca de 0,18 y una cola hacia cooperación alta.
  • La distancia coseno media entre intervalos de 20 generaciones es 0,05.
  • Las trayectorias muestran estancamientos largos y cambios bruscos entre defección y cooperación.
  • El control binario alcanza cooperación media 0,50 y distancia coseno 0,07.
  • El control evoluciona de forma más gradual y con menor variación espacial entre ensayos.
  • Palabras de armonía y colaboración se asocian descriptivamente con cooperación alta.
  • Palabras de desprecio o auto-interés se asocian descriptivamente con defección.
  • El paper reconoce que no se sabe si el mapeo LLM coincide con relaciones humanas entre personalidad y conducta.
  • El repositorio Hugging Face del modelo sigue accesible, pero ofrece múltiples cuantizaciones y el paper no fija revisión.
  • No hay repositorio oficial de código o datos del experimento.

Limitaciones

  • Personalidad se reduce a frases de cooperación y egoísmo, sin medición psicológica.
  • No se usan ni validan dimensiones Big Five pese a citarlas como motivación.
  • No hay participantes ni anotadores humanos que validen frase, estrategia o interpretación.
  • El LLM no actúa durante cada ronda; compila una tabla una vez.
  • Una muestra estocástica a temperatura 0,9 se congela como fenotipo determinista.
  • Las tasas de regeneración y asignación aleatoria tras diez fallos no se publican.
  • El cache por string exacto puede tratar paráfrasis casi idénticas como genes distintos.
  • El control cambia a la vez representación, mapeo y operador de mutación.
  • Las mutaciones lingüísticas no tienen una distancia controlada comparable a voltear uno o dos bits.
  • Los siete genes iniciales dependen de GPT-4, cuya versión y prompt no se especifican.
  • Solo se usa un LLM local cuantizado y un único tipo de juego.
  • No hay robustez a otros modelos, prompts, temperaturas, payoffs o tamaños de población.
  • Quince ensayos no incluyen intervalos, pruebas inferenciales o análisis de potencia.
  • La elección del ensayo 13 para la narrativa no sigue un criterio predeclarado.
  • UMAP es una proyección no única y no preserva necesariamente estructura global.
  • Las palabras se analizan por asociación marginal dentro de frases altamente correlacionadas.
  • No hay ablación que muestre que una palabra aislada causa la conducta atribuida.
  • El umbral de 500 apariciones es arbitrario y no se justifica estadísticamente.
  • La Tabla 1 contiene el error tipográfico 00.404.
  • No se publican código, datasets, semillas ni entorno de ejecución.
  • No se fija commit, rama o configuración GPTQ exacta del modelo.
  • No se documentan versiones de Transformers, AutoGPTQ, Sentence Transformers o UMAP.
  • Los datos solo están disponibles a petición razonable.
  • La inferencia desde una simulación artificial a evolución de conducta humana es especulativa.
  • Las frases generadas heredan sesgos semánticos de GPT-4 y Llama 2.
  • No se evalúan efectos de seguridad, cultura, idioma o variación demográfica.

Qué no demuestra

  • No demuestra que los agentes tengan personalidad.
  • No demuestra evolución de rasgos psicológicos humanos.
  • No valida una medida Big Five.
  • No demuestra que las frases predigan conducta humana real.
  • No demuestra que un LLM simule decisiones humanas.
  • No demuestra que las palabras individuales causen cooperación o defección.
  • No demuestra que las mutaciones lingüísticas sean biológicamente plausibles.
  • No demuestra emergencia espontánea independiente del sesgo cooperativo/egoísta impuesto al mutador.
  • No demuestra superioridad del modelo lingüístico; el control obtiene mayor cooperación media.
  • No generaliza a otros juegos, modelos, idiomas o sociedades.
  • No establece estabilidad ante otra muestra del mismo gen.
  • No permite reproducir exactamente las figuras desde artefactos públicos.
  • No demuestra consciencia, intención, preferencias o comprensión del LLM.
  • No demuestra que mayor cooperación sea siempre mayor fitness o mejor resultado individual.

Trazabilidad

Alcance: Texto completo

Versión: Scientific Reports 14:5989, version of record published 19 Mar 2024, DOI 10.1038/s41598-024-55903-y

Fuente consultada: https://www.nature.com/articles/s41598-024-55903-y.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, evolutionary-game, LLM-genotype-phenotype, prompt, control, lexical-association, personality-construct, model-artifact, statistics, reproducibility and data-availability audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • TheBloke/Llama-2-13B-chat-GPTQ
  • GPT-4 for generating seven initial personality descriptions
  • sentence-transformers/paraphrase-MiniLM-L6-v2 for embeddings
  • UMAP for two-dimensional visualization

Instrumentos y métricas

  • Iterated Prisoner's Dilemma
  • 16-action deterministic strategy table with memory of two rounds
  • Roulette-wheel evolutionary selection
  • LLM semantic mutation operator
  • Proportion of cooperation
  • Cosine distance between population-average gene embeddings
  • Word-outcome association table
  • Direct behavioral-genotype control

Datos utilizados

  • Seven GPT-4-generated initial personality descriptions
  • 15 evolutionary trials of 1,000 generations
  • 15 direct-genotype control trials
  • Generated natural-language mutation lineages
  • No public code or experiment dataset; available on reasonable request

Evidencia y localización

  • Publicación oficial: Scientific Reports 14:5989, published 19 Mar 2024, DOI 10.1038/s41598-024-55903-y
  • Fuente completa: .cache/editorial-sources/article-108/source.pdf; 9 pages; sha256 5b8a9df601e311ee81dbee60a8ebc8e6b9e27565f88e5bf35d6eed59705dfa84
  • Mapeo genotipo-fenotipo: Full text p. 3, Methods and Figure 1
  • Prompts y fallback: Full text pp. 3-4, Methods and Figure 2
  • Parámetros de simulación y modelos: Full text pp. 3-4, Experiments and analyses
  • Siete genes y 50 generaciones: Full text pp. 4-5, Figure 3
  • Ensayo evolutivo ilustrativo: Full text pp. 4-6, Figure 4
  • Resultados agregados: Full text p. 6, Figure 5
  • Control directo: Full text pp. 6-7, Figure 6
  • Asociaciones léxicas: Full text pp. 7-8, Table 1
  • Límites reconocidos: Full text p. 8, Conclusion
  • Disponibilidad de datos: Full text p. 8, Data availability: on reasonable request
  • Modelo GPTQ actual: https://huggingface.co/TheBloke/Llama-2-13B-chat-GPTQ; multiple quantization branches; checked 15 Jul 2026
  • Inspección visual: All 9 PDF pages rendered and visually inspected, including six figures, prompts and Table 1; checked 15 Jul 2026