Personality-Driven Decision-Making in LLM-Based Autonomous Agents

Personas, identidad y agentes2025arXivRevisión editorial aprobada

Autores: Lewis Newsham, Daniel Prince

Palabras clave: Artificial Intelligence, Multiagent Systems, Large Language Models, Autonomous Agents, OCEAN model, Cyber Defense

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
15
Hallazgos
57
Limitaciones
17
Evidencias

Resumen editorial

Español

El artículo estudia si una descripción de personalidad OCEAN cambia el orden en que un LLM elige tareas de una agenda diaria. A partir de 500 horarios laborales generados previamente por un LLM no identificado, cada actividad recibe un UID calculado con SHA-512 a partir del nombre y la hora asignada. En cada ciclo, el modelo ve primero una frase de personalidad, la hora actual, las tareas restantes en JSON, la lista de tareas completadas y la instrucción de devolver únicamente el UID siguiente. Debe completar todas las actividades y no puede omitir ninguna: la variable observada es, por tanto, una permutación de la misma lista, no una decisión abierta ni el desempeño de una acción en un entorno. Se prueban GPT-4o, GPT-4o-mini y GPT-3.5-Turbo con los cinco rasgos OCEAN en dirección alta y baja, más una condición sin personalidad. Los checkpoints exactos y gran parte de la configuración de API no se publican.

El análisis usa el desplazamiento de posición de cada tarea y cinco medidas normalizadas de comparación de secuencias: longest common substring, longest common prefix, distancia de Levenshtein, un ratio basado en longest common subsequence y distancia de Hamming. Para cada modelo se comparan las diez condiciones con el control mediante 50 t-tests de Welch independientes y corrección de Bonferroni hasta p≤0,001. Con temperatura 1,0, las 50 comparaciones de GPT-4o y las 50 de GPT-4o-mini se declaran significativas; para GPT-3.5-Turbo son 41 de 50. Sin embargo, la diferencia principal es que las condiciones con persona reordenan mucho más la agenda que el control. El propio artículo reconoce que en GPT-3.5 las diferencias absolutas son pequeñas pese a la significación. Al inspeccionar tareas concretas, GPT-4o con alta responsabilidad adelanta actividades de trabajo y con baja responsabilidad adelanta actividades personales; la alta extraversión adelanta tareas sociales y la baja extraversión favorece tareas solitarias. Ese análisis de plausibilidad se limita a responsabilidad y extraversión y utiliza categorías de tareas asignadas por los autores.

La evidencia no separa personalidad de seguimiento literal de instrucciones. Los prompts contienen descriptores transparentes como «outgoing, energetic, public» y las tareas tienen nombres semánticamente obvios como Work, Social Media o Team Collaboration. No hay control de igual longitud sin significado psicológico, ablación de los descriptores, evaluación humana ciega, inventario psicométrico ni prueba de que el patrón se mantenga fuera de esa lista. La significación frente a un control no demuestra que el cambio sea coherente con un rasgo; para apertura, amabilidad y neuroticismo el artículo ofrece sobre todo magnitud de reordenación. Además, los mismos 500 horarios parecen reutilizarse entre condiciones, pero se aplican pruebas independientes en vez de un análisis emparejado o de medidas repetidas. Cada prompt se ejecuta una sola vez por horario y condición, por lo que no se estima la estabilidad ante la no determinación que el propio trabajo invoca.

La auditoría detecta una inconsistencia sustancial en el ratio SR. El método lo define como Similarity Ratio derivado de LCS y afirma que 1 representa alineación perfecta. No obstante, en la Tabla 1 SR aumenta con la temperatura, de 0,321 a 0,446 para GPT-4o y de 0,393 a 0,530 para GPT-4o-mini, mientras el texto sostiene que disminuye. En la Tabla 2, el control obtiene SR de 0,35/0,45 y las condiciones con personalidad valores de 0,57 a 0,94, patrón opuesto al de LCSS y LCP y más compatible con una distancia. La narración también cita valores de temperatura cero que no coinciden con la tabla: informa 0,652/0,615 para GPT-4o y 0,528/0,489 para GPT-4o-mini, frente a 0,635/0,604 y 0,522/0,476 impresos. Estas contradicciones impiden interpretar SR como validación adicional y reducen la confianza en la lectura de temperatura.

La relación con SANDMAN y la ciberdefensa es prospectiva. No se prueba un honeypot, un adversario, el realismo para observadores, la retención de atacantes, la seguridad ni una decisión con consecuencias. La sección ética reconoce riesgos de desinformación y persuasión y propone supervisión, mitigación de sesgos y alineación de forma general, pero no implementa controles y basa el uso defensivo en la idea de «rightful deception». No se enlazan código, horarios, prompts completos, resultados o datos, y una búsqueda dirigida no localizó un repositorio oficial. La contribución defendible es un procedimiento para cuantificar cuánto reordena un LLM una lista cerrada bajo descripciones OCEAN y una demostración exploratoria de asociaciones semánticas previsibles en GPT-4o; no evidencia personalidad psicológica, autonomía operativa ni eficacia de ciberdefensa.

English

The paper studies whether an OCEAN personality description changes the order in which an LLM selects tasks from a daily schedule. It starts with 500 workday schedules previously generated by an unidentified LLM. Each activity receives a UID computed with SHA-512 from its name and assigned time. At every cycle, the target model sees a personality statement first, the current time, remaining JSON tasks, completed tasks, and an instruction to return only the next UID. It must complete every activity and cannot skip any, so the observed outcome is a permutation of a fixed list rather than open-ended decision-making or action performance in an environment. GPT-4o, GPT-4o-mini, and GPT-3.5-Turbo are tested under high and low variants of each OCEAN trait plus a no-personality baseline. Exact model snapshots and much of the API configuration are not reported.

The analysis uses each task's positional movement and five normalized sequence-comparison measures: longest common substring, longest common prefix, Levenshtein distance, a longest-common-subsequence-based ratio, and Hamming distance. For each model, the ten conditions are compared with baseline through 50 independent Welch t-tests with a Bonferroni threshold of p≤.001. At temperature 1.0, all 50 comparisons are declared significant for GPT-4o and GPT-4o-mini, and 41 of 50 for GPT-3.5-Turbo. The dominant pattern, however, is that persona conditions reorder schedules much more than baseline. The paper itself notes that GPT-3.5 absolute differences are small despite statistical significance. In selected task-level plots, high-conscientiousness GPT-4o moves work activities earlier and low conscientiousness moves personal activities earlier; high extraversion advances social tasks and low extraversion favors solitary tasks. This plausibility analysis is limited to conscientiousness and extraversion and relies on task categories assigned by the authors.

The evidence does not separate personality from literal instruction following. Prompts contain transparent descriptors such as “outgoing, energetic, public,” while tasks have semantically obvious names such as Work, Social Media, and Team Collaboration. There is no equal-length nonpsychological control, descriptor ablation, blinded human evaluation, psychometric inventory, or test that the pattern persists beyond this task list. Statistical difference from baseline does not by itself show trait alignment; for openness, agreeableness, and neuroticism the paper mainly establishes the amount of reordering. The same 500 schedules appear to be reused across conditions, yet independent tests are used instead of a paired or repeated-measures analysis. Each schedule-condition prompt is apparently sampled once, so stability under the nondeterminism invoked by the paper is not estimated.

The audit identifies a material inconsistency in the SR metric. The method defines it as an LCS-derived Similarity Ratio and states that 1 means perfect alignment. In Table 1, however, SR rises with temperature, from .321 to .446 for GPT-4o and .393 to .530 for GPT-4o-mini, while the prose says it decreases. In Table 2, baseline SR is .35/.45 and personality conditions range from .57 to .94, the opposite pattern to LCSS and LCP and one that behaves more like a distance. The temperature narrative also quotes zero-temperature values that do not match the table: it gives .652/.615 for GPT-4o and .528/.489 for GPT-4o-mini, whereas the printed values are .635/.604 and .522/.476. These contradictions prevent SR from serving as independent validation and weaken the temperature interpretation.

The connection to SANDMAN and cyber defense remains prospective. No honeypot, adversary, observer-rated realism, attacker retention, safety property, or consequential decision is tested. The ethics section recognizes risks of misinformation and tailored persuasion and recommends oversight, bias mitigation, and alignment in general terms, but implements no safeguards and grounds defensive use in “rightful deception.” No code, schedules, complete prompts, results, or data are linked, and targeted search did not locate an official repository. The defensible contribution is a procedure for quantifying how strongly an LLM reorders a closed list under OCEAN descriptions and an exploratory demonstration of predictable semantic associations in GPT-4o; it is not evidence of psychological personality, operational autonomy, or cyber-defense effectiveness.

Pregunta de investigación

¿En qué medida descripciones OCEAN altas o bajas alteran la selección y el orden de tareas de agentes controlados por GPT, y se corresponden algunos desplazamientos con prioridades esperables de responsabilidad y extraversión?

Método

Experimento de permutación de secuencias sobre 500 agendas diarias generadas por un LLM. GPT-4o, GPT-4o-mini y GPT-3.5-Turbo reciben, en cada ciclo, una persona OCEAN, la hora, las tareas restantes y completadas y deben devolver el UID SHA-512 de la siguiente tarea hasta agotarlas. Se comparan diez condiciones de rasgo y un control mediante desplazamientos por tarea, cinco métricas de secuencia y 50 t-tests de Welch por modelo con Bonferroni. Una prueba adicional varía la temperatura de 0,0 a 1,6 en GPT-4o y GPT-4o-mini sin persona. La auditoría editorial leyó y renderizó las diez páginas, contrastó tablas, fórmulas, narrativa, ética, metadatos, licencia y disponibilidad de artefactos.

Muestra: Quinientas agendas sintéticas con frecuencia, duración, orden, tipo de actividad y hora inicial variables. Cada agenda se ejecuta en diez condiciones de personalidad y un control para cada uno de tres modelos; el texto no aclara repeticiones independientes de una misma combinación. Para cada condición se obtienen 500 valores por métrica. El barrido de temperatura usa las mismas 500 agendas en el control para GPT-4o y GPT-4o-mini. No se informa distribución del número de tareas, longitud de las agendas, semilla, tasa de errores o recuento de respuestas descartadas.

Hallazgos

  • Las descripciones de personalidad alteran de forma marcada el orden de las mismas tareas frente al control sin persona.
  • GPT-4o con responsabilidad alta adelanta en promedio tareas clasificadas como laborales.
  • GPT-4o con responsabilidad baja adelanta en promedio actividades clasificadas como personales.
  • GPT-4o con extraversión alta adelanta tareas sociales como colaboración, reuniones y llamadas.
  • GPT-4o con extraversión baja favorece tareas presentadas como solitarias.
  • El análisis de plausibilidad por contenido se restringe a responsabilidad y extraversión en GPT-4o.
  • Con temperatura 1,0, las diez condiciones de GPT-4o difieren del control en las cinco métricas según el umbral Bonferroni.
  • GPT-4o-mini presenta también 50 de 50 comparaciones declaradas significativas.
  • GPT-3.5-Turbo presenta 41 de 50 comparaciones significativas y nueve no significativas.
  • Las diferencias absolutas de GPT-3.5-Turbo respecto al control son mucho menores que las de GPT-4o y GPT-4o-mini.
  • El control conserva mucho más el orden inicial que la mayoría de condiciones con personalidad en GPT-4o y GPT-4o-mini.
  • LCSS y LCP tienden a bajar y Levenshtein a subir al aumentar la temperatura en el control.
  • La Tabla 1 muestra que SR aumenta, no disminuye, entre temperatura 0,0 y 1,6 en ambos modelos.
  • La narrativa de temperatura cita cuatro valores iniciales distintos de los impresos en la Tabla 1.
  • El trabajo reconoce riesgos de desinformación y persuasión derivados de agentes con personalidad inducida.

Limitaciones

  • La tarea observada es únicamente reordenar una lista cerrada; no hay decisión abierta, entorno o consecuencia de las acciones.
  • Todas las tareas son obligatorias, por lo que no existe selección con escasez, renuncia o coste de oportunidad.
  • No se mide calidad de planificación, cumplimiento de plazos, utilidad, eficiencia o resultado de la agenda.
  • El programa realiza llamadas sucesivas al LLM, pero no se demuestra autonomía en un entorno operativo.
  • Los descriptores de personalidad contienen directamente la semántica que se espera observar en las tareas.
  • Los nombres de tareas, como Work o Social Media, hacen transparente la asociación buscada.
  • No hay un prompt de control de igual longitud y valencia sin significado de personalidad.
  • No se realizan ablaciones entre la etiqueta del rasgo, sus adjetivos y la posición inicial de la persona.
  • La persona siempre aparece primero, sin contrabalanceo que permita medir sesgo de posición.
  • Las descripciones altas y bajas pueden diferir en longitud, valencia y fuerza semántica.
  • Los prompts completos de los diez rasgos no se publican en el artículo ni como suplemento.
  • La plausibilidad de las categorías de tareas es asignada por los autores sin codificación ciega.
  • No se informa validación humana, acuerdo entre evaluadores o preregistro de las asociaciones tarea-rasgo.
  • Solo responsabilidad y extraversión reciben un análisis de plausibilidad específico por tarea.
  • Para apertura, amabilidad y neuroticismo, una diferencia de secuencia no demuestra coherencia con el rasgo.
  • Diferir del control demuestra reordenación, no personalidad o adecuación psicológica.
  • No se administra ningún inventario psicométrico ni se evalúan fiabilidad o validez de constructo.
  • No se incluyen calificaciones humanas de personalidad, realismo o semejanza con conducta humana.
  • No se comparan reglas simples o heurísticas semánticas que podrían reproducir los mismos patrones.
  • Las 500 agendas fueron generadas por un LLM no identificado y no se publica su prompt o configuración.
  • No se informa la distribución del número de tareas, duraciones, categorías o estructura de las agendas.
  • La composición de las agendas sintéticas puede codificar sesgos y regularidades favorables a los prompts.
  • Los mismos horarios parecen reutilizarse entre condición y control, pero se aplican t-tests independientes y no emparejados.
  • No se usa un modelo de medidas repetidas o mixto que represente horarios compartidos y múltiples condiciones.
  • No se documentan repeticiones de un prompt idéntico, así que no se estima variabilidad entre ejecuciones.
  • Una sola muestra por agenda y condición no sustenta la afirmación de un efecto estable bajo no determinación.
  • No se publican semillas, retries, respuestas inválidas, fallos de UID ni reglas de recuperación.
  • Faltan los identificadores exactos de checkpoint, fechas de API y versiones del proveedor.
  • No se informan top-p, semilla y otros parámetros necesarios para reproducir las condiciones principales.
  • Las cinco métricas de secuencia son correlacionadas y parcialmente redundantes; no constituyen evidencias independientes.
  • No queda claro si Levenshtein y LCS se calculan sobre tokens UID o sobre caracteres de hashes concatenados.
  • Si se calculan a nivel de carácter, la distancia entre hashes SHA-512 no representa una diferencia semántica entre tareas.
  • LCSS y LCP miden conservación del orden inicial, no calidad o plausibilidad de la decisión.
  • Hamming pondera por igual cualquier desacuerdo de posición y no incorpora tiempo, duración o coste.
  • El Similarity Ratio se define como similitud, pero sus valores en las tablas se comportan como distancia.
  • El texto afirma que SR baja con temperatura, mientras la Tabla 1 muestra un aumento neto en ambos modelos.
  • Los valores de LCSS y LCP a temperatura cero citados en el texto no coinciden con la Tabla 1.
  • La caída de Hamming con temperatura contradice una lectura simple de mayor desalineación y no se prueba estadísticamente.
  • No se aplican tests de tendencia o monotonicidad al barrido de temperatura.
  • Las tablas de significación omiten p-valores exactos, tamaños de efecto e intervalos de confianza.
  • Con n=500, diferencias absolutas pequeñas pueden alcanzar significación, como muestra GPT-3.5-Turbo.
  • La corrección Bonferroni se aplica a 50 pruebas por modelo, no a todas las familias analíticas del artículo.
  • No hay una prueba formal de interacción modelo por rasgo que sustente comparaciones de capacidad entre modelos.
  • Atribuir los efectos mayores de GPT-4o a razonamiento superior no descarta diferencias de seguimiento de instrucciones.
  • La expresión «aceptar la hipótesis nula» para nueve pruebas es incorrecta; solo cabe no rechazarla.
  • Las barras de error de desplazamiento son desviaciones estándar, no intervalos de confianza sobre la media.
  • El desplazamiento medio puede ocultar patrones heterogéneos y cancelación entre agendas.
  • En cualquier permutación, adelantar unas tareas obliga a retrasar otras; los efectos por tarea son composicionales.
  • No se prueban otras listas de tareas, dominios, idiomas, culturas o modelos abiertos.
  • No se publican código, agendas, datos, salidas, prompts completos ni scripts de análisis.
  • Una búsqueda dirigida no localizó un repositorio oficial o artefactos reproducibles vinculados al trabajo.
  • No se informa coste, latencia, consumo de tokens o dependencia temporal de APIs cerradas.
  • No se evalúa un honeypot, atacante, operación SANDMAN o resultado de ciberdefensa.
  • La plausibilidad para engañar a un observador o retener a un adversario no se mide.
  • La sección ética propone salvaguardas genéricas, pero no implementa supervisión, control de acceso o mitigación.
  • La idea de «rightful deception» no analiza falsos positivos, límites legales ni mecanismos concretos de rendición de cuentas.
  • El artículo no contiene una sección formal que delimite sus limitaciones.

Qué no demuestra

  • No demuestra que GPT-4o, GPT-4o-mini o GPT-3.5-Turbo posean personalidad.
  • No demuestra un constructo OCEAN estable, fiable o psicométricamente válido.
  • No separa personalidad inducida de seguimiento semántico directo del prompt.
  • No prueba que la reordenación mejore una agenda o una decisión.
  • No demuestra planificación autónoma en un entorno real.
  • No prueba consistencia bajo ejecuciones repetidas del mismo prompt.
  • No establece generalización a otras tareas, idiomas, dominios o familias de modelos.
  • No demuestra plausibilidad para observadores humanos o atacantes.
  • No valida todos los rasgos OCEAN mediante conducta específica del rasgo.
  • No demuestra que cinco métricas correlacionadas aporten cinco validaciones independientes.
  • No establece una relación monotónica fiable entre temperatura y todas las métricas.
  • No prueba que GPT-4o tenga mayor capacidad de razonamiento por mostrar más reordenación.
  • No demuestra eficacia de SANDMAN, honeypots o defensa cibernética proactiva.
  • No evalúa seguridad, legalidad, equidad o daños del sistema propuesto.
  • No ofrece una replicación completa con los artefactos públicos disponibles.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2504.00727v1 (1 Apr 2025); published in AAMAS 2025 proceedings; CC BY 4.0

Fuente consultada: https://arxiv.org/pdf/2504.00727v1

Revisión: Codex full-text, visual, statistical, metric-consistency, ethics and artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o (exact snapshot not reported)
  • GPT-4o-mini (exact snapshot not reported)
  • GPT-3.5-Turbo (exact snapshot not reported)
  • Unidentified LLM used to generate the 500 schedules
  • SANDMAN deceptive-agent architecture as prior/proposed application context

Instrumentos y métricas

  • High and low prompt descriptions for the five OCEAN traits
  • Task-position movement delta
  • Longest Common Substring (LCSS)
  • Longest Common Prefix (LCP)
  • Levenshtein Distance (LEV)
  • LCS-derived Similarity Ratio (SR)
  • Hamming Distance (HAM)
  • Independent two-sample Welch t-tests
  • Bonferroni family-wise correction to p≤.001
  • Temperature sweep from 0.0 to 1.6 in increments of 0.2

Datos utilizados

  • 500 synthetic work-oriented daily schedules generated by an unidentified LLM
  • Ten OCEAN persona conditions plus one no-personality baseline
  • Task categories manually treated as work, personal, social or solitary
  • Per-condition transformed UID sequences for three closed OpenAI model families

Evidencia y localización

  • Objetivo, alcance y contribuciones declaradas: arXiv v1, abstract and section 1, pp. 1–2
  • Generación de 500 agendas y UID SHA-512: arXiv v1, section 3.1, pp. 2–3
  • Ciclo de decisión, orden del prompt y obligación de completar tareas: arXiv v1, section 3.1 and Figure 1, p. 3
  • Construcción de las diez personas OCEAN y control: arXiv v1, section 3.2, p. 3
  • Desplazamiento y métricas de comparación de secuencias: arXiv v1, section 3.3, pp. 3–4
  • Resultados por tareas para responsabilidad: arXiv v1, sections 4.1.1–4.1.2 and Figures 2–4, pp. 4–5
  • Resultados por tareas para extraversión: arXiv v1, section 4.1.3 and Figures 5–7, p. 5
  • Definición normalizada de similitud y distancia: arXiv v1, section 4.2, pp. 5–6
  • Valores del barrido de temperatura e inconsistencia de SR: arXiv v1, Table 1 and section 4.2.1, p. 6
  • Contradicción entre valores de temperatura citados y tabla: arXiv v1, Table 1 and section 4.2.1, p. 6
  • Welch, 50 comparaciones y Bonferroni: arXiv v1, section 4.2.2, p. 7
  • Resultados completos de GPT-4o y GPT-4o-mini: arXiv v1, Table 2 and section 4.2.3, p. 7
  • Resultados y pequeña magnitud absoluta de GPT-3.5-Turbo: arXiv v1, Table 3 and section 4.2.4, p. 7
  • Interpretación, aplicación propuesta y límites del resultado: arXiv v1, section 5, pp. 7–8
  • Riesgos y salvaguardas éticas declaradas: arXiv v1, section 5.1, p. 8
  • Versión, publicación y licencia: arXiv:2504.00727v1 metadata and paper front matter; AAMAS 2025; CC BY 4.0
  • Ausencia de artefactos públicos enlazados: arXiv v1 paper and metadata plus targeted repository search; audited 15 Jul 2026