Psychologically Enhanced AI Agents

Personas, identidad y agentes2025arXivRevisión editorial aprobada

Autores: Maciej Besta, Shriram Chandran, Robert Gerstenberger, Mathis Lindner, Marcin Chrapek, Sebastian Hermann Martschat, Taraneh Ghandi, Patrick Iff, Hubert Niewiadomski, Piotr Nyczyk, Jürgen Müller, Torsten Hoefler

Palabras clave: Artificial Intelligence, Computation and Language, Computers and Society, Human-Computer Interaction, Multiagent Systems

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

12
Autores
7
Hallazgos
11
Limitaciones
10
Evidencias

Resumen editorial

Español

El artículo presenta MBTI-in-Thoughts (MiT), un marco de prompts que asigna a agentes LLM uno de los 16 perfiles MBTI y estudia si esas instrucciones cambian respuestas psicométricas, relatos, estrategias en juegos y colaboración multiagente. Para validar la inducción, GPT-4o mini responde los 60 ítems de 16Personalities cinco veces por perfil, a temperatura 1; los prompts incluyen tanto una descripción del tipo como cuatro ejemplos de respuesta ya alineados con sus ejes. Los diagramas separan con claridad E/I, T/F y J/P, mientras S/N resulta más débil. Esta prueba demuestra seguimiento coherente de instrucciones en el mismo constructo que el prompt explicita, no una personalidad interna ni persistencia fuera del test. En generación narrativa se toman 100 prompts de WritingPrompts y se generan historias para los 16 tipos y dos controles, EXPERT y NONE. En el resultado mostrado, Qwen3-235B-A22B a temperatura 0 produce diferencias de tono evaluadas automáticamente: los perfiles Feeling reciben mayores puntuaciones de carga emocional, final feliz y carácter personal. Sin embargo, los controles también mejoran cohesión y redundancia respecto de historias humanas, por lo que el propio texto reconoce que el efecto específico de personalidad sobre esas propiedades de calidad es pequeño. En juegos repetidos, el trabajo define honestidad como coincidencia entre la acción anunciada, inferida por otro LLM, y la acción elegida. En la figura agregada para GPT-4, Thinking aparece con aproximadamente 90 % de defección frente a 50 % en Feeling; Thinking cambia de estrategia alrededor de 0,07 frente a 0,16 en Feeling; e Introversion alcanza una honestidad cercana a 0,54 frente a 0,33 en Extraversion. Son patrones del protocolo, cuyo prompt permite expresamente mentir, no medidas generales de honestidad, cognición o seguridad. En BIG-Bench y SOCKET, la comunicación con reflexión privada supera a la comunicación interactiva simple, pero queda aproximadamente al nivel de la votación independiente; por tanto, no se demuestra una mejora sobre el control más sencillo. La extensión a Big Five, HEXACO, Eneagrama y DISC es una formalización vectorial ilustrativa, no una evaluación experimental de esos marcos. El artículo admite que selecciona resultados “representativos” y omite datos sin “insights relevantes”. Además, el repositorio oficial no reproduce de forma ejecutable el estudio: no contiene resultados ni una instantánea de entorno, tres módulos no compilan por imports con guion, varios scripts apuntan a rutas inexistentes, el juez de los protocolos interactivos no recibe la conversación final y la configuración publicada de teoría de juegos usa temperatura 0 o GPT-4o mini, frente a GPT-4 y temperatura 1 declarados en la figura. Por estas razones, las conclusiones aplicadas a salud, negociación, seguridad o justicia son especulativas.

English

The paper presents MBTI-in-Thoughts (MiT), a prompting framework that assigns one of 16 MBTI profiles to LLM agents and examines whether those instructions alter psychometric answers, stories, game strategies, and multi-agent collaboration. For induction validation, GPT-4o mini answers the 60-item 16Personalities assessment five times per profile at temperature 1. The prompt contains both a profile description and four answer exemplars already aligned with the requested axes. The plots clearly separate E/I, T/F, and J/P, while S/N is weaker. This supports consistent instruction following on the same construct explicitly encoded by the prompt, not an internal personality or persistence beyond the test. For narrative generation, the study samples 100 WritingPrompts items and generates stories for all 16 types plus EXPERT and NONE controls. In the displayed Qwen3-235B-A22B, temperature-0 result, automated scores assign Feeling profiles greater emotional chargedness, happier endings, and personalness. Yet the controls also improve cohesion and redundancy over human stories, and the paper acknowledges that the personality-specific effect on those quality properties is small. In repeated games, honesty is operationalized as agreement between an action announced in a message, as inferred by another LLM, and the selected action. In the aggregated GPT-4 figure, Thinking profiles defect in roughly 90% of rounds versus 50% for Feeling; Thinking switches strategy at about 0.07 versus 0.16 for Feeling; and Introversion reaches about 0.54 honesty versus 0.33 for Extraversion. These are protocol-specific patterns under instructions that explicitly permit deception, not general measures of honesty, cognition, or safety. On BIG-Bench and SOCKET, communication with private reflection outperforms plain interactive communication but is approximately comparable to independent voting, so it does not establish an improvement over the simpler control. The claimed extension to Big Five, HEXACO, Enneagram, and DISC is an illustrative vector formalization rather than an experimental evaluation. The paper explicitly says it presents representative results and omits data that does not yield relevant insights. The official repository also does not provide an executable reproduction: it contains no raw results or locked environment, three modules fail compilation because of hyphenated import names, several scripts reference missing paths, the interactive-protocol judge is not passed the concluding conversation, and the published game configuration fixes temperature 0 or invokes GPT-4o mini whereas the figure reports GPT-4 at temperature 1. Claims about healthcare, negotiation, safety, or judicial use therefore remain speculative.

Pregunta de investigación

¿Puede el condicionamiento por prompt basado en perfiles MBTI producir sesgos conductuales medibles en agentes LLM y aprovecharse para generación narrativa, interacción estratégica y razonamiento multiagente; y es el mismo mecanismo formalmente adaptable a otros marcos de personalidad?

Método

Estudio de prompting en cuatro bloques. (1) GPT-4o mini responde los 60 ítems de 16Personalities para cada uno de los 16 perfiles, con cinco respuestas por ítem y temperatura 1; se envían las respuestas al backend de 16Personalities y se representan las cuatro dicotomías. (2) Qwen3-235B-A22B genera historias a temperatura 0 para 100 prompts de WritingPrompts bajo 16 perfiles y los controles EXPERT y NONE; un LLM juez puntúa once atributos narrativos y se calculan además métricas léxicas y de legibilidad en el código. (3) Parejas de agentes juegan dilemas repetidos con un mensaje y una acción por ronda; GPT-4o mini clasifica la intención del mensaje y se calculan defección, cambios de estrategia y coincidencia mensaje-acción. (4) Equipos de tres agentes resuelven seis tareas BIG-Bench/SOCKET mediante votación, comunicación interactiva o comunicación con scratchpad privado. El manuscrito no informa de manera completa el número de ejecuciones, unidades estadísticas ni todas las combinaciones incluidas en las figuras, y declara selección de resultados representativos.

Muestra: El protocolo psicométrico descrito implica 16 perfiles × 60 ítems × 5 respuestas, es decir, 4.800 respuestas de GPT-4o mini. La tarea narrativa usa 100 prompts × 18 condiciones (16 tipos y dos controles), hasta 1.800 historias por modelo si todas las celdas están completas. Para los juegos, el repositorio propone siete rondas por emparejamiento y recorre combinaciones de 16 tipos más NONE, ALTRUISTIC y SELFISH, pero el manuscrito no documenta qué ejecuciones exactas alimentan cada figura ni publica los CSV. En multiagente, el script usa equipos de tres, seis configuraciones de equipo, seis tareas y una ejecución por configuración; el artículo no informa los recuentos de ítems por barra ni intervalos reproducibles.

Hallazgos

  • La verificación con 16Personalities separa fuertemente E/I, T/F y J/P; S/N es menos nítida. Como el prompt describe el perfil e incluye cuatro ejemplos ya alineados con los ejes, el resultado es compatible con seguimiento de instrucciones y contaminación del test.
  • En 100 prompts narrativos, los perfiles Feeling reciben mayores puntuaciones automáticas de carga emocional, finales felices y carácter personal, especialmente INFP, INFJ e ISFP; Extraversion se asocia en la figura con mayor legibilidad, humor y finales felices.
  • Las mejoras de cohesión y redundancia frente a historias humanas también aparecen con NONE y EXPERT, por lo que el manuscrito considera pequeño el efecto específico del perfil sobre esas propiedades de calidad.
  • En el protocolo de juegos, Thinking muestra cerca de 90 % de defección frente a 50 % en Feeling y cambia menos de estrategia (aprox. 0,07 frente a 0,16); Introversion muestra mayor coincidencia mensaje-acción que Extraversion (aprox. 0,54 frente a 0,33).
  • La comunicación con autorreflexión privada supera a la interacción sin scratchpad en las seis tareas mostradas, pero su exactitud es comparable a la votación independiente y no evidencia una ventaja general sobre ella.
  • La supuesta generalización a Big Five, HEXACO, Eneagrama y DISC consiste en representar cada marco como un vector de rasgos; no se presentan experimentos, tests de validez ni resultados con esos marcos.
  • El repositorio oficial contiene una implementación sustancial, pero la versión auditada no compila completa ni reproduce las figuras: faltan datos/resultados, las rutas de MBTI y juegos están rotas, y el juez interactivo resuelve desde la tarea sin recibir el diálogo que supuestamente debe juzgar.

Limitaciones

  • Los autores declaran que presentan resultados representativos y omiten datos que no producen insights relevantes; no definen por adelantado criterios de selección ni entregan el conjunto completo de resultados, lo que introduce sesgo de reporte.
  • La evaluación llamada MBTI utiliza el NERIS Type Explorer de 16Personalities. La propia documentación de 16Personalities explica que su modelo combina rasgos Big Five y define los tipos de manera distinta de MBTI; no es el instrumento oficial MBTI.
  • La inducción y la prueba no son independientes: los prompts detallan estereotipos como empatía, honestidad, estructura o espontaneidad y añaden cuatro ejemplos con la respuesta esperada para cada eje antes de administrar los ítems.
  • La evaluación narrativa depende de un único juez LLM sin validación humana, acuerdo entre jueces, análisis de sensibilidad ni resultados por historia; además, el prompt exige al modelo razonar explícitamente sobre su perfil, lo que refuerza el tratamiento.
  • El artículo usa lenguaje de significación pero no ofrece una tabla completa de pruebas, tamaños muestrales, intervalos, corrección por comparaciones múltiples o tratamiento de dependencia entre rondas, perfiles y oponentes.
  • La honestidad es un proxy estrecho: otro LLM infiere la intención del mensaje y se comprueba si coincide con la acción en un juego cuyo prompt autoriza expresamente el engaño. No equivale a veracidad factual, integridad ni fiabilidad en otros contextos.
  • Longitud de la justificación y latencia de respuesta no prueban deliberación interna, autorreflexión ni mayor profundidad cognitiva; también pueden proceder de estilo, longitud del prompt, infraestructura o variación del servicio.
  • La comparación multiagente no iguala tokens ni coste entre protocolos y el resultado más complejo solo iguala aproximadamente la votación; el código publicado, además, no pasa la conversación al juez final.
  • La reproducibilidad es insuficiente: no hay resultados crudos, tests ni CI, no se fija un lockfile, tres archivos fallan compilación por imports inválidos, varias rutas no existen y las configuraciones de modelo/temperatura difieren de las figuras.
  • No hay evaluación con usuarios, pacientes, profesionales sanitarios, negociadores, sistemas de seguridad o justicia; las recomendaciones para esos dominios extrapolan juegos y relatos a contextos de alto riesgo.
  • Es una versión arXiv v1 y working paper, no una publicación revisada por pares identificada en la auditoría; tampoco se incluye una sección sistemática de limitaciones o evaluación de riesgos.

Qué no demuestra

  • No demuestra que un LLM tenga personalidad, afecto, cognición, honestidad, intención o autorreflexión humanas; demuestra cambios de salida bajo prompts explícitos.
  • No prueba que un perfil Feeling o Introverted haga a un agente más seguro, empático, fiable o apto para salud, negociación o justicia.
  • No demuestra que la autorreflexión mejore el razonamiento frente a una votación independiente ni que la diversidad de personalidad reduzca errores correlacionados.
  • No valida la generalización experimental a Big Five, HEXACO, Eneagrama, DISC, modalidades multimodales o agentes incorporados.
  • No separa causalmente personalidad de contenido, longitud, estereotipos y ejemplos incluidos en el prompt, ni de diferencias de modelo, temperatura, coste o protocolo.
  • No permite reproducir las cifras principales a partir del repositorio oficial actual ni verificar si los resultados omitidos contradicen las conclusiones seleccionadas.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2509.04343v1, submitted 4 September 2025, 37 pages

Fuente consultada: https://arxiv.org/pdf/2509.04343

Revisión: Codex full-text, bilingual-fidelity, 37-page visual, official-repository, reproducibility, construct-validity, treatment-contamination, selective-reporting, statistical, automated-judge, game-theory, multi-agent, high-risk-extrapolation and evidence-level audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o mini
  • GPT-4o
  • Qwen3-235B-A22B
  • Qwen2.5-14B-Instruct

Instrumentos y métricas

  • 16Personalities NERIS Type Explorer, 60 items and 7-point response scale
  • MBTI profile prompts with four type-aligned few-shot exemplars
  • PersonaLLM-style automated narrative attributes
  • Lexical richness and readability metrics in the released code
  • Repeated Prisoner's Dilemma and Hawk-Dove games
  • Majority voting, interactive communication and interactive communication with self-reflection
  • Welch t-tests and two-proportion tests in the released analysis code

Datos utilizados

  • WritingPrompts
  • BIG-Bench: causal judgment, dark humor detection, simple ethical questions and disambiguation QA
  • SOCKET: complaints and Stanford politeness
  • Model-generated repeated-game transcripts

Evidencia y localización

  • Objetivo, contribuciones y afirmaciones aplicadas: Paper, pp. 1–2, Abstract and Introduction; p. 9, Conclusion
  • Construcción de prompts, test de 60 ítems y protocolos multiagente: Paper, pp. 4–6, Sections 3.1–4.1; pp. 13–31, Appendix C
  • Diseño y resultados de WritingPrompts: Paper, pp. 6–7, Section 4.2 and Figure 3
  • Defección, cambios de estrategia, honestidad y extrapolaciones: Paper, pp. 7–8, Section 4.3 and Figures 4–5; pp. 32–33, Appendix D.2
  • Resultados de comunicación multiagente: Paper, pp. 32–33, Appendix D.1 and Figure 6
  • Selección de resultados y generalización solo formal: Paper, p. 5, Evaluation & Use Cases; pp. 9–12, Sections 6 and Appendices A–B
  • Diferencia entre NERIS Type Explorer y MBTI: 16Personalities, Our Framework, sections Historical Detour and Our Approach: https://www.16personalities.com/articles/our-theory
  • Fallos de compilación, rutas, ausencia de resultados y configuración: Official repository commit ba760ed73b9592798c964ad64db11a1ca4c7ce8f; pyproject.toml; src/MBTITest; src/WritingPrompt; src/MultiAgent-GameTheory
  • El juez interactivo no recibe el mensaje final: Official repository commit ba760ed73b9592798c964ad64db11a1ca4c7ce8f; src/MultiAgent-BenchmarkTasks/solve_blackboard_independent.py and solve_blackboard_independent_scratchpad.py
  • Inspección visual integral y defectos de maquetación: Paper, all 37 rendered pages; p. 8 malformed text marker and p. 29 stray [H] marker