From Persona to Personalization: A Survey on Role-Playing Language Agents

Revisiones, teoría y gobernanza2024arXivRevisión editorial aprobada

Autores: Jiangjie Chen, Xintao Wang, Rui Xu, Siyu Yuan, Yikai Zhang, Wei Shi, Jian Xie, Shuang Li, Ruihan Yang, Tinghui Zhu, Aili Chen, Nianqi Li, Lida Chen, Caiyu Hu, Siye Wu, Scott Ren, Ziquan Fu, Yanghua Xiao

Palabras clave: role-playing agents, persona modeling, personalization, character simulation, interactive systems, LLM applications, human-likeness

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

18
Autores
24
Hallazgos
35
Limitaciones
23
Evidencias

Resumen editorial

Español

Esta revisión narrativa de 50 páginas, aceptada en TMLR en 2024, organiza el campo de los agentes de lenguaje de juego de rol (RPLA) alrededor de una progresión útil pero conceptual: persona demográfica, persona de personaje y persona individualizada. La primera representa grupos, profesiones, identidades, intereses o tipos de personalidad, y explota patrones y estereotipos estadísticos aprendidos por el LLM; la segunda representa figuras públicas, históricas o ficticias con atributos y narrativas establecidas; la tercera construye un perfil dinámico de una persona concreta a partir de sus datos, preferencias e interacciones. Las categorías pueden coexistir: un tutor que interpreta a Sócrates puede reunir el arquetipo de filósofo griego, el personaje Sócrates y una personalización aprendida del usuario. El artículo no propone ni prueba un modelo nuevo. Sintetiza literatura y productos para clasificar cómo se obtienen los datos, cómo se construyen los agentes, cómo se evalúan y qué riesgos plantean. Para la construcción distingue entrenamiento paramétrico, preentrenamiento, ajuste supervisado y refuerzo, de prompting no paramétrico, incluidos perfiles, demostraciones, recuperación y memoria. Para la evaluación separa capacidad general de role-play, participación, calidad conversacional y habilidades antropomórficas, de fidelidad a una persona concreta, estilo lingüístico, conocimiento, personalidad y proceso de pensamiento, y resume cuatro familias de evaluación: métricas o jueces con ground truth, jueces sin ground truth, preguntas de opción múltiple y evaluación humana. El propio texto advierte que los jueces LLM pueden desconocer personajes, que el ground truth suele ser sintético y que las evaluaciones humanas son costosas y difíciles de reproducir. La sección demográfica revisa la medición de rasgos inherentes mediante cuestionarios humanos y el steering por prompt, pero reconoce que asignar roles puede amplificar toxicidad y sesgo. La sección de personajes diferencia descripciones y demostraciones, y compara extracción de experiencias, síntesis de diálogos y anotación humana; la Tabla 2 reúne 18 filas de datasets, desde PDP y Character-LLM hasta PersonaHub. La sección individualizada organiza los datos en perfil, interacciones y conocimiento de dominio; la Tabla 3 reúne 14 datasets en inglés, chino, japonés y coreano, y contrasta aprendizaje offline con adaptación online mediante memoria, recuperación, fine-tuning o feedback. También ordena las aplicaciones personalizadas en conversación, recomendación y resolución de tareas. La contribución más responsable del artículo es que no reduce el tema a “imitar personalidad”: dedica secciones a toxicidad, sesgo, alucinación de personaje, privacidad, falta de inteligencia social, contexto largo, lagunas de conocimiento y antropomorfización. Señala que la fidelidad a personajes dañinos entra en tensión con la seguridad, que personalizar requiere almacenar datos sensibles y que la dependencia emocional o la suplantación no declarada puede fomentar aislamiento o manipulación. Sus cuatro direcciones futuras son análisis causal de decisiones, mejor toma de decisiones, asistentes personales integrales y simulación social autónoma. El apéndice añade una fotografía del mercado de 2024: 49 filas de productos, 13 orientadas a persona y 36 a tareas, pero solo 48 nombres únicos porque Squirrel AI aparece dos veces. Ese inventario es ilustrativo, no una evaluación de producto: no aporta fecha de corte, protocolo de búsqueda, pruebas de funcionalidades, fuentes por fila ni criterios de inclusión, y varias descripciones son afirmaciones comerciales no verificadas en el paper. Esta misma limitación afecta a la literatura. Aunque se autodenomina revisión sistemática y obtuvo la certificación de survey de TMLR, el texto no publica consulta de búsqueda, bases consultadas, periodo, cribado, criterios de inclusión o exclusión, diagrama de selección, extracción duplicada ni evaluación de calidad o sesgo. Por tanto, el trabajo es una taxonomía amplia y muy útil para orientarse hasta octubre de 2024, no una revisión sistemática reproducible ni una medición empírica de que los LLM posean personalidad, inteligencia social, consciencia o una réplica fiel de individuos. Su lenguaje de “apariencia humana”, “vida digital” y convivencia debe leerse como framing del campo, no como evidencia ontológica. Para este proyecto sirve como columna vertebral conceptual y como catálogo histórico de métodos, datasets, evaluaciones y riesgos, siempre etiquetando su alcance temporal y sus límites de selección.

English

This 50-page narrative survey, accepted in TMLR in 2024, organizes role-playing language agents (RPLAs) around a useful but conceptual progression: demographic persona, character persona, and individualized persona. The first represents groups, professions, identities, interests, or personality types, and draws on statistical patterns and stereotypes learned by an LLM; the second represents public, historical, or fictional figures with established attributes and narratives; the third builds a dynamic profile of a particular person from their data, preferences, and interactions. The categories can coexist: a Socrates tutor may combine the demographic archetype of an ancient Greek philosopher, the Socrates character, and personalization learned from the user. The paper neither proposes nor tests a new model. It synthesizes literature and products to classify how data are sourced, how agents are constructed, how they are evaluated, and what risks they pose. For construction, it separates parametric training, pretraining, supervised fine-tuning, and reinforcement learning, from nonparametric prompting, including profiles, demonstrations, retrieval, and memory. For evaluation, it distinguishes general role-playing capability, engagement, conversation quality, and anthropomorphic abilities, from fidelity to a particular persona, linguistic style, knowledge, personality, and thought process, and summarizes four evaluation families: metrics or judges with ground truth, judges without ground truth, multiple-choice questions, and human evaluation. The text itself notes that LLM judges may lack character knowledge, that ground truth is often synthetic, and that human evaluations are costly and hard to reproduce. The demographic section reviews human questionnaire use to characterize inherent traits and prompt-based steering, while recognizing that assigned roles can amplify toxicity and bias. The character section separates descriptions from demonstrations and compares experience extraction, dialogue synthesis, and human annotation; Table 2 lists 18 dataset rows ranging from PDP and Character-LLM to PersonaHub. The individualized section organizes data as profiles, interactions, and domain knowledge; Table 3 lists 14 datasets across English, Chinese, Japanese, and Korean, and contrasts offline learning with online adaptation through memory, retrieval, fine-tuning, or feedback. It also groups personalized applications into conversation, recommendation, and task solving. The paper's most responsible contribution is that it does not reduce the topic to “personality imitation”: dedicated sections cover toxicity, bias, character hallucination, privacy, lack of social intelligence, long context, knowledge gaps, and anthropomorphism. It notes that fidelity to harmful characters conflicts with safety, personalization requires storing sensitive data, and emotional dependence or undisclosed impersonation may foster isolation or manipulation. Its four future directions concern causal analysis of decisions, improved decision making, comprehensive personal assistants, and autonomous social simulation. The appendix adds a snapshot of the 2024 market: 49 product rows, 13 persona-oriented and 36 task-oriented, but only 48 unique names because Squirrel AI is listed twice. This inventory is illustrative rather than a product evaluation: it supplies no cutoff date, search protocol, feature testing, row-level sources, or inclusion criteria, and several descriptions reproduce commercial claims not verified in the paper. The same qualification applies to the literature review. Although the paper calls the review systematic and received TMLR survey certification, it reports no search query, databases, time window, screening procedure, inclusion or exclusion criteria, selection flow, duplicate extraction, or quality and bias appraisal. The work should therefore be treated as a broad and useful taxonomy for orientation through October 2024, not as a reproducible systematic review or empirical evidence that LLMs possess personality, social intelligence, consciousness, or a faithful replica of an individual. Its language about “human likeness,” “digital life,” and human-RPLA coexistence is field framing, not an ontological finding. For this project it can serve as a conceptual backbone and historical catalog of methods, datasets, evaluations, and risks, provided its temporal scope and selection limitations remain explicit.

Pregunta de investigación

¿Cómo puede organizarse la investigación y el mercado de los agentes de lenguaje de juego de rol según el tipo de persona representada, las fuentes de datos, los métodos de construcción y evaluación, y los riesgos asociados?

Método

Revisión narrativa y taxonómica de literatura sobre LLM y agentes, estructurada en tres tipos progresivos de persona: demográfica, de personaje e individualizada. El artículo sintetiza métodos de construcción, datasets, dimensiones y técnicas de evaluación, riesgos y productos comerciales mediante tres tablas de investigación, una taxonomía gráfica y un apéndice de mercado. No documenta una estrategia reproducible de búsqueda, cribado, extracción o evaluación de calidad, por lo que “sistemática” describe la amplitud organizativa, no un protocolo de revisión sistemática verificable.

Muestra: El paper no define una muestra bibliográfica reproducible. Su corpus visible se materializa en referencias distribuidas por una taxonomía, 18 filas de datasets de personaje, 14 filas de datasets individualizados y 49 filas de productos de mercado, con una duplicación de Squirrel AI que deja 48 nombres únicos. La cobertura llega hasta trabajos citados de 2024 y la versión final es de octubre de 2024.

Hallazgos

  • Propone una progresión conceptual de persona demográfica a personaje e individualizada.
  • Las tres categorías no son excluyentes y pueden coexistir en un mismo agente.
  • La persona demográfica se apoya explícitamente en patrones y estereotipos estadísticos del preentrenamiento.
  • La persona de personaje exige representar atributos, historia, relaciones, conocimiento, estilo y decisiones de una figura establecida.
  • La persona individualizada se actualiza con datos y preferencias de una persona concreta.
  • La construcción se divide en entrenamiento paramétrico y prompting no paramétrico, que pueden combinarse.
  • El prompting incluye descripciones, demostraciones, recuperación y memoria de largo plazo.
  • Los datos de personaje se distinguen entre descripciones y demostraciones.
  • Las demostraciones pueden proceder de extracción de experiencias, síntesis con LLM o anotación humana.
  • La síntesis sin fuente de referencia se describe como limitada por el LLM profesor y necesitada de filtrado.
  • La evaluación separa capacidad general de role-play y fidelidad a una persona específica.
  • La fidelidad incluye estilo lingüístico, conocimiento, personalidad y proceso de pensamiento.
  • El artículo reconoce que los jueces LLM pueden evaluar mal personajes que desconocen.
  • El artículo reconoce que parte del ground truth de evaluación se sintetiza con modelos avanzados.
  • Los datos individualizados se organizan en perfil, interacciones y conocimiento de dominio.
  • La personalización se organiza por conversación, recomendación y resolución de tareas.
  • El aprendizaje individualizado se divide en offline y online, con un papel central de memoria y recuperación.
  • La revisión dedica secciones explícitas a toxicidad, sesgo, alucinación de personaje, privacidad y despliegue.
  • La antropomorfización se vincula con dependencia, aislamiento social y manipulación de opinión pública.
  • Las direcciones futuras propuestas incluyen causalidad, decisiones, asistentes personales y simulación social.
  • La Tabla 2 presenta 18 filas de datasets de personaje y la Tabla 3 presenta 14 filas individualizadas.
  • El apéndice comercial presenta 49 filas pero 48 nombres únicos por duplicar Squirrel AI.
  • La versión auditada es arXiv v2 de octubre de 2024 y el trabajo fue aceptado en TMLR 2024.
  • No se identifica un repositorio oficial de código o dataset específico del survey, y el trabajo no depende de uno para su contribución taxonómica.

Limitaciones

  • Es una revisión narrativa; no publica una consulta de búsqueda reproducible.
  • No indica qué bases bibliográficas se consultaron.
  • No declara una fecha de corte explícita para la búsqueda de literatura.
  • No define criterios de inclusión y exclusión.
  • No muestra un proceso de cribado ni un diagrama de selección.
  • No informa extracción por revisores independientes ni resolución de desacuerdos.
  • No evalúa calidad, riesgo de sesgo o fuerza de evidencia de los estudios incluidos.
  • No explica cómo se eligieron los trabajos representativos que aparecen en la taxonomía.
  • No permite determinar la exhaustividad ni el sesgo de cobertura del corpus.
  • La cobertura termina en 2024 y no representa el estado actual de 2026.
  • Agrupar demografía, personajes e individuos en una progresión puede ocultar diferencias éticas y epistemológicas profundas.
  • La categoría demográfica mezcla profesiones, grupos sociales, intereses y tipologías psicológicas heterogéneas.
  • Usar MBTI como ejemplo no implica que sea una medida científica validada para LLM.
  • Aplicar cuestionarios humanos a texto de LLM no demuestra que el constructo psicométrico mida lo mismo.
  • La revisión cita resultados de estudios pero rara vez compara diseños, tamaños, incertidumbre o replicaciones.
  • No realiza meta-análisis ni síntesis cuantitativa.
  • El texto enumera los métodos de evaluación como “three-fold” y a continuación lista cuatro categorías.
  • Las métricas con ground truth sintético pueden heredar sesgos y errores del modelo generador.
  • Los jueces LLM sin ground truth carecen a menudo de conocimiento suficiente sobre personajes menos conocidos.
  • La evaluación humana se caracteriza como costosa y poco reproducible, pero no se ofrece un estándar alternativo validado.
  • El término character hallucination redefine alucinación como ruptura del rol o conocimiento fuera de época, no como falsedad factual general.
  • La tensión entre fidelidad a un personaje dañino y seguridad se discute, pero no se resuelve con criterios operativos.
  • La discusión de privacidad es general y no compara amenazas, garantías o requisitos regulatorios por técnica.
  • La sección de antropomorfismo formula riesgos plausibles sin aportar una revisión específica de evidencia clínica o longitudinal.
  • El inventario de productos no publica método de búsqueda, criterios de selección ni fuentes por producto.
  • No se verifican empíricamente las funcionalidades, modelos o prácticas de datos atribuidas a productos comerciales.
  • La Tabla 4 no declara una fecha de corte y quedó rápidamente expuesta a obsolescencia.
  • Squirrel AI aparece duplicado en la Tabla 4 con dos descripciones distintas.
  • Algunas referencias están incompletas y API-Bank aparece citado dos veces en la bibliografía.
  • La etiqueta de “revisión sistemática” puede inducir a error porque no se acompaña de un protocolo sistemático reproducible.
  • La certificación survey de TMLR acredita el tipo de contribución, no garantiza exhaustividad metodológica.
  • Expresiones como human likeness, digital life y coexistencia armónica son framing aspiracional y favorecen antropomorfización.
  • La revisión no distingue de forma consistente evidencia sobre comportamiento observable de afirmaciones sobre cognición o estados internos.
  • No hay artefacto estructurado que permita actualizar automáticamente la taxonomía, las tablas o el inventario de productos.
  • No se aporta repositorio oficial con la selección bibliográfica, fichas de extracción o historial de cambios.

Qué no demuestra

  • No demuestra que los LLM tengan personalidad humana.
  • No demuestra que los RPLA posean consciencia, identidad, emociones o experiencia subjetiva.
  • No demuestra que una puntuación en un cuestionario humano tenga la misma validez psicométrica en un LLM.
  • No demuestra que un agente que imita un estilo sea fiel a la personalidad o al pensamiento de una persona.
  • No demuestra que los tres tipos de persona sean una ontología única o exhaustiva.
  • No demuestra causalmente que asignar personas mejore la resolución de tareas en general.
  • No demuestra que mayor role-play engagement implique mayor fidelidad.
  • No demuestra que los jueces LLM sean evaluadores válidos o imparciales de personalidad.
  • No demuestra que el ground truth sintético represente respuestas humanas o canónicas.
  • No demuestra que la memoria de interacción produzca una réplica digital de una persona.
  • No demuestra que los RPLA sean seguros para apoyo emocional, salud, educación o decisiones personales.
  • No demuestra que anonimización, filtros o protocolos generales eliminen riesgos de privacidad y abuso.
  • No demuestra que la simulación multiagente reproduzca sociedades humanas.
  • No demuestra que los productos enumerados implementen realmente todas las capacidades atribuidas.
  • No establece el estado del mercado ni de la investigación después de octubre de 2024.
  • No constituye una revisión sistemática reproducible aunque use ese término.
  • No ofrece evidencia empírica propia para comparar modelos, métodos o productos.
  • No valida una teoría psicológica de la personalidad sintética.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2404.18231v2, revised 9 Oct 2024; accepted and published in Transactions on Machine Learning Research, October 2024; OpenReview forum xrO70E8UIZ

Fuente consultada: https://arxiv.org/pdf/2404.18231

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, taxonomy, review-method, persona-construction, evaluation, psychometrics, dataset, risk, anthropomorphism, privacy, product-inventory and temporal-scope audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Large language models as a general model class
  • GPT-4 and ChatGPT as examples and automated evaluators in surveyed work
  • Claude, PaLM 2 and other contemporary foundation models as background examples
  • Parametrically trained role-playing language agents surveyed across prior work
  • Prompted and retrieval-augmented role-playing language agents surveyed across prior work

Instrumentos y métricas

  • Three-level RPLA persona taxonomy
  • Construction taxonomy: pretraining, supervised fine-tuning, reinforcement learning and in-context prompting
  • Role-playing capability versus persona fidelity distinction
  • Automatic evaluation with ground truth
  • Automatic evaluation without ground truth and LLM-as-judge
  • Multiple-choice evaluation
  • Human evaluation
  • Psychological questionnaires cited in surveyed studies, including Big Five instruments
  • Application-tier taxonomy: conversation, recommendation and task solving
  • Risk taxonomy: toxicity, bias, character hallucination, privacy, deployment challenges and anthropomorphism

Datos utilizados

  • Table 2: 18 rows of character-persona datasets
  • Table 3: 14 rows of individualized-persona datasets
  • PDP, Character-LLM, ChatHaruhi, RoleLLM, HPD and CharacterGLM
  • PIPPA, RoleEval, CharacterEval, DITTO, RolePersonality and MORTISE
  • CroSS-MR, SocialBench, TimeChara, LifeChoice, InCharacter and PersonaHub
  • PERSONA-CHAT, ConvAI, Qianyan, P-Ubuntu, P-Weibo and FoCus
  • MPCHAT, OpinionQA, Synthetic-Persona-Chat, COMSET, RealPersonaChat, LiveChat, KBP and Cho et al. 2023
  • Table 4: 49 product rows representing 48 unique product names

Evidencia y localización

  • Registro oficial y alcance temporal: arXiv:2404.18231v2, submitted 28 Apr 2024, revised 9 Oct 2024; accepted to TMLR 2024; OpenReview forum xrO70E8UIZ
  • Fuente completa auditada: .cache/editorial-sources/article-104/source.pdf; 50 pages; sha256 dc0680f09336e4be4c49ab278d619dba1a52c3d7f6e5bf45a79a586c6bfb64d7
  • Objetivo y taxonomía de tres personas: Full text pp. 1-3, Abstract, Introduction and Figure 1
  • Antecedentes de LLM y agentes: Full text pp. 3-5, sections 2.1-2.2
  • Taxonomía global de investigación: Full text p. 6, Figure 2
  • Métodos de construcción: Full text pp. 7-8, Table 1 and sections 3.2-3.3
  • Persona demográfica: Full text pp. 9-11, section 4
  • Datasets y datos de personaje: Full text pp. 11-13, section 5.2 and Table 2
  • Construcción de personajes: Full text pp. 13-14, section 5.3
  • Dimensiones y métodos de evaluación: Full text pp. 14-16, section 5.4
  • Error three-fold versus cuatro categorías: Full text pp. 8 and 15, sections 3.3 and 5.4
  • Persona individualizada y datasets: Full text pp. 16-18, sections 6.1-6.3 and Table 3
  • Evaluación de personalización: Full text pp. 18-19, section 6.4
  • Toxicidad y sesgo: Full text pp. 19-21, sections 7.1-7.2
  • Alucinación de personaje y privacidad: Full text pp. 21-22, sections 7.3-7.4
  • Despliegue y antropomorfización: Full text pp. 22-23, sections 7.5-7.6
  • Conclusiones y futuras direcciones: Full text pp. 23-24, section 8
  • Ausencia de protocolo sistemático reproducible: Full text pp. 1-24: no search query, databases, cutoff, inclusion/exclusion criteria, screening flow, duplicate extraction or study-quality appraisal reported
  • Inventario de productos: Full text pp. 43-50, Appendix A and Table 4
  • Recuento y duplicación del inventario: Table 4 audit: 13 persona-oriented rows plus 36 task-oriented rows, 49 total rows, 48 unique names; Squirrel AI listed twice
  • Problemas bibliográficos: Full text References: API-Bank appears in two adjacent entries; several web/preprint references lack complete publication metadata
  • Ausencia de artefacto del survey: Official arXiv record exposes PDF, HTML and TeX source but no author-provided code/data repository; checked 15 Jul 2026
  • Comprobación visual integral: All 50 PDF pages rendered and visually inspected: 24 main-text pages, 19 reference pages and 7 product-appendix pages; checked 15 Jul 2026