Two Tales of Persona in LLMs: A Survey of Role-Playing and Personalization

Revisiones, teoría y gobernanza2024ACL AnthologyRevisión editorial aprobada

Autores: Yu-Min Tseng, Yu-Chao Huang, Teng-Yun Hsiao, Wei-Lin Chen, Chao-Wei Huang, Yu Meng, Yun-Nung Chen

Palabras clave: Large Language Models, Persona, Role-Playing, Personalization, LLM Personality Evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

7
Autores
9
Hallazgos
12
Limitaciones
11
Evidencias

Resumen editorial

Español

Este survey propone una distinción sencilla y útil para ordenar literatura que suele mezclar significados diferentes de «persona». En el role-playing, la persona se asigna al propio modelo, médico, juez, programador o personaje, para que actúe dentro de un entorno. En la personalización, la persona pertenece al usuario, historial, preferencias, contexto o atributos, y el modelo adapta su respuesta a esa persona. El artículo convierte esa diferencia de propiedad y objetivo en una taxonomía común, añade una sección sobre evaluación de personalidad y reúne tareas, datasets y trabajos representativos publicados hasta 2024.

La rama de role-playing se organiza por entornos, desarrollo de software, juegos, medicina y LLM como evaluador, por esquema de interacción, agente único o multiagente cooperativo/adversarial, y por conductas descritas como voluntarias, conformistas o destructivas. La rama de personalización cubre recomendación, búsqueda, educación, salud y diálogo orientado a tareas o modelado del usuario. Esta cartografía ayuda a no confundir que un modelo interprete un rol con que infiera y satisfaga preferencias de una persona real, aunque ambos mecanismos pueden coexistir en una aplicación.

La sección de personalidad revisa Big Five, MBTI, Machine Personality Inventory y entrevistas evaluadas por LLM para comprobar alineación con personajes. Su formulación más importante es cautelar: que una salida parezca coherente con la persona asignada no demuestra que un cuestionario psicométrico humano sea transferible al modelo. Sin embargo, esta sección es breve y principalmente descriptiva; no evalúa la calidad psicométrica de cada estudio, no compara instrumentos bajo criterios comunes y en ocasiones reproduce conclusiones fuertes de los trabajos citados, por ejemplo, tipos MBTI o «conductas emergentes», sin volver a analizar su evidencia.

Debe leerse como survey narrativo y mapa de diseño, no como revisión sistemática ni metaanálisis. No declara bases consultadas, consulta de búsqueda, fechas de corte, criterios de inclusión/exclusión, número de registros, cribado, extracción, evaluación de sesgo ni valoración de calidad. Tampoco realiza experimentos propios o una comparación homogénea de resultados, y reconoce que la diversidad de métricas impide construir una tabla de eficacia justa. El repositorio asociado funciona como lista de lectura, pero solo contiene README e imágenes, carece de licencia y datos estructurados y su último commit es la versión camera-ready de octubre de 2024, pese a la promesa de mantenimiento continuo. La contribución defendible es, por tanto, una taxonomía introductoria muy útil para distinguir roles del modelo y perfiles del usuario, no evidencia de que role-playing o personalización mejoren de forma general, segura o psicométricamente válida los LLM.

English

This survey offers a simple and useful distinction for organizing a literature that often mixes different meanings of “persona.” In role-playing, the persona is assigned to the model itself, a doctor, judge, programmer, or character, so that it acts inside an environment. In personalization, the persona belongs to the user, their history, preferences, context, or attributes, and the model adapts its response to that person. The paper turns this difference in ownership and purpose into a shared taxonomy, adds a section on personality evaluation, and assembles representative tasks, datasets, and papers published through 2024.

The role-playing branch is organized by environment, software development, games, medicine, and LLM-as-evaluator, by interaction schema, single agent or cooperative/adversarial multi-agent, and by behavior described as voluntary, conforming, or destructive. The personalization branch covers recommendation, search, education, healthcare, and either task-oriented or user-persona dialogue. This map helps distinguish a model performing an assigned role from a model inferring and satisfying the preferences of a real user, while recognizing that both mechanisms may coexist in one application.

The personality section surveys Big Five, MBTI, the Machine Personality Inventory, and LLM-rated interviews used to assess character alignment. Its most important point is cautionary: output that appears consistent with an assigned persona does not establish that a human psychometric questionnaire transfers validly to a model. The section is nevertheless brief and mainly descriptive. It does not appraise the psychometric quality of each study, compare instruments under common criteria, or reanalyze the evidence behind strong claims reproduced from cited work, such as MBTI types or “emergent behaviors.”

The paper should be read as a narrative survey and design map, not a systematic review or meta-analysis. It reports no searched databases, query, cutoff dates, inclusion or exclusion criteria, record counts, screening procedure, extraction process, bias assessment, or quality appraisal. It also performs no original experiment or homogeneous comparison, and explicitly acknowledges that heterogeneous metrics prevent a fair comprehensive performance table. The companion repository is a reading list, but contains only a README and images, has no license or structured data, and its latest commit is the October 2024 camera-ready update despite a promise of continuous maintenance. The defensible contribution is therefore a strong introductory taxonomy for separating model roles from user profiles, not evidence that role-playing or personalization generally makes LLMs more effective, safe, or psychometrically valid.

Pregunta de investigación

¿Cómo puede organizarse bajo una visión común la investigación sobre personas en LLM, distinguiendo los roles asignados al modelo de la adaptación a perfiles de usuario, y qué tareas, esquemas, evaluaciones y riesgos caracterizan cada línea?

Método

Survey narrativo de literatura sobre persona y LLM. Los autores sintetizan trabajos en una taxonomía jerárquica: role-playing por entorno, esquema de agentes y conducta observada; personalización por tarea o dominio; y una capa transversal de evaluación de personalidad. Las tablas reúnen benchmarks web, sistemas y datasets de recomendación, búsqueda y diálogo. El artículo no describe una estrategia reproducible de búsqueda, cribado o evaluación de calidad, no informa el número total de estudios incluidos y no realiza síntesis cuantitativa. La revisión editorial leyó las 20 páginas, incluidas tablas y referencias, verificó la ficha de ACL Anthology y auditó la colección pública asociada.

Muestra: No existe una muestra experimental ni un conjunto formalmente declarado de estudios incluidos. El texto cubre literatura de diálogo previa a los LLM y trabajos de agentes, role-playing, personalización y evaluación publicados principalmente hasta mediados de 2024. Las tablas enumeran sistemas y datasets, pero el artículo no informa cuántos registros se identificaron, descartaron o analizaron ni una fecha de corte reproducible. El repositorio auditado contiene una lista de lectura en README con enlaces repetidos entre categorías, no una base bibliográfica estructurada.

Hallazgos

  • La distinción central asigna la persona al LLM en role-playing, cuyo objetivo es adaptarse al entorno, y al usuario en personalización, cuyo objetivo es adaptar la respuesta a necesidades individuales.
  • Role-playing se organiza por entorno, software, juegos, medicina y evaluación, por interacción, agente único o multiagente, y por comportamientos descritos durante la colaboración.
  • Los sistemas multiagente se subdividen en cooperación y adversarialidad; el survey relaciona división de trabajo, debate, crítica y memoria con aplicaciones concretas, pero no estima su efecto medio.
  • La personalización se despliega en recomendación, búsqueda, educación, salud y diálogo, normalmente mediante prompting, recuperación, memoria, perfilado o ajuste del modelo.
  • Los mismos escenarios pueden combinar ambas ramas: un agente puede desempeñar un rol profesional y, a la vez, adaptar su respuesta al perfil del usuario.
  • Las evaluaciones de personalidad citadas usan Big Five, MBTI, inventarios diseñados para máquinas e entrevistas, pero el survey reconoce que la transferibilidad directa de tests humanos sigue abierta.
  • Los principales retos identificados son marcos dependientes de tarea, personas largas, falta de datasets y benchmarks, sesgos, jailbreaks, toxicidad, privacidad y fuga de información personal.
  • El artículo reconoce que métricas incompatibles entre tareas impiden una comparación completa y justa; por ello entrega taxonomía y direcciones, no un ranking de métodos.
  • Las implicaciones sociales incluyen acceso educativo y sanitario potencialmente más asequible, junto con riesgos de desigualdad, responsabilidad clínica, polarización y sustitución desigual de apoyo humano.

Limitaciones

  • No se presenta protocolo de revisión sistemática: faltan bases, consulta, periodo, criterios de selección, deduplicación, doble cribado, diagrama de flujo y evaluación de calidad o sesgo.
  • No se informa el número de trabajos incluidos por rama ni se define una frontera verificable entre literatura central, contexto general y ejemplos ilustrativos.
  • La taxonomía mezcla niveles distintos: dominio de aplicación, arquitectura de agentes, técnica de personalización, fenómeno conductual, benchmark e instrumento de evaluación.
  • Varias categorías se solapan. LLM-as-evaluator puede ser role-playing o simplemente instrucción de tarea; user persona modeling puede inferir atributos sin personalizar; un sistema médico puede pertenecer a ambas ramas.
  • Las afirmaciones de mejora, precisión, conocimiento experto o correlación humana proceden de los artículos citados y no son reanalizadas ni ponderadas por calidad metodológica.
  • La sección de evaluación de personalidad ocupa una fracción pequeña del survey y no trata en profundidad invariancia de medida, validez de constructo, fiabilidad condicional, aquiescencia o dependencia del prompt.
  • Presentar cooperación, conformidad o intención destructiva como conductas emergentes puede antropomorfizar regularidades de generación condicionadas por prompts y protocolos.
  • No hay síntesis cuantitativa, tamaños de efecto, intervalos, tabla común de resultados ni comparación controlada de prompting, fine-tuning, memoria y recuperación.
  • La cobertura está congelada alrededor de 2024 y no representa modelos, benchmarks, riesgos regulatorios ni técnicas posteriores; su afirmación de ser el primer survey es temporal y difícil de probar exhaustivamente.
  • La privacidad se trata como riesgo general, pero no se ofrece un marco de amenazas, clasificación de datos, requisitos de consentimiento, retención o evaluación diferencial de memorias y perfiles.
  • La colección pública no contiene exportación bibliográfica, metadatos estructurados, historial de inclusión, etiquetas verificables ni automatización para detectar enlaces rotos o actualizar la cobertura.
  • El repositorio no incluye licencia y su último commit auditado es del 11 de octubre de 2024; por tanto, «continuously maintain» describe una intención, no una garantía de actualidad.

Qué no demuestra

  • No demuestra que asignar roles mejore de forma general el razonamiento, la precisión o el éxito de tareas frente a prompts equivalentes sin persona.
  • No demuestra que un conjunto multiagente supere a un único modelo con el mismo presupuesto, información y número de llamadas.
  • No demuestra que comportamientos denominados voluntarios, conformistas o destructivos correspondan a motivaciones o procesos sociales humanos internos.
  • No demuestra que coherencia con un personaje equivalga a poseer una personalidad ni que Big Five o MBTI sean válidos para LLM.
  • No demuestra que personalizar sea siempre beneficioso: una respuesta más ajustada puede amplificar sesgo, polarización, manipulación, dependencia o exposición de datos.
  • No establece seguridad clínica, educativa o legal para los sistemas descritos ni sustituye evaluación específica del dominio y supervisión humana.
  • No ofrece una clasificación exhaustiva, mutuamente excluyente o estable; es una lente útil sobre una literatura cambiante.
  • No permite comparar eficacia entre dominios o métodos porque las métricas, datasets, modelos, costes y protocolos no están armonizados.
  • No prueba que las listas del repositorio estén completas o actualizadas a la fecha actual.

Trazabilidad

Alcance: Texto completo

Versión: Findings of EMNLP 2024 proceedings, pp. 16612–16631, DOI 10.18653/v1/2024.findings-emnlp.969; official collection commit 6567151fdcc1fe7c0a7d757c1443282a87df78ff audited

Fuente consultada: https://aclanthology.org/2024.findings-emnlp.969.pdf

Revisión: Codex editorial review and methods/artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • No LLM is evaluated directly (narrative survey)
  • GPT-3.5 and ChatGPT family discussed across cited studies
  • GPT-4 family discussed across cited studies
  • Llama family discussed across cited studies
  • PaLM family discussed across cited studies
  • Role-playing and personalized agent systems using heterogeneous backbones

Instrumentos y métricas

  • Role-playing versus personalization taxonomy
  • Role-playing environments: software, games, medicine and LLM-as-evaluator
  • Single-agent and multi-agent schemas
  • Voluntary, conformity and destructive behavior categories
  • Big Five personality inventories
  • Myers–Briggs Type Indicator (MBTI)
  • Machine Personality Inventory (MPI)
  • Personality-test interviewing and LLM rating
  • Task-specific success, accuracy, preference and dialogue metrics reported by cited work

Datos utilizados

  • Surveyed recommendation datasets: Amazon Review, MovieLens, Yelp, TripAdvisor and MIND
  • Surveyed task-oriented dialogue datasets: MultiWOZ, SGD, STAR, AirDialogue and UniDA
  • Surveyed user-persona datasets: PersonaChat, ConvAI2, Baidu PersonaChat, JPersonaChat, JEmpatheticDialogues and DailyDialog
  • Surveyed web-agent benchmarks: WebShop, Mind2Web, WebArena, VisualWebArena and VisualWebBench
  • Official PersonaLLM-Survey GitHub reading list

Evidencia y localización

  • Publicación definitiva, autores, páginas y DOI: ACL Anthology 2024.findings-emnlp.969; Findings of EMNLP 2024, pp. 16612–16631; DOI 10.18653/v1/2024.findings-emnlp.969
  • Definiciones de role-playing y personalización y taxonomía general: Proceedings paper, pp. 16612–16614, Figures 1–3 and sections 1–2
  • Entornos, esquemas de agente y categorías de conducta: Proceedings paper, pp. 16614–16616, sections 2.1–2.3
  • Tareas y métodos de personalización: Proceedings paper, pp. 16616–16618, sections 3.1–3.5 and Figure 4
  • Evaluación de personalidad y duda sobre transferencia de tests humanos: Proceedings paper, p. 16618, section 4
  • Retos de generalización, contexto largo, datos, sesgos, seguridad y privacidad: Proceedings paper, pp. 16619–16620, sections 5.1–5.5
  • Implicaciones educativas, sanitarias y necesidad de nuevas medidas: Proceedings paper, p. 16620, section 6
  • Ausencia reconocida de comparación completa por heterogeneidad de métricas: Proceedings paper, p. 16620, Limitations
  • Benchmarks, sistemas y datasets tabulados: Proceedings paper, pp. 16629–16631, Tables 1–6
  • Lista de lectura, estructura del artefacto, falta de licencia y última actualización: GitHub MiuLab/PersonaLLM-Survey commit 6567151fdcc1fe7c0a7d757c1443282a87df78ff dated 11 Oct 2024; README.md and repository tree
  • Ausencia de método reproducible de búsqueda y selección: Full proceedings paper and companion README: no search strategy, inclusion/exclusion criteria, screening counts or quality appraisal reported