A Survey of Personality, Persona, and Profile in Conversational Agents and Chatbots

Revisiones, teoría y gobernanza2024arXivRevisión editorial aprobada

Título original: A Survey of Personality, Persona, and Profile in Conversational Agents

Autores: Richard Sutcliffe

Palabras clave: conversational agents, chatbots, personality models, Big Five, persona, dialogue systems, neural networks

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

1
Autores
23
Hallazgos
36
Limitaciones
18
Evidencias

Resumen editorial

Español

Esta revisión narrativa organiza la literatura sobre personalidad, persona y perfil en agentes conversacionales, desde ELIZA y PARRY hasta trabajos neuronales y unos pocos estudios tempranos con GPT publicados hasta 2023. Su aportación principal no es un experimento ni un nuevo modelo, sino seis tablas de orientación cruzada. La Tabla 1 reúne 15 formas de especificar personalidad en cuatro grupos: esquemas psicológicos previos, introversión/extraversión, dimensiones de Eysenck, Big Five/OCEAN, 16PF e IRI; recursos propios de chatbots, listas de rasgos, tropos de personaje, frases descriptivas y pares atributo-valor; especificaciones implícitas mediante monólogos o diálogos; y medidas relacionadas como plantillas, género textual, atributos demográficos o personas históricas. La Tabla 2 describe 21 recursos, entre ellos Persona-Chat, ConvAI2, Image-Chat, PersonalDialog, PersuasionForGood, FriendsPersona y PERSONAGE. Las Tablas 3 y 4 conectan trabajos citados con esas representaciones y con 13 familias técnicas: BERT, CNN, vectores de condición, GAN, GPT, entrenamiento conjunto, redes de memoria, prefijos, prompts, seq2seq, plantillas simbólicas, Transformers y VAE. Las Tablas 5 y 6 agrupan líneas de investigación y revisiones afines. El autor concluye que Persona-Chat e Image-Chat popularizaron las frases descriptivas transparentes, que los perfiles implícitos extraídos de historiales son más sofisticados y que seq2seq, Transformers y redes de memoria dominaban el campo. Su observación más sólida es crítica: muchos resultados seguían siendo inconclusos porque las métricas automáticas suelen reducir la evaluación a predecir la siguiente intervención y la evaluación humana es costosa y no deja claro qué aspecto de la personalidad se está midiendo. El artículo es útil como índice histórico amplio y como vocabulario de diseño, pero no cumple los requisitos de una revisión sistemática reproducible: no informa bases consultadas, búsqueda, fecha de corte, criterios de inclusión/exclusión, cribado, evaluación de calidad, protocolo ni flujo de selección. Además, declara nueve temas relacionados aunque la Tabla 6 contiene diez; equipara deliberadamente personalidad, persona y perfil pese a reconocer sus diferencias; mezcla rasgos psicológicos, biografías, estilos, edad/género, tropos, historiales y personajes históricos; incluye recursos privados junto a datasets públicos; y reproduce claims de trabajos primarios sin una escala común de evidencia. Hay defectos verificables de edición y trazabilidad: el listado de rasgos se describe como 638 elementos pero desglosa 234 positivos y 292 negativos, mientras el texto añade 292 neutrales, 818 en total; PersonalDialog figura con “8.47M million speakers”; PersuasionForGood duplica una frase y escribe “denote” por “donate”; y aparecen referencias sin resolver como “citezhang2018personalizing”, “[Zhao2017]” y “[Sukhbaatar 2015)]”. Tampoco audita licencias, privacidad, disponibilidad, sesgos, seguridad, persuasión o antropomorfización. Por ello debe citarse como mapa narrativo del campo hasta finales de 2023, no como inventario exhaustivo, metaanálisis ni estado actual de la personalidad en LLM en 2026.

English

This narrative review organizes work on personality, persona, and profile in conversational agents, from ELIZA and PARRY to neural systems and a small number of early GPT-era studies published through 2023. Its main contribution is neither an experiment nor a new model, but six cross-referencing orientation tables. Table 1 groups 15 ways of specifying personality into four families: pre-existing psychological schemes, introversion/extraversion, Eysenck dimensions, Big Five/OCEAN, 16PF, and IRI; chatbot-specific resources, trait lists, character tropes, descriptive sentences, and attribute-value pairs; implicit specifications from monologues or dialogues; and related measures such as templates, text genre, demographic attributes, or historical personas. Table 2 describes 21 resources, including Persona-Chat, ConvAI2, Image-Chat, PersonalDialog, PersuasionForGood, FriendsPersona, and PERSONAGE. Tables 3 and 4 connect cited studies to those representations and to 13 technical families: BERT, CNNs, conditioning vectors, GANs, GPT, joint training, memory networks, prefixes, prompts, seq2seq, symbolic templates, Transformers, and VAEs. Tables 5 and 6 group research themes and adjacent reviews. The author concludes that Persona-Chat and Image-Chat made transparent descriptive sentences especially influential, that implicit profiles inferred from dialogue history were becoming more sophisticated, and that seq2seq, Transformers, and memory networks dominated the field. The review's strongest observation is critical: many results remained inconclusive because automatic metrics often reduce evaluation to next-utterance prediction, while human evaluation is expensive and does not make clear which aspect of personality is being measured. The article is useful as a broad historical index and design vocabulary, but it does not meet reproducible systematic-review requirements: it reports no searched databases, search string, cutoff date, inclusion/exclusion criteria, screening process, quality appraisal, protocol, or selection flow. It also claims nine related topics although Table 6 contains ten; deliberately treats personality, persona, and profile as interchangeable despite acknowledging their differences; mixes psychological traits, biographies, styles, age/gender, tropes, histories, and historical characters; places private resources beside public datasets; and repeats claims from primary papers without a common evidence scale. Verifiable editorial and traceability defects include a trait list described as 638 items but broken down as 234 positive and 292 negative, while the prose adds 292 neutral items, 818 total; PersonalDialog reported as “8.47M million speakers”; a duplicated PersuasionForGood sentence with “denote” instead of “donate”; and unresolved citations such as “citezhang2018personalizing”, “[Zhao2017]”, and “[Sukhbaatar 2015)]”. The review also does not systematically audit licenses, privacy, availability, bias, safety, persuasion, or anthropomorphism. It should therefore be cited as a narrative map of the field through late 2023, not as an exhaustive inventory, meta-analysis, or current 2026 account of personality in LLMs.

Pregunta de investigación

¿Cómo se habían definido y representado personalidad, persona y perfil en agentes conversacionales; qué datasets y métodos de incorporación se habían usado; qué modelos y temas podían organizarse bajo esas categorías; y qué dificultades de evaluación seguían abiertas hasta finales de 2023?

Método

Revisión narrativa de autor único. El texto introduce definiciones y una breve historia de los agentes conversacionales, propone una taxonomía propia de representaciones de personalidad, describe 21 datasets, clasifica trabajos por esquema de personalidad y por método de incorporación, resume trabajos agrupados en nueve temas principales y revisiones relacionadas, y sintetiza tendencias en seis tablas. No se documenta una estrategia de búsqueda, selección o evaluación de calidad que permita reproducir el corpus bibliográfico.

Muestra: El corpus exacto de estudios no se informa como un flujo de selección. El artículo contiene 207 referencias y resume 21 datasets en la Tabla 2. La Tabla 1 enumera 15 especificaciones o medidas en cuatro grupos, la Tabla 4 muestra 13 familias técnicas, la Tabla 5 contiene nueve temas de investigación y la Tabla 6 contiene diez temas relacionados pese a que la contribución declarada dice nueve. El periodo cubierto llega de forma visible hasta 2023, pero no se publica una fecha de corte formal.

Hallazgos

  • El artículo ofrece seis tablas que conectan definiciones, datasets, modelos, métodos de incorporación y áreas de investigación.
  • La taxonomía de la Tabla 1 contiene 15 entradas repartidas entre esquemas psicológicos previos, esquemas de chatbot, esquemas implícitos y medidas relacionadas.
  • Big Five/OCEAN es el esquema psicológico preexistente asociado con más trabajos en la Tabla 3.
  • La Tabla 3 no identifica modelos conversacionales para las dimensiones de Eysenck ni para 16PF, aunque ambos marcos aparecen en la taxonomía conceptual.
  • Las frases descriptivas de persona son la representación de chatbot con mayor número de referencias en la Tabla 3.
  • La Tabla 2 describe 21 recursos de entrenamiento, con tamaños y procedencias muy heterogéneos.
  • Dos recursos atribuidos al trabajo de Li et al., Speaker Model y Speaker-Addressee Model, se señalan como privados.
  • Persona-Chat se resume con 1.155 personas de cinco líneas, 10.907 diálogos y 162.064 intervenciones.
  • Image-Chat se resume con 215 rasgos de estilo y 201.779 diálogos de tres turnos asociados a imágenes.
  • PersonalDialog se presenta como un recurso chino de Weibo con 20,83 millones de diálogos y 56,25 millones de intervenciones.
  • PERSONAGE/PersonageNLG aporta 88.855 recomendaciones de restaurantes controladas por rasgos Big Five y generadas automáticamente.
  • La Tabla 4 agrupa 13 familias técnicas y advierte expresamente que son amplias, no exclusivas y solo indicativas.
  • Seq2seq y Transformers concentran muchas referencias y las redes de memoria aparecen como mecanismo recurrente de incorporación de persona.
  • El survey distingue perfiles explícitos, rasgos, frases o atributos estructurados, de perfiles implícitos derivados de monólogos o diálogos previos.
  • El autor considera que Persona-Chat e Image-Chat fueron especialmente influyentes para representar persona mediante frases transparentes.
  • El texto interpreta los métodos implícitos basados en historiales como una dirección progresivamente más sofisticada y escalable.
  • La revisión agrupa nueve temas principales, entre ellos diálogo con personalidad, estilo, evaluación, identificación, coherencia, imágenes, confianza y prompting.
  • La Tabla 6 contiene diez filas temáticas relacionadas, no las nueve anunciadas en la lista de contribuciones.
  • La conclusión reconoce que los resultados de personalidad suelen ser inconclusos y que no está claro qué mide la evaluación humana.
  • La evaluación automática revisada se apoya con frecuencia en predicción de la siguiente intervención, una medida que no equivale por sí sola a personalidad coherente.
  • El artículo incluye algunos trabajos tempranos con GPT y LLM de 2023, pero el núcleo de su mapa corresponde a la era pre-LLM y a sistemas neuronales de diálogo anteriores.
  • El registro arXiv mantiene una sola versión v1, enviada el 31 de diciembre de 2023, con 6 tablas y 207 referencias.
  • No se identificó un repositorio oficial de código o datos complementario vinculado al artículo; el artefacto principal es la revisión en sí misma.

Limitaciones

  • Aunque se autodenomina systematic survey, no presenta un protocolo de revisión sistemática reproducible.
  • No indica bases bibliográficas, motores o repositorios consultados.
  • No publica cadenas de búsqueda, términos, idiomas o ventanas temporales.
  • No fija una fecha de corte explícita para la literatura.
  • No define criterios de inclusión y exclusión ni cómo se resolvieron casos fronterizos.
  • No informa cuántos registros fueron encontrados, deduplicados, excluidos o incluidos.
  • No aporta diagrama de flujo, protocolo registrado ni lista de trabajos excluidos.
  • No evalúa calidad metodológica, riesgo de sesgo o fuerza de evidencia de los estudios primarios.
  • La revisión es de autor único y no informa cribado o extracción independientes.
  • El propio autor reconoce que pueden existir omisiones, pero no permite cuantificarlas.
  • La decisión de tratar personalidad, persona y perfil como intercambiables borra distinciones centrales que el mismo texto reconoce.
  • La taxonomía mezcla rasgos psicológicos relativamente estables con biografías, datos demográficos, estilo, género textual, tropos y personajes históricos.
  • Edad, género, idioma, nivel de conocimiento y áreas de expertise se presentan como factores relacionados sin separar perfil de personalidad.
  • El mapa reúne generación, identificación de rasgos, recuperación, persuasión, emoción, confianza e impersonación sin un criterio común de outcome.
  • Los datasets públicos, privados, sintéticos, propietarios y derivados de plataformas sociales aparecen en una sola lista sin calificación de acceso.
  • No se auditan licencias, términos de uso, persistencia de enlaces ni posibilidad real de descargar cada recurso.
  • No se examinan consentimiento, privacidad o reidentificación en datos procedentes de Twitter, Weibo, Reddit, películas o conversaciones.
  • No se dedica una sección a seguridad, manipulación persuasiva, dependencia, antropomorfización o riesgos de impersonación.
  • No se analiza sesgo cultural, lingüístico, demográfico o de estereotipos asociado a representar personalidad.
  • La revisión reproduce resultados positivos de trabajos primarios sin normalizar métricas, baselines, intervalos o tamaños de efecto.
  • No hay metaanálisis ni síntesis cuantitativa, y la heterogeneidad impediría comparar directamente muchos claims.
  • Las categorías de incorporación técnica se declaran amplias y solapadas, de modo que los recuentos no son mutuamente excluyentes.
  • La clasificación por cita en tablas no explica reglas de codificación ni si todos los artículos fueron revisados a texto completo.
  • La contribución afirma nueve temas relacionados, mientras la Tabla 6 contiene diez filas.
  • La lista de rasgos se describe en la tabla como 638 elementos, 234 positivos y 292 negativos, una descomposición incompleta.
  • El cuerpo del texto añade 292 rasgos neutrales; 234+292+292 suma 818, no 638.
  • PersonalDialog aparece con la unidad redundante '8.47M million speakers'.
  • La descripción de PersuasionForGood repite la misma frase y escribe 'denote' en lugar de 'donate'.
  • El texto conserva referencias LaTeX sin resolver: 'citezhang2018personalizing', '[Zhao2017]' y '[Sukhbaatar 2015)]'.
  • Hay otras erratas visibles, entre ellas 'interchangable', 'intraversion', 'conscientous' y el encabezado 'IntroversionExtraversion'.
  • La amplitud histórica consume espacio en sistemas generales y trabajos tangenciales sin justificar su peso en la evidencia de personalidad.
  • La literatura termina esencialmente en 2023 y solo captura el inicio de la investigación con LLM, por lo que quedó rápidamente desactualizada.
  • No cubre la expansión posterior de role-play, agentes generativos, steerability, evaluación psicométrica de LLM, memoria de largo plazo y riesgos de character AI.
  • No compara modelos abiertos y cerrados bajo un marco uniforme ni conserva versiones, prompts o artefactos de los estudios citados.
  • No existe código, dataset de extracción bibliográfica o tabla estructurada descargable para replicar o actualizar el mapa.
  • Una única versión arXiv no documenta correcciones posteriores de las inconsistencias editoriales y bibliográficas.

Qué no demuestra

  • No establece que el corpus de 207 referencias sea exhaustivo.
  • No demuestra que se hayan encontrado todos los esquemas de personalidad usados en agentes conversacionales.
  • No constituye una revisión sistemática reproducible pese al término empleado por el autor.
  • No ofrece una estimación cuantitativa del efecto de añadir personalidad a un chatbot.
  • No demuestra que una familia técnica sea superior a otra.
  • No demuestra que seq2seq, Transformers o redes de memoria produzcan personalidad coherente o estable.
  • No valida psicométricamente Big Five, 16PF, IRI u otros instrumentos cuando se aplican a agentes artificiales.
  • No establece equivalencia conceptual entre personalidad, persona y perfil.
  • No convierte edad, género, profesión, preferencias o biografía en rasgos de personalidad psicológicamente válidos.
  • No demuestra que predecir la siguiente intervención mida personalidad.
  • No permite comparar de forma directa métricas humanas heterogéneas entre los estudios citados.
  • No garantiza que los 21 datasets sigan disponibles, licenciados o éticamente utilizables.
  • No evalúa la privacidad o seguridad de los recursos procedentes de redes sociales y conversaciones.
  • No establece que los resultados de agentes históricos o sistemas pre-LLM generalicen a LLM contemporáneos.
  • No representa el estado del arte de 2026.
  • No proporciona artefactos suficientes para reproducir, auditar automáticamente o actualizar su selección bibliográfica.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2401.00609v1, submitted 31 Dec 2023, 25 content pages plus a final references page, 6 tables and 207 references; single arXiv version; no official companion code or data repository linked by the paper or arXiv record and none identified in targeted author/project search

Fuente consultada: https://arxiv.org/pdf/2401.00609

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, taxonomy, dataset, conversational-agent, psychometric-conflation, systematic-review-method, evaluation, reproducibility, access, privacy, safety, bias and currency audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • BERT
  • Convolutional Neural Networks (CNN)
  • Conditioning on a personality vector
  • Generative Adversarial Networks (GAN)
  • GPT-based models
  • Joint training with parameter sharing
  • Memory Networks, including end-to-end memory
  • Prefix conditioning with descriptive sentences
  • Prompt-based models
  • Sequence-to-sequence models
  • Symbolic templates
  • Transformers
  • Variational Autoencoders (VAE)

Instrumentos y métricas

  • Introversion-Extraversion
  • Eysenck personality dimensions
  • Big Five/OCEAN
  • 16 Personality Factor Questionnaire (16PF)
  • Interpersonal Reactivity Index (IRI)
  • Trait lists
  • Character tropes
  • Descriptive persona sentences
  • Attribute-value profiles
  • Implicit profiles from monologues and dialogues
  • Automatic next-utterance metrics and heterogeneous human evaluation

Datos utilizados

  • List of Personality Traits
  • Film Dialogue Corpus
  • CMU Movie Summary Dataset
  • Speaker Model Dataset
  • Speaker-Addressee Model Dataset
  • Personalized-Dialog
  • Character Trope Description Dataset
  • Image-Chat
  • IMDB Dialogue Snippet Dataset
  • Persona-Chat
  • ConvAI2
  • Microsoft Personality Chat
  • Movie Character Attributes (MovieChAtt)
  • PersonalDialog
  • PersuasionForGood
  • FriendsPersona
  • Personality Emotion Lines
  • IT-ConvAI2
  • Chinese Personality Emotion Lines Dataset
  • JPersonaChat
  • PersonageNLG/PERSONAGE

Evidencia y localización

  • Registro y versión oficial: arXiv:2401.00609v1, submitted 31 Dec 2023; comments: 25 pages, 6 tables, 207 references; cs.CL and cs.AI
  • Fuente completa auditada: .cache/editorial-sources/article-102/source.pdf; official arXiv PDF; 26 rendered pages including final references page; sha256 1b8f568410787602ff3974ad9dd18ad5294a3ac375afa738ec56fb1b90df90b7
  • Objetivo, contribuciones y ausencia de protocolo: Full text pp. 1-2, Abstract and Introduction
  • Definiciones y equivalencia terminológica: Full text pp. 2-3, section 2 and Table 1
  • Quince formas de especificación: Full text p. 3, Table 1
  • Veintiún datasets y errores de tabla: Full text pp. 4-5, Table 2
  • Detalles, acceso y tamaños de datasets: Full text pp. 5-9, section 3
  • Inconsistencia del listado de rasgos: Full text p. 4 Table 2 and p. 7 Image-Chat description
  • Cruce entre esquemas y modelos: Full text p. 9, Table 3
  • Trece familias técnicas y categorías solapadas: Full text p. 10, Table 4
  • Revisión de modelos y evaluaciones: Full text pp. 9-15, section 4
  • Referencias sin resolver: Full text p. 8 JPersonaChat and p. 12 Song et al. discussion
  • Nueve temas principales y diez relacionados: Full text p. 15, Tables 5 and 6
  • Revisiones adyacentes y cobertura LLM temprana: Full text p. 16, section 5
  • Conclusiones y límites de evaluación: Full text pp. 16-17, section 6
  • Bibliografía completa: Full text pp. 17-26, references 1-207
  • Artefactos no identificados: Paper, arXiv record and targeted official author/project search checked 15 Jul 2026; no official companion code or data repository identified
  • Comprobación visual integral: All 26 PDF pages rendered and visually inspected, including six tables, footnote URLs, conclusions and all 207 references; dense table pages 3-5, 9-10 and 15-16 inspected at original resolution; checked 15 Jul 2026