Enhancing Persona Consistency for LLMs' Role-Playing using Persona-Aware Contrastive Learning

Personas, identidad y agentes2025ACL AnthologyRevisión editorial aprobada

Autores: Ke Ji, Yixin Lian, Linxu Li, Jingsheng Gao, Weiyuan Li, Bin Dai

Palabras clave: Large Language Models, Personality, Persona, Model Evaluation, LLM Evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
10
Hallazgos
24
Limitaciones
11
Evidencias

Resumen editorial

Español

Persona-Aware Contrastive Learning (PCL) es una receta para mejorar role-play de personajes, no un método que mida o aprenda personalidad humana. Combina tres piezas. Chain of Persona (COP) añade al prompt cinco preguntas y respuestas internas sobre el perfil del personaje y el diálogo previo antes de generar la réplica final. Como Qwen-7B y Baichuan2-7B no siempre obedecen ese formato, el warm-up toma 1.000 pares de perfil e historial, pide a un modelo GPT más capaz que genere la cadena completa y usa esas salidas sintéticas como objetivos de SFT durante tres epochs. Después, Contrastive Self-Play Alignment genera una respuesta y+ con el perfil presente y otra y- tras borrarlo; DPO trata automáticamente y+ como preferida y y- como rechazada. Los pares se regeneran tras cada epoch y se entrena dos epochs. La etiqueta annotation-free solo significa que no se pide a humanos que anoten cada preferencia. El pipeline principal sí depende de 1.000 anotaciones sintéticas producidas por GPT, y cada etiqueta de preferencia se decide por construcción, sin comprobar que la respuesta con perfil sea realmente mejor. Un apéndice sustituye el warm-up de GPT por datos COP generados y filtrados con Qwen few-shot; elimina el modelo externo fuerte, pero sigue usando 1.000 objetivos sintéticos. En GPT-3.5-turbo-1106 y GPT-4-0125-preview no se ejecutan SFT, DPO ni self-play: solo se aplica el prompt COP. El propio pie de tabla llama PCL* a esta condición. Por tanto, sus mejoras validan el prompt de reflexión, no el aprendizaje contrastivo. La evaluación usa CharacterEval, un benchmark chino de diálogos de personajes. Su fuente original contiene 77 personajes, 1.785 diálogos multiturno y 23.020 ejemplos, aunque este paper no informa cuántas instancias procesa después de sus transformaciones. En el setting principal, los 77 personajes aparecen tanto en entrenamiento como en prueba. El setting de transferencia elige aleatoriamente 60 para entrenar y reserva 17 perfiles disjuntos; no publica semilla, lista de personajes ni particiones. Los modelos abiertos son Qwen/Qwen-7B-Chat, Baichuan2-7B y CharacterGLM-6B. En consistencia de personaje, el promedio CharacterRM sube de 2,700 a 2,799 para Baichuan, de 2,540 a 2,616 para Qwen y de 1,805 a 2,076 para CharacterGLM. COP sin entrenamiento sube GPT-3.5 de 2,155 a 2,280 y GPT-4 de 2,697 a 2,785. Estos agregados ocultan regresiones importantes. Frente a ICL, PCL reduce Persona-Behavior en 0,386 y Persona-Utterance en 0,063 para Baichuan; en Qwen las caídas son 0,461 y 0,139. Las mejoras del promedio de consistencia proceden sobre todo de Knowledge-Exposure, Knowledge-Accuracy y Knowledge-Hallucination. En Qwen, la submétrica de consistencia conversacional también baja levemente de 3,229 a 3,224, y varias métricas de atractivo quedan por debajo del baseline. Así, no es fiel decir que todas las dimensiones de consistencia mejoran. En los 17 personajes no vistos, el promedio de tres dimensiones sube solo 0,064 para Baichuan (2,934 a 2,998) y 0,059 para Qwen (2,849 a 2,908), sin intervalos ni repetición de splits. La cadena obtiene su mejor promedio con cinco reflexiones: 2,941 frente a 2,849 sin cadena; con diez baja a 2,935. La ablación apoya que COP y CSPA contribuyen al promedio, aunque su escala de mejora es modesta. La evaluación humana reúne diez investigadores y becarios de la empresa de los autores, entrenados para armonizar criterios. Cada uno selecciona 50 ejemplos y se obtienen 500 juicios por comparación. PCL gana 262, empata 43 y pierde 195 veces para Baichuan: 52,4% de todos los juicios o 57,3% de los decisivos. Para Qwen gana 303, empata 137 y pierde 60: 60,6% del total u 83,5% de los decisivos. No se informa acuerdo interjueces, cegamiento, asignación por personaje o test estadístico, y llamar a estos evaluadores human experts es más fuerte que la descripción real de investigadores y becarios internos. GPT-4-turbo-2024-04-09 evalúa cada orden dos veces para reducir sesgo posicional. Reporta 602/92/306 victorias/empates/derrotas para Baichuan y 582/181/237 para Qwen, pero no se valida su acuerdo con humanos ni se explica cómo se reconcilian órdenes discordantes. CharacterRM procede del mismo ecosistema CharacterEval que proporciona los datos, por lo que tampoco es un evaluador independiente. El paper afirma significantly outperform sin dar desviaciones, intervalos, p-values, tests o réplicas por semilla en sus doce submétricas. El control de conocimiento general solo usa Qwen: el promedio de seis benchmarks cambia de 37,4 a 37,6, mientras OpenBookQA cae cuatro puntos y MedQA-cn 0,4. Esto es compatible con conocimiento medio aproximadamente conservado, pero no demuestra ausencia de catastrophic forgetting. La reproducibilidad es insuficiente. No se enlazan código PCL, checkpoints, datos warm-up, pares DPO, outputs, particiones o scripts. No se versiona el GPT que genera las 1.000 cadenas principales; falta beta de DPO; no se publican hardware, coste, semillas, temperatura, decoding, criterio de checkpoint o parser del bloque final. Table 12 cambia la escala de aproximadamente 1–4 a 0–100 sin definir la transformación. Tampoco se aclara si CharacterRM recibe las cinco reflexiones explícitas o solo la respuesta final; si recibe todo, el método expone directamente datos del perfil y más tokens al juez, un confusor de longitud y contenido. La conclusión defendible es que obligar al modelo a verbalizar cinco comprobaciones del personaje y, en modelos abiertos, afinarlo con objetivos sintéticos y pares con/sin perfil, aumenta varios promedios de CharacterEval y es preferido con frecuencia por jueces internos y GPT-4. No demuestra que el modelo adquiera una personalidad, que toda consistencia de personaje mejore, que el método carezca de anotación sintética, que generalice ampliamente a perfiles nuevos o que preserve conocimiento sin coste.

English

Persona-Aware Contrastive Learning (PCL) is a recipe for improving fictional-character role-play, not a method that measures or learns human personality. It combines three components. Chain of Persona (COP) adds five explicit self-question/self-answer steps about the character profile and dialogue history before the final reply. Because Qwen-7B and Baichuan2-7B do not always follow that format, the warmup takes 1,000 profile/history pairs, asks a stronger GPT model to generate complete COP chains, and uses those synthetic targets for three epochs of supervised fine-tuning. Contrastive Self-Play Alignment then generates y+ with the profile present and y- after deleting it; DPO automatically treats y+ as preferred and y- as rejected. Pairs are regenerated after each epoch and training runs for two epochs. Annotation-free therefore means no humans label each preference. The main pipeline still depends on 1,000 GPT-generated synthetic annotations, and each preference label is assigned by construction without checking whether the profile-conditioned answer is actually better. An appendix replaces GPT warmup with COP data generated and filtered by few-shot Qwen. This removes reliance on a stronger external model but still uses 1,000 synthetic targets. GPT-3.5-turbo-1106 and GPT-4-0125-preview receive no SFT, DPO, or self-play; they only receive the COP prompt. The table itself calls this PCL*. Their gains therefore validate reflective prompting, not contrastive learning. Evaluation uses CharacterEval, a Chinese fictional-character dialogue benchmark. Its source paper reports 77 characters, 1,785 multi-turn dialogues, and 23,020 examples, although the PCL paper does not state how many instances remain after its transformations. In the main setting, all 77 characters occur in both train and test. The transfer setting randomly chooses 60 profiles for training and reserves 17 disjoint profiles; no seed, character list, or split files are published. Open models are Qwen/Qwen-7B-Chat, Baichuan2-7B, and CharacterGLM-6B. Average CharacterRM consistency rises from 2.700 to 2.799 for Baichuan, 2.540 to 2.616 for Qwen, and 1.805 to 2.076 for CharacterGLM. Prompt-only COP raises GPT-3.5 from 2.155 to 2.280 and GPT-4 from 2.697 to 2.785. These aggregates hide important regressions. Relative to ICL, PCL lowers Persona-Behavior by 0.386 and Persona-Utterance by 0.063 for Baichuan; for Qwen the drops are 0.461 and 0.139. Average consistency gains mainly come from Knowledge-Exposure, Knowledge-Accuracy, and Knowledge-Hallucination. Qwen conversational Consistency also falls slightly from 3.229 to 3.224, and several attractiveness submetrics remain below baseline. It is therefore inaccurate to say that every consistency dimension improves. On 17 unseen characters, the three-dimension average rises only 0.064 for Baichuan (2.934 to 2.998) and 0.059 for Qwen (2.849 to 2.908), without intervals or repeated splits. Five reflections have the best average, 2.941 versus 2.849 with no chain; ten falls to 2.935. Ablations support contributions from both COP and CSPA, although average gains are modest. Human evaluation uses ten company researchers and interns, trained to harmonize judgments. Each selects 50 examples, yielding 500 judgments per comparison. PCL records 262 wins, 43 ties, and 195 losses for Baichuan: 52.4% wins over all judgments or 57.3% among decisive judgments. For Qwen it records 303/137/60: 60.6% overall or 83.5% among decisive judgments. Inter-rater agreement, blinding, character assignment, and significance tests are absent, and human experts is stronger than the actual description of internal researchers and interns. GPT-4-turbo-2024-04-09 judges each ordering twice to reduce position bias. It reports 602/92/306 wins/ties/losses for Baichuan and 582/181/237 for Qwen, but human agreement is not validated and the reconciliation of discordant orders is not explained. CharacterRM comes from the same CharacterEval ecosystem that supplies the data, so it is not an independent evaluator either. The paper claims models significantly outperform baselines without reporting deviations, confidence intervals, p-values, tests, or seed repetitions across its twelve submetrics. General-knowledge checking uses Qwen only: mean accuracy across six benchmarks changes from 37.4 to 37.6, while OpenBookQA drops four points and MedQA-cn drops 0.4. This is compatible with approximately maintained average knowledge but does not demonstrate absence of catastrophic forgetting. Reproducibility is insufficient. No PCL code, checkpoints, warmup targets, DPO pairs, outputs, splits, or scripts are linked. The GPT model that generates the main 1,000 chains is not versioned; DPO beta is missing; hardware, cost, seeds, temperature, decoding, checkpoint selection, and final-response parsing are absent. Table 12 changes the scale from roughly 1-4 to 0-100 without defining the transformation. It is also unclear whether CharacterRM receives all five explicit reflections or only the final reply. If it receives the full text, the method directly exposes more profile facts and tokens to the evaluator, confounding length and content. The defensible conclusion is that forcing five verbal character checks and, for open models, fine-tuning on synthetic targets plus profile/no-profile pairs raises several CharacterEval averages and is often preferred by internal judges and GPT-4. It does not establish acquired personality, improvement on every persona-consistency component, freedom from synthetic annotation, broad unseen-persona generalization, or cost-free knowledge preservation.

Pregunta de investigación

¿Puede una cadena explícita de autorreflexión sobre un personaje, combinada con SFT sintético y DPO sobre respuestas generadas con y sin perfil, mejorar el role-play en CharacterEval sin anotaciones humanas de preferencias?

Método

COP fuerza cinco preguntas/respuestas sobre perfil e historial. Para Qwen-7B y Baichuan2-7B, un GPT no versionado genera 1.000 objetivos COP para warm-up SFT; después se crean pares y+ con perfil e y- sin perfil y se optimizan con DPO iterativo. GPT-3.5 y GPT-4 solo reciben COP. Se evalúa con CharacterRM, diez jueces internos y GPT-4, en un setting con personajes solapados y otro 60/17 con perfiles disjuntos.

Muestra: La publicación no informa el número final de diálogos o ejemplos CharacterEval usado por split. El setting general comparte los 77 personajes entre train y test; transferencia usa 60/17 perfiles disjuntos. Hay 1.000 targets COP sintéticos. La evaluación humana contiene 500 decisiones por comparación de diez investigadores/becarios internos; GPT-4 reporta 1.000 comparaciones por backbone. No se publican repeticiones por semilla.

Hallazgos

  • La fuente vigente es Findings of ACL 2025, Anthology ID 2025.findings-acl.1344, DOI 10.18653/v1/2025.findings-acl.1344, páginas 26221-26238.
  • Las 18 páginas se renderizaron e inspeccionaron visualmente; SHA-256 8074843d52da2a772172e6fb98154d0c9f42846a75c9cfc8b773504aef9b2d1b.
  • PCL abierto usa warm-up SFT sintético, DPO con pares con/sin perfil y COP en inferencia; PCL* cerrado usa solo COP.
  • Los promedios de consistencia suben 0,099 en Baichuan, 0,076 en Qwen y 0,271 en CharacterGLM.
  • Persona-Behavior y Persona-Utterance empeoran frente a ICL para Qwen y Baichuan.
  • En 17 perfiles no vistos, los promedios suben 0,064 para Baichuan y 0,059 para Qwen.
  • Los jueces humanos prefieren PCL en 262/500 casos Baichuan y 303/500 Qwen, con 43 y 137 empates respectivamente.
  • GPT-4 prefiere PCL en 602/1.000 casos Baichuan y 582/1.000 Qwen, con 92 y 181 empates.
  • Cinco autorreflexiones logran el mejor promedio; diez no aportan una mejora adicional.
  • La precisión media de conocimiento de Qwen cambia 37,4 a 37,6, con una caída de cuatro puntos en OpenBookQA.

Limitaciones

  • Annotation-free excluye etiquetas humanas, pero no objetivos sintéticos ni supuestos automáticos de preferencia.
  • El warm-up principal depende de 1.000 salidas de un GPT no versionado.
  • La respuesta con perfil se declara preferida sin comprobar su calidad, factualidad o consistencia.
  • Borrar el perfil crea un negativo fácil y no garantiza un contraste semánticamente controlado.
  • GPT-3.5 y GPT-4 no prueban contrastive learning; prueban COP prompting.
  • El setting principal permite los mismos personajes en train y test.
  • El split 60/17 no fija semilla, lista o múltiples particiones.
  • No se informa el número final de ejemplos por split.
  • Los promedios ocultan caídas en Persona-Behavior, Persona-Utterance y algunas submétricas conversacionales/atractivas.
  • No hay tests, p-values, intervalos, desviaciones o replicación por semillas pese a usar significant.
  • CharacterRM y CharacterEval proceden del mismo benchmark, limitando independencia.
  • No se aclara si el juez ve las cinco reflexiones o solo la respuesta final.
  • No se controla longitud, exposición explícita del perfil o verbosidad de COP.
  • Los jueces humanos son investigadores y becarios de la empresa autora, no una muestra independiente.
  • No hay acuerdo interjueces, detalle de cegamiento o análisis por personaje.
  • GPT-4 juez no se valida contra humanos y no se explica cómo se agregan órdenes discordantes.
  • La conservación de conocimiento se evalúa en un solo backbone y seis datasets.
  • El promedio de conocimiento casi igual coexiste con pérdidas específicas relevantes.
  • No se define un margen de equivalencia para afirmar preservation.
  • No se publican código, checkpoints, targets, pares DPO, outputs o splits.
  • Falta beta de DPO y el GPT de warm-up no tiene versión.
  • Faltan hardware, coste, semillas, temperatura, sampling y selección de checkpoints.
  • Table 12 usa una escala 0-100 no reconciliada con las tablas 1-4.
  • El análisis se limita a personajes ficticios y diálogo chino de un benchmark.

Qué no demuestra

  • No establece que el modelo adquiera una personalidad interna.
  • No demuestra mejora en todos los componentes de consistencia de personaje.
  • No demuestra aprendizaje contrastivo en GPT-3.5 o GPT-4.
  • No demuestra ausencia de supervisión sintética.
  • No demuestra que cada par DPO contenga una preferencia válida.
  • No demuestra generalización amplia a personajes, idiomas o dominios nuevos.
  • No demuestra significación estadística de las diferencias tabuladas.
  • No demuestra evaluación humana independiente o acuerdo robusto.
  • No demuestra preservación general de conocimiento sin pérdidas.
  • No permite reproducir el entrenamiento o las tablas completas.

Trazabilidad

Alcance: Texto completo

Versión: Findings of ACL 2025, Anthology ID 2025.findings-acl.1344, DOI 10.18653/v1/2025.findings-acl.1344, pages 26221-26238, 18 pages; supersedes arXiv:2503.17662v2

Fuente consultada: https://aclanthology.org/2025.findings-acl.1344/

Revisión: Codex complete bilingual full-text fidelity pass using the published ACL 2025 version, all-page visual inspection, method decomposition, open-versus-black-box reconciliation, table arithmetic, submetric direction audit, human and GPT-4 judge validity review, CharacterEval source reconciliation, code/artifact search, and reproducibility assessment; summaries written from the full paper, appendices, tables, and benchmark source rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Qwen/Qwen-7B-Chat
  • baichuan-inc/Baichuan2-7B
  • CharacterGLM-6B
  • GPT-3.5-turbo-1106 prompt-only COP
  • GPT-4-0125-preview prompt-only COP
  • Unspecified stronger GPT model for 1,000 COP warmup targets
  • gpt-4-turbo-2024-04-09 pairwise evaluator

Instrumentos y métricas

  • Five-step Chain of Persona prompt
  • Synthetic COP supervised warmup
  • Profile-present versus profile-removed self-play pairs
  • Direct Preference Optimization
  • CharacterRM with 12 submetrics across character consistency, conversational ability, and role-playing attractiveness
  • Pairwise evaluation by ten company researchers and interns
  • Order-swapped GPT-4 pairwise evaluation
  • Six general-knowledge benchmarks

Datos utilizados

  • CharacterEval: 77 Chinese fictional characters; upstream source reports 1,785 multi-turn dialogues and 23,020 examples
  • General setting with all 77 character profiles represented in train and test
  • Transfer setting with random 60-profile train and 17-profile test split; seed and files unreported
  • 1,000 GPT-generated COP warmup targets in the main open-model pipeline
  • OpenBookQA, MedQA-cn, Natural Questions, TriviaQA, ARC-E, and ARC-C for Qwen knowledge evaluation
  • No released PCL outputs, preference pairs, checkpoints, or training code

Evidencia y localización

  • Versión, autores, venue, DOI y páginas: ACL Anthology record and published PDF page 26221 checked 15 July 2026
  • COP, warm-up SFT, pares con/sin perfil y DPO: Sections 4.1-4.4, pages 26223-26225
  • Modelos, settings 77 y 60/17 y baselines: Sections 5.1.1-5.1.2 and Table 1, pages 26225-26226
  • Métricas y resultados detallados: Sections 5.2-5.4 and Tables 2-4, pages 26226-26228
  • Transferencia, longitud y ablación: Sections 5.6-5.8 and Tables 5-7, page 26228
  • Resultados humanos y GPT-4: Appendix E and Tables 9-10, pages 26233-26235
  • Warm-up sin GPT y escala alternativa: Appendix D and Table 12, page 26234
  • Tamaño del benchmark upstream: CharacterEval source paper arXiv:2401.01275 and official repository metadata checked 15 July 2026
  • Limitaciones reconocidas: Limitations, page 26229
  • Auditoría integral: reports/verification/article-188-pcl-method-and-evaluation-audit.json
  • Inspección visual completa: All 18 published PDF pages rendered and visually inspected on 15 July 2026