Persona-Aware Contrastive Learning (PCL) es una receta para mejorar role-play de personajes, no un método que mida o aprenda personalidad humana. Combina tres piezas. Chain of Persona (COP) añade al prompt cinco preguntas y respuestas internas sobre el perfil del personaje y el diálogo previo antes de generar la réplica final. Como Qwen-7B y Baichuan2-7B no siempre obedecen ese formato, el warm-up toma 1.000 pares de perfil e historial, pide a un modelo GPT más capaz que genere la cadena completa y usa esas salidas sintéticas como objetivos de SFT durante tres epochs. Después, Contrastive Self-Play Alignment genera una respuesta y+ con el perfil presente y otra y- tras borrarlo; DPO trata automáticamente y+ como preferida y y- como rechazada. Los pares se regeneran tras cada epoch y se entrena dos epochs. La etiqueta annotation-free solo significa que no se pide a humanos que anoten cada preferencia. El pipeline principal sí depende de 1.000 anotaciones sintéticas producidas por GPT, y cada etiqueta de preferencia se decide por construcción, sin comprobar que la respuesta con perfil sea realmente mejor. Un apéndice sustituye el warm-up de GPT por datos COP generados y filtrados con Qwen few-shot; elimina el modelo externo fuerte, pero sigue usando 1.000 objetivos sintéticos. En GPT-3.5-turbo-1106 y GPT-4-0125-preview no se ejecutan SFT, DPO ni self-play: solo se aplica el prompt COP. El propio pie de tabla llama PCL* a esta condición. Por tanto, sus mejoras validan el prompt de reflexión, no el aprendizaje contrastivo. La evaluación usa CharacterEval, un benchmark chino de diálogos de personajes. Su fuente original contiene 77 personajes, 1.785 diálogos multiturno y 23.020 ejemplos, aunque este paper no informa cuántas instancias procesa después de sus transformaciones. En el setting principal, los 77 personajes aparecen tanto en entrenamiento como en prueba. El setting de transferencia elige aleatoriamente 60 para entrenar y reserva 17 perfiles disjuntos; no publica semilla, lista de personajes ni particiones. Los modelos abiertos son Qwen/Qwen-7B-Chat, Baichuan2-7B y CharacterGLM-6B. En consistencia de personaje, el promedio CharacterRM sube de 2,700 a 2,799 para Baichuan, de 2,540 a 2,616 para Qwen y de 1,805 a 2,076 para CharacterGLM. COP sin entrenamiento sube GPT-3.5 de 2,155 a 2,280 y GPT-4 de 2,697 a 2,785. Estos agregados ocultan regresiones importantes. Frente a ICL, PCL reduce Persona-Behavior en 0,386 y Persona-Utterance en 0,063 para Baichuan; en Qwen las caídas son 0,461 y 0,139. Las mejoras del promedio de consistencia proceden sobre todo de Knowledge-Exposure, Knowledge-Accuracy y Knowledge-Hallucination. En Qwen, la submétrica de consistencia conversacional también baja levemente de 3,229 a 3,224, y varias métricas de atractivo quedan por debajo del baseline. Así, no es fiel decir que todas las dimensiones de consistencia mejoran. En los 17 personajes no vistos, el promedio de tres dimensiones sube solo 0,064 para Baichuan (2,934 a 2,998) y 0,059 para Qwen (2,849 a 2,908), sin intervalos ni repetición de splits. La cadena obtiene su mejor promedio con cinco reflexiones: 2,941 frente a 2,849 sin cadena; con diez baja a 2,935. La ablación apoya que COP y CSPA contribuyen al promedio, aunque su escala de mejora es modesta. La evaluación humana reúne diez investigadores y becarios de la empresa de los autores, entrenados para armonizar criterios. Cada uno selecciona 50 ejemplos y se obtienen 500 juicios por comparación. PCL gana 262, empata 43 y pierde 195 veces para Baichuan: 52,4% de todos los juicios o 57,3% de los decisivos. Para Qwen gana 303, empata 137 y pierde 60: 60,6% del total u 83,5% de los decisivos. No se informa acuerdo interjueces, cegamiento, asignación por personaje o test estadístico, y llamar a estos evaluadores human experts es más fuerte que la descripción real de investigadores y becarios internos. GPT-4-turbo-2024-04-09 evalúa cada orden dos veces para reducir sesgo posicional. Reporta 602/92/306 victorias/empates/derrotas para Baichuan y 582/181/237 para Qwen, pero no se valida su acuerdo con humanos ni se explica cómo se reconcilian órdenes discordantes. CharacterRM procede del mismo ecosistema CharacterEval que proporciona los datos, por lo que tampoco es un evaluador independiente. El paper afirma significantly outperform sin dar desviaciones, intervalos, p-values, tests o réplicas por semilla en sus doce submétricas. El control de conocimiento general solo usa Qwen: el promedio de seis benchmarks cambia de 37,4 a 37,6, mientras OpenBookQA cae cuatro puntos y MedQA-cn 0,4. Esto es compatible con conocimiento medio aproximadamente conservado, pero no demuestra ausencia de catastrophic forgetting. La reproducibilidad es insuficiente. No se enlazan código PCL, checkpoints, datos warm-up, pares DPO, outputs, particiones o scripts. No se versiona el GPT que genera las 1.000 cadenas principales; falta beta de DPO; no se publican hardware, coste, semillas, temperatura, decoding, criterio de checkpoint o parser del bloque final. Table 12 cambia la escala de aproximadamente 1–4 a 0–100 sin definir la transformación. Tampoco se aclara si CharacterRM recibe las cinco reflexiones explícitas o solo la respuesta final; si recibe todo, el método expone directamente datos del perfil y más tokens al juez, un confusor de longitud y contenido. La conclusión defendible es que obligar al modelo a verbalizar cinco comprobaciones del personaje y, en modelos abiertos, afinarlo con objetivos sintéticos y pares con/sin perfil, aumenta varios promedios de CharacterEval y es preferido con frecuencia por jueces internos y GPT-4. No demuestra que el modelo adquiera una personalidad, que toda consistencia de personaje mejore, que el método carezca de anotación sintética, que generalice ampliamente a perfiles nuevos o que preserve conocimiento sin coste.
Pregunta de investigación
¿Puede una cadena explícita de autorreflexión sobre un personaje, combinada con SFT sintético y DPO sobre respuestas generadas con y sin perfil, mejorar el role-play en CharacterEval sin anotaciones humanas de preferencias?