HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing

Personas, identidad y agentes2026ACL AnthologyRevisión editorial aprobada

Autores: Chengyu Du, Xintao Wang, Aili Chen, Weiyuan Li, Rui Xu, Junteng Liu, Zishan Huang, Rong Tian, Zijun Sun, Yuhao Li, Liheng Feng, Deming Ding, Pengyu Zhao, Yanghua Xiao

Palabras clave: Role-playing language models, Persona simulation, Dual-layer thinking, Generative reward model, Reinforcement learning

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

14
Autores
9
Hallazgos
12
Limitaciones
4
Evidencias

Resumen editorial

Español

HER propone un formato de role-play con dos capas textuales. Antes de responder, el modelo genera un bloque oculto de system thinking en tercera persona para planificar cómo representar al personaje; después produce role thinking en primera persona, acciones y diálogo. Esas trazas no proceden de pensamientos humanos observados: un modelo comercial no identificado las sintetiza a partir de diálogos literarios de CoSER. El pipeline añade monólogo interno, diversifica el orden de pensamiento/acción/habla y reescribe el plan con acceso offline a la continuación realizada. Qwen3-32B-Base recibe SFT y después RL tipo GRPO/DAPO. Un reward model generativo Qwen3-32B compara la respuesta de la política con la de un checkpoint SFT congelado usando principios dependientes del caso.

El paper informa 53,12 en CoSER y 65,73 en MiniMax Role-Play Bench para HER-RL, frente a 22,86 y 50,76 para Qwen3-32B. Las diferencias son 30,26 y 14,97 puntos, no porcentajes. Respecto al baseline, equivalen aproximadamente a 132,37% y 29,49% relativos. El salto atribuible a RL sobre HER-SFT es mucho menor: 2,20 puntos CoSER y 7,29 MiniMax. En la tabla principal HER-RL ocupa el octavo lugar y queda por debajo de varios modelos propietarios. La ablación sube CoSER de 48,64 sin system thinking a 50,92 con esa capa y a 53,12 con RL, pero también cambia cómputo, formato y supervisión; no identifica un mecanismo cognitivo humano.

La evaluación CoSER usa 200 conversaciones de 20 rondas y un único juez Qwen3-235B-A22B para puntuar modelos derivados de Qwen y otros sistemas. No hay intervalos de CoSER, repeticiones de entrenamiento ni ledger por semilla. El contraste teacher-humano reserva solo 50 pares para test después de usar 150 para ajustar el prompt: 80,5% de acuerdo con consenso y 84,0% entre dos expertos. Otra calibración declara 81,5% de acuerdo bruto sin tamaño muestral. Tabla 3 menciona además 4.739 pares anotados por expertos sin documentar su protocolo. Esta evidencia calibra preferencias textuales de role-play; no demuestra razonamiento humano, estados mentales auténticos, conciencia ni personalidad psicológica. La diversidad medida es principalmente variedad de órdenes de etiquetas y n-gramas.

La liberación pública es sustancial pero no reproduce el trabajo de extremo a extremo. Existen los pesos completos BF16 de HER-32B y HER-RM-32B, cuatro JSONL grandes, una demo y 69 archivos de código; todos los Python compilan. Sin embargo, no hay tests, CI, lockfile, logs ni resultados, faltan scripts que exige la propia guía, muchas rutas siguen como /path/to, no se publican las configuraciones ms-swift/verl ni los datos CoSER que espera el evaluador. El código quedó en enero, antes de arXiv v4 y ACL final. El dataset público tampoco coincide con el paper: 76.883 frente a 72.656 muestras multi-turn y 342.493 frente a 323.600 single-turn.

Hay dos contradicciones éticas importantes. El texto afirma que no usa datos de usuarios, pero el Apéndice F describe feedback explícito e implícito recogido durante despliegue normal. También afirma que no libera texto fuente protegido, mientras la ficha del dataset declara campos con texto literario original y las muestras públicas reproducen pasajes identificables de novelas. La etiqueta Apache-2.0 no resuelve por sí sola los derechos de cada obra. La contribución válida es una arquitectura de generación estructurada, un reward model contextual, pesos utilizables y evidencia benchmark de mejor role-play para un Qwen adaptado. No es prueba de emulación cognitiva humana ni un release plenamente reproducible. El trabajo sí está revisado por pares en Findings of ACL 2026, DOI 10.18653/v1/2026.findings-acl.1283.

English

HER proposes a two-layer textual format for role-play. Before responding, the model generates a hidden third-person system-thinking block to plan how to portray the character; it then produces first-person role thinking, actions, and dialogue. These traces are not observations of human thought: an unidentified commercial teacher synthesizes them from CoSER literary dialogues. The pipeline adds inner monologue, diversifies the ordering of thought/action/speech, and rewrites the plan offline with access to the realized continuation. Qwen3-32B-Base receives SFT followed by GRPO/DAPO-style RL. A Qwen3-32B generative reward model compares the policy response with a frozen SFT checkpoint using case-dependent principles.

The paper reports 53.12 on CoSER and 65.73 on MiniMax Role-Play Bench for HER-RL, versus 22.86 and 50.76 for Qwen3-32B. The differences are 30.26 and 14.97 score points, not percentages. Relative to the baselines, they correspond to approximately 132.37% and 29.49%. The gain attributable to RL over HER-SFT is much smaller: 2.20 CoSER points and 7.29 MiniMax points. HER-RL ranks eighth in the main table and remains below several proprietary models. The ablation raises CoSER from 48.64 without system thinking to 50.92 with that layer and 53.12 with RL, but it also changes computation, format, and supervision; it does not identify a human cognitive mechanism.

CoSER evaluation uses 200 twenty-round conversations and a single Qwen3-235B-A22B judge to score Qwen-derived and other systems. There are no CoSER intervals, repeated training runs, or seed-level ledger. The teacher-human comparison reserves only 50 pairs for testing after 150 are used to refine the prompt: agreement with consensus is 80.5%, and agreement between two experts is 84.0%. A separate calibration reports 81.5% raw agreement without a sample size. Table 3 also mentions 4,739 expert-annotated pairs without documenting their protocol. This evidence calibrates textual role-play preferences; it does not establish human reasoning, authentic mental states, consciousness, or psychological personality. The diversity evidence is mostly tag-order and n-gram variety.

The public release is substantial but does not reproduce the study end to end. Complete BF16 HER-32B and HER-RM-32B weights, four large JSONL files, a demo, and 69 code files are available; all Python files compile. However, there are no tests, CI, lockfile, logs, or result ledger; scripts required by the documentation are missing, many paths remain /path/to placeholders, ms-swift/verl launch configurations are absent, and the CoSER data expected by the evaluator are not included. The code stopped in January, before arXiv v4 and the final ACL paper. The released dataset also differs from the paper: 76,883 versus 72,656 multi-turn samples and 342,493 versus 323,600 single-turn samples.

Two ethical contradictions matter. The paper says that no user or user-derived data are used, while Appendix F describes explicit and implicit feedback collected during normal deployment. It also says that no raw copyrighted source text is released, while the dataset card declares original literary-text fields and public samples reproduce identifiable novel passages. An Apache-2.0 label does not itself resolve rights to each underlying work. The supported contribution is a structured-generation architecture, a contextual reward model, usable weights, and benchmark evidence of stronger role-play for an adapted Qwen model. It is not evidence of human cognitive emulation or a fully reproducible release. The paper is peer reviewed in Findings of ACL 2026, DOI 10.18653/v1/2026.findings-acl.1283.

Pregunta de investigación

¿Mejoran el role-play de personajes literarios unas trazas sintéticas que separan planificación del modelo y monólogo del personaje, junto con un reward model contextual y RL, frente a SFT o al Qwen3-32B base?

Método

HER convierte diálogos literarios CoSER mediante un teacher comercial en trayectorias con system thinking, role thinking, acción y habla; diversifica sus patrones y construye planes mediante generación hacia delante y reescritura retrospectiva. Entrena Qwen3-32B-Base con SFT y luego con GRPO/DAPO. Un GenRM Qwen3-32B genera principios por caso, compara la política con HER-SFT congelado y devuelve recompensa -1/0/+1. Evalúa 200 conversaciones CoSER de 20 rondas con Qwen3-235B-A22B y el protocolo MiniMax de 100 turnos, más ablations, análisis de diversidad y pequeñas calibraciones humanas.

Muestra: Tras limpiar CoSER, el paper declara 760 libros, 30.069 plots, 29.081 conversaciones, 17.966 personajes y 383.654 utterances. Tabla 12 asigna 107.800 muestras a role-play SFT, 26.800 a role-play RL, 108.800 a GRM SFT, 80.000 a GRM RL y 200 a GRM test: 323.600 single-turn derivados de 72.656 multi-turn. El release contiene 76.883 y 342.493 filas, respectivamente. CoSER test usa 200 conversaciones x 20 rondas. La validación teacher-humano usa 150 pares para desarrollo y 50 para test; otra calibración no publica N. Tabla 3 declara 4.739 preferencias expertas y el GRM balanceado se prueba sobre 800 comparaciones.

Hallazgos

  • HER-RL obtiene 53,12 en CoSER frente a 50,92 de HER-SFT y 22,86 del Qwen3-32B base.
  • En MiniMax obtiene 65,73 frente a 58,44 de HER-SFT y 50,76 del base.
  • 30,26 y 14,97 son diferencias en puntos; los porcentajes relativos correctos frente al base son aproximadamente 132,37% y 29,49%.
  • La ganancia incremental de RL sobre SFT es 2,20 puntos CoSER y 7,29 puntos MiniMax.
  • System thinking eleva la ablación CoSER de 48,64 a 50,92; RL la lleva a 53,12.
  • El GenRM balanceado alcanza 73,99% frente a 69,91% del no balanceado en 800 comparaciones y reduce el colapso de patrón.
  • La calibración teacher-humano informa 80,5% de acuerdo en 50 pares de test y 84,0% entre dos expertos.
  • Los pesos completos del policy y del reward model están publicados y los scripts Python liberados compilan.
  • Los conteos del dataset público no coinciden con los del paper y el pipeline completo no se reproduce desde el checkout.

Limitaciones

  • Las trazas de pensamiento son síntesis del teacher y racionalizaciones retrospectivas, no estados mentales observados.
  • Un único juez Qwen evalúa sistemas Qwen sin comparación de familias de jueces.
  • CoSER no tiene intervalos ni resultados por semilla; no se reportan repeticiones de entrenamiento.
  • Las principales cifras se etiquetan incorrectamente como porcentajes.
  • Los estudios humanos son pequeños o tienen N/protocolo sin publicar, y no evalúan directamente toda la salida de HER-RL.
  • Diversidad de etiquetas y n-gramas no demuestra diversidad semántica o psicológica.
  • El teacher comercial, sus prompts operativos y sus snapshots no están completamente fijados.
  • Dataset, código, pesos y manuscrito no comparten una release inmutable y sus conteos divergen.
  • Faltan scripts documentados, configuraciones de entrenamiento, datos de evaluación, resultados, tests y CI.
  • La afirmación de no usar datos derivados de usuarios contradice la sección de señales de despliegue.
  • La afirmación de no liberar texto protegido contradice el esquema y las muestras del dataset.
  • No hay evaluación de seguridad del modelo liberado para suplantación, manipulación o sesgos.

Qué no demuestra

  • Que HER razone como un humano o posea cognición, conciencia o estados internos auténticos.
  • Que role thinking sea el pensamiento real de un personaje o de una persona.
  • Que se haya medido personalidad psicológica estable.
  • Que 30,26 y 14,97 sean mejoras porcentuales relativas.
  • Que RL por sí solo explique toda la diferencia frente al modelo base.
  • Que un juez de la misma familia sea independiente o imparcial.
  • Que los acuerdos humanos generalicen a todas las conversaciones, dimensiones y modelos.
  • Que variedad estructural de salida equivalga a profundidad narrativa o psicológica.
  • Que no se hayan usado señales derivadas de usuarios.
  • Que no se haya liberado texto literario protegido o que Apache-2.0 resuelva todos sus derechos.
  • Que el dataset público corresponda exactamente a los splits y conteos del paper.
  • Que el repositorio permita reproducir entrenamiento y tablas de extremo a extremo.
  • Que los resultados se generalicen a personas reales, otros idiomas, dominios o riesgos de despliegue.
  • Que la publicación en Findings valide afirmaciones más amplias que la evidencia experimental reportada.

Trazabilidad

Alcance: Texto completo

Versión: Findings of ACL 2026 final paper / arXiv:2601.21459v4, 38 pages; ACL record, GitHub commit 1e5fd85, Hugging Face dataset and HER-32B/HER-RM-32B releases also audited

Fuente consultada: https://aclanthology.org/2026.findings-acl.1283/

Revisión: Codex 38-page Findings/arXiv-v4 visual, ACL-publication, construct, score-arithmetic, judge/human-study, dataset-count, privacy/copyright, GitHub and Hugging Face artifact audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Qwen3-32B-Base (policy backbone)
  • HER-SFT
  • HER-RL / ChengyuDu0123/HER-32B
  • HER-RM-32B generative reward model
  • Qwen3-235B-A22B evaluation judge
  • Unidentified commercial teacher model
  • Commercial and open comparison models listed in Table 2

Instrumentos y métricas

  • Dual-layer system-thinking and role-thinking format
  • Three-stage reverse-synthesis pipeline
  • Case-dependent principle generation
  • Pairwise generative reward model
  • GRPO with DAPO techniques
  • CoSER SC, AN, CF and SQ scores
  • MiniMax Worlds, Stories and Preferences scores
  • Human win/lose/tie preference labels
  • Pattern concentration, Shannon entropy, Distinct-n and Self-BLEU

Datos utilizados

  • CoSER literary role-play dialogues
  • HER-Dataset full_info and clean releases
  • HER-Dataset sft_multi_turn and sft_single_turn releases
  • CoSER held-out evaluation conversations
  • MiniMaxAI Role-Play Bench
  • Principle and preference data derived from simulated, expert and reported production interaction signals

Evidencia y localización

  • Publicación, arquitectura, entrenamiento, resultados, apéndices, limitaciones y ética: Findings of ACL 2026, pages 25725-25762; ACL Anthology 2026.findings-acl.1283; arXiv:2601.21459v4
  • Pesos, dataset, conteos públicos, esquema, muestras y licencias: Hugging Face ChengyuDu0123/HER-32B, HER-RM-32B and HER-Dataset revisions checked 2026-07-16
  • Alcance del código, deriva documental, archivos ausentes, placeholders, tests y CI: cydu24/HER commit 1e5fd856b9e23d3af41445e3c4ca734e24e012ef
  • Aritmética de resultados, validez de constructo, evaluación humana, privacidad, copyright y reproducibilidad: reports/verification/article-266-her-publication-construct-metric-human-data-privacy-and-artifact-audit.json