HER propone un formato de role-play con dos capas textuales. Antes de responder, el modelo genera un bloque oculto de system thinking en tercera persona para planificar cómo representar al personaje; después produce role thinking en primera persona, acciones y diálogo. Esas trazas no proceden de pensamientos humanos observados: un modelo comercial no identificado las sintetiza a partir de diálogos literarios de CoSER. El pipeline añade monólogo interno, diversifica el orden de pensamiento/acción/habla y reescribe el plan con acceso offline a la continuación realizada. Qwen3-32B-Base recibe SFT y después RL tipo GRPO/DAPO. Un reward model generativo Qwen3-32B compara la respuesta de la política con la de un checkpoint SFT congelado usando principios dependientes del caso.
El paper informa 53,12 en CoSER y 65,73 en MiniMax Role-Play Bench para HER-RL, frente a 22,86 y 50,76 para Qwen3-32B. Las diferencias son 30,26 y 14,97 puntos, no porcentajes. Respecto al baseline, equivalen aproximadamente a 132,37% y 29,49% relativos. El salto atribuible a RL sobre HER-SFT es mucho menor: 2,20 puntos CoSER y 7,29 MiniMax. En la tabla principal HER-RL ocupa el octavo lugar y queda por debajo de varios modelos propietarios. La ablación sube CoSER de 48,64 sin system thinking a 50,92 con esa capa y a 53,12 con RL, pero también cambia cómputo, formato y supervisión; no identifica un mecanismo cognitivo humano.
La evaluación CoSER usa 200 conversaciones de 20 rondas y un único juez Qwen3-235B-A22B para puntuar modelos derivados de Qwen y otros sistemas. No hay intervalos de CoSER, repeticiones de entrenamiento ni ledger por semilla. El contraste teacher-humano reserva solo 50 pares para test después de usar 150 para ajustar el prompt: 80,5% de acuerdo con consenso y 84,0% entre dos expertos. Otra calibración declara 81,5% de acuerdo bruto sin tamaño muestral. Tabla 3 menciona además 4.739 pares anotados por expertos sin documentar su protocolo. Esta evidencia calibra preferencias textuales de role-play; no demuestra razonamiento humano, estados mentales auténticos, conciencia ni personalidad psicológica. La diversidad medida es principalmente variedad de órdenes de etiquetas y n-gramas.
La liberación pública es sustancial pero no reproduce el trabajo de extremo a extremo. Existen los pesos completos BF16 de HER-32B y HER-RM-32B, cuatro JSONL grandes, una demo y 69 archivos de código; todos los Python compilan. Sin embargo, no hay tests, CI, lockfile, logs ni resultados, faltan scripts que exige la propia guía, muchas rutas siguen como /path/to, no se publican las configuraciones ms-swift/verl ni los datos CoSER que espera el evaluador. El código quedó en enero, antes de arXiv v4 y ACL final. El dataset público tampoco coincide con el paper: 76.883 frente a 72.656 muestras multi-turn y 342.493 frente a 323.600 single-turn.
Hay dos contradicciones éticas importantes. El texto afirma que no usa datos de usuarios, pero el Apéndice F describe feedback explícito e implícito recogido durante despliegue normal. También afirma que no libera texto fuente protegido, mientras la ficha del dataset declara campos con texto literario original y las muestras públicas reproducen pasajes identificables de novelas. La etiqueta Apache-2.0 no resuelve por sí sola los derechos de cada obra. La contribución válida es una arquitectura de generación estructurada, un reward model contextual, pesos utilizables y evidencia benchmark de mejor role-play para un Qwen adaptado. No es prueba de emulación cognitiva humana ni un release plenamente reproducible. El trabajo sí está revisado por pares en Findings of ACL 2026, DOI 10.18653/v1/2026.findings-acl.1283.