Too Good to be Bad: On the Failure of LLMs to Role-Play Villains

Personas, identidad y agentes2026ACL AnthologyRevisión editorial aprobada

Autores: Zihao Yi, Qingxuan Jiang, Ruotian Ma, Xingyu Chen, Qu Yang, Mengru Wang, Fanghua Ye, Ying Shen, Zhaopeng Tu, Xiaolong Li, Liefeng Bo

Palabras clave: Moral RolePlay, Villain role-play, Character fidelity, Safety alignment, LLM-as-judge

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

11
Autores
6
Hallazgos
7
Limitaciones
3
Evidencias

Resumen editorial

Español

El trabajo estudia si los modelos de lenguaje mantienen la fidelidad a personajes literarios cuando estos pasan de ser prosociales a egoístas o villanos. Presenta Moral RolePlay, un benchmark derivado de escenas de COSER. Gemini 2.5 Pro asigna a cada escena una puntuación de completitud, sentimiento, uno de cuatro niveles morales, paradigmas morales, personajes buenos con defectos, egoístas y villanos, y rasgos de un vocabulario de 77 etiquetas. El corpus publicado contiene 23.191 escenas y 54.591 apariciones de personajes clave. Para la evaluación principal se seleccionan 325 escenas y se anuncia un conjunto equilibrado de 800 personajes, 200 por nivel. Cada modelo recibe el perfil del personaje, el contexto narrativo y una instrucción de actuación; después, un juez LLM compara la simulación con los rasgos anotados y marca incoherencias con gravedad de 1 a 5. La puntuación Character Fidelity parte de 5, resta 0,5 por la suma de deducciones y 0,1 por la gravedad máxima, suma 0,15 por turno de diálogo del personaje y recorta el resultado al intervalo 0–5.

La comparación final abarca 18 sistemas. Las medias comunicadas descienden de 3,21 en el nivel 1 a 3,14, 2,71 y 2,62 en los niveles siguientes. Casi toda la caída ocurre entre personajes buenos con defectos y egoístas (-0,43); el paso de egoísta a villano es mucho menor (-0,09). La ordenación se conserva descriptivamente con instrucciones en primera y tercera persona. En siete modelos con modo de razonamiento, activarlo cambia las medias de 3,23/3,14/2,74/2,59 a 3,23/3,09/2,69/2,57: diferencias pequeñas y sin intervalos ni pruebas inferenciales. El ranking específico de villanos tampoco coincide bien con Arena. En las 17 filas transcritas en la tarjeta pública, la correlación de Pearson entre puntuaciones es aproximadamente 0,098 y la de Spearman 0,025; el artículo no reporta esos coeficientes ni su incertidumbre.

La auditoría del material público cambia varios detalles importantes. El JSON completo sí tiene 23.191 escenas y 54.591 apariciones, pero su distribución moral real es 22,987%, 56,740%, 18,514% y 1,757%, más un registro sin nivel, no 23,6%, 46,3%, 27,5% y 2,6% como afirma el paper. Esas apariciones corresponden a 11.934 identidades libro-personaje, no a 54.591 personajes independientes. Los dos test públicos tienen 325 escenas y 805 apariciones, 200/205/200/200 por nivel, no exactamente 800; solo hay 620 identidades libro-personaje y 19 personajes clave no hablan en la referencia. Las dos copias del test difieren además en un campo de 17 escenas. El número medio de turnos de referencia varía por nivel y la propia métrica premia los turnos, de modo que la puntuación no aísla fidelidad de rasgo.

La evidencia respalda una observación acotada: bajo estas etiquetas generadas, prompts y juez LLM, los grupos de menor moralidad reciben menor fidelidad media juzgada. No demuestra que el alineamiento de seguridad cause la caída. No hay pares controlados antes/después del alineamiento, medida o intervención de seguridad ni control de familia, capacidad, escena, complejidad, rasgos y oportunidades de diálogo. Tampoco se identifica el modelo juez en el paper: el README usa GPT-4o como ejemplo, el script elige dsr1 y el adaptador público devuelve un marcador fijo. No hay validación humana de etiquetas o juicios, fiabilidad entre evaluadores, barras de error, pruebas de significación, salidas de actores/jueces ni resultados recomputables. El código expone prompts y fórmula, y los datos permiten auditar conteos, pero los proveedores son plantillas sin implementar y la evaluación no se reproduce de extremo a extremo. El estudio es pertinente para simulación de personas narrativas y tensiones entre fidelidad y políticas, no como validación de personalidad psicológica, comprensión moral interna o superioridad de una mayor fidelidad a villanos.

English

This paper asks whether language models preserve fidelity to literary characters as those characters move from prosocial roles toward egoists and villains. It introduces Moral RolePlay, a benchmark derived from COSER narrative scenes. Gemini 2.5 Pro assigns scene completeness, sentiment, one of four moral levels, moral paragons, flawed but good characters, egoists, and villains, and traits from a 77-label vocabulary. The released corpus contains 23,191 scenes and 54,591 key-character portrayals. The main evaluation selects 325 scenes and describes a balanced set of 800 characters, 200 per level. Each tested model receives a character profile, narrative context, and acting instruction; an LLM judge then compares the simulation with the annotated traits and marks inconsistencies with severity from one to five. Character Fidelity starts at five, subtracts 0.5 times the sum of deductions and 0.1 times the maximum severity, adds 0.15 per dialogue turn by the character, and clips the result to 0–5.

The final comparison covers 18 systems. Reported averages fall from 3.21 at Level 1 to 3.14, 2.71, and 2.62 at the following levels. Most of the decline occurs between flawed-good characters and egoists (-0.43); the egoist-to-villain step is much smaller (-0.09). The descriptive ordering remains under first- and third-person prompts. Across seven hybrid reasoning models, enabling reasoning changes the averages from 3.23/3.14/2.74/2.59 to 3.23/3.09/2.69/2.57: small differences without intervals or inferential tests. The villain-specific leaderboard also corresponds poorly with Arena. Across the 17 rows transcribed in the public dataset card, Pearson correlation between scores is about 0.098 and Spearman correlation about 0.025; the paper itself supplies neither those coefficients nor their uncertainty.

Audit of the public artifacts changes several material details. The full JSON does contain 23,191 scenes and 54,591 portrayals, but its actual moral distribution is 22.987%, 56.740%, 18.514%, and 1.757%, plus one record without a level, rather than the paper's 23.6%, 46.3%, 27.5%, and 2.6%. Those portrayals represent 11,934 book-character identities, not 54,591 independent characters. Both public test files contain 325 scenes and 805 portrayals, 200/205/200/200 by level, rather than exactly 800; there are only 620 book-character identities, and 19 listed key characters have no turns in the reference dialogue. The two test copies also differ in one field for 17 scenes. Mean reference turns differ across moral levels, while the metric itself rewards turns, so the score does not isolate trait fidelity.

The evidence supports a bounded observation: under these generated labels, prompts, and LLM judge, lower-morality groups receive lower average judged fidelity. It does not demonstrate that safety alignment caused the decline. There are no controlled pre/post-alignment pairs, safety measure or intervention, or controls for provider family, capability, scene, complexity, traits, and dialogue opportunity. The judge model is not identified in the paper: the README uses GPT-4o as an example, the runner selects dsr1, and the public adapter returns a fixed placeholder. There is no human validation of labels or judgments, inter-rater reliability, error bars, significance testing, actor/judge outputs, or recomputable result ledger. The code exposes prompts and the formula, and the data allows count audits, but provider calls are unimplemented templates and the evaluation cannot be reproduced end to end. The work is relevant to narrative persona simulation and tensions between fidelity and policy, not as validation of psychological personality, internal moral understanding, or the claim that higher villain fidelity is inherently a better alignment outcome.

Pregunta de investigación

¿Disminuye la fidelidad narrativa juzgada de los LLM al representar personajes literarios clasificados desde paradigmas morales hasta villanos, y pueden la perspectiva del prompt, el modo de razonamiento o la capacidad general explicar esa variación?

Método

Moral RolePlay deriva escenas de COSER y usa Gemini 2.5 Pro para anotar completitud, sentimiento, cuatro niveles morales y 77 rasgos. Dieciocho modelos generan simulaciones zero-shot a partir de perfiles y escenas. Un juez LLM no identificado detecta incoherencias de rasgo y severidad; la puntuación combina deducciones, gravedad máxima y un premio por turnos, con recorte 0–5. Se comparan niveles, primera/tercera persona, razonamiento activado/desactivado, polaridad de rasgos y ranking Arena.

Muestra: El paper declara 23.191 escenas y 54.591 apariciones de personajes; el test principal se describe como 800 personajes equilibrados en 325 escenas. El archivo público contiene realmente 805 apariciones (200/205/200/200), 620 identidades libro-personaje y 19 personajes clave sin turnos de referencia. La comparación final incluye 18 modelos.

Hallazgos

  • La fidelidad media comunicada desciende 3,21 → 3,14 → 2,71 → 2,62; la mayor caída es nivel 2→3 (-0,43), no nivel 3→4 (-0,09).
  • La ordenación descriptiva persiste en primera y tercera persona, pero no se aportan intervalos ni pruebas pareadas.
  • Activar razonamiento produce diferencias pequeñas en siete modelos y no identifica activación causal de salvaguardas.
  • VRP y Arena muestran correspondencia descriptiva casi nula en las 17 filas públicas transcritas: Pearson ≈0,098 y Spearman ≈0,025.
  • El JSON completo contradice materialmente la distribución moral publicada, aunque reproduce el número de escenas, sentimiento medio y completitud media.
  • El test público tiene 805 apariciones, no 800, y dos versiones públicas difieren en 17 escenas.

Limitaciones

  • Las etiquetas morales y de rasgo proceden de Gemini 2.5 Pro sin validación humana, acuerdo ni análisis psicométrico.
  • El juez LLM no está identificado y no hay calibración humana, fiabilidad entre jueces ni salidas de evaluación.
  • La métrica premia turnos, recorta valores y puede omitir del denominador personajes ausentes de la simulación.
  • Nivel moral, polaridad de rasgos, escena, identidad, complejidad y oportunidades de diálogo están confundidos.
  • No se reportan intervalos de confianza, barras de error, significación, corrección por repetición ni estabilidad del juez.
  • El código público no implementa proveedores y no publica salidas o resultados, por lo que no reproduce las tablas.
  • Los datos completos y de test divergen de conteos o proporciones del paper; la licencia específica del dataset no está declarada.

Qué no demuestra

  • Que el alineamiento de seguridad cause la menor puntuación de los personajes menos prosociales.
  • Que el modo de razonamiento active salvaguardas o explique causalmente la diferencia.
  • Que los modelos carezcan de comprensión social, psicológica o moral interna.
  • Que el nivel moral aislado explique el gradiente, frente a rasgos, escenas, complejidad o longitud.
  • Que la puntuación mida fidelidad pura con independencia del juez, los turnos y las omisiones.
  • Que una mayor fidelidad a villanos sea intrínsecamente deseable, segura o una alineación superior.
  • Que 54.591 apariciones equivalgan a 54.591 personajes únicos o independientes.
  • Que el benchmark valide personalidad psicológica o estados morales internos en LLM.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2511.04962v2, 17 pages; checked against Findings of ACL 2026 final publication, 11 pages, DOI 10.18653/v1/2026.findings-acl.282

Fuente consultada: https://arxiv.org/abs/2511.04962

Revisión: Codex 17-page arXiv plus 11-page ACL-final visual, full-data, test-version, score, judge-identity, annotation-validity, causal-claim, official-code, licensing and reproducibility audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • 18 actor models in the final main comparison
  • Gemini 2.5 Pro for dataset annotation
  • Unidentified LLM judge

Instrumentos y métricas

  • Moral RolePlay four-level moral taxonomy
  • 77 generated character-trait labels
  • Character Fidelity score
  • Villain RolePlay leaderboard
  • Arena scores and ranks

Datos utilizados

  • Moral RolePlay full dataset
  • Moral RolePlay public test sets
  • COSER-derived narrative scenes

Evidencia y localización

  • Publicación, autoría, DOI, diseño y resultados principales: Findings of ACL 2026 final paper, pp. 5724-5734; DOI 10.18653/v1/2026.findings-acl.282
  • Anotación, prompts, ablations, ranking y detalles extendidos: arXiv:2511.04962v2, 17-page version and appendices
  • Conteos reales, distribución moral, repetición de identidades, versiones del test, métrica, juez, código y reproducibilidad: reports/verification/article-262-acl-villain-roleplay-gemini-annotations-llm-judge-data-drift-score-causal-and-artifact-audit.json