Large Language Models are Superpositions of All Characters: Attaining Arbitrary Role-play via Self-Alignment

Inducción y control de rasgos2024ACL AnthologyRevisión editorial aprobada

Autores: Keming Lu, Bowen Yu, Chang Zhou, Jingren Zhou

Palabras clave: Computation and Language, Machine Learning

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
9
Hallazgos
20
Limitaciones
6
Evidencias

Resumen editorial

Español

Ditto propone que un LLM genere su propio entrenamiento de role-play. Para cada personaje recoge atributos de Wikidata y un perfil de Wikipedia, empareja personajes para producir preguntas pertinentes y preguntas incompatibles, entrega el perfil completo al mismo modelo para simular respuestas y finalmente lo ajusta con una introducción breve, sin el perfil detallado. El paper aplica el proceso a Qwen-Chat de 1,8B, 7B, 14B y 72B. WikiRole se describe como 3.902 roles, 7.086 sesiones en inglés/chino y 36.164 turnos; el test separa 100 personajes, 53 ingleses y 47 chinos, no presentes en entrenamiento, con 498 turnos generados por GPT-4. GPT-4-1106-preview juzga tres dimensiones: identificar al personaje entre cuatro candidatos, puntuar de 1 a 10 el conocimiento apoyado por evidencia y clasificar si rechaza una pregunta fuera de su época o ámbito. Ditto mejora las tres cifras en los cuatro tamaños. Qwen-72B pasa de 0,54/4,92/0,67 a 0,90/6,64/0,82 en identidad/conocimiento/rechazo y de 8,13 a 8,43 en el subset role-play de MT-Bench. Aun así, Qwen-Max obtiene 0,92/8,33/0,91 y GPT-4 supera a Ditto-72B en conocimiento y rechazo. El experimento cruzado 4x4 sugiere que el formato o estilo de role-play puede aprenderse incluso de un supervisor menor, mientras el conocimiento depende más del modelo base. Esa interpretación es plausible, pero descriptiva: no hay intervalos, tests ni repeticiones por semilla. La auditoría del artefacto detecta límites esenciales. La métrica de identidad evalúa cada turno por separado y muestra al juez también la pregunta; un baseline léxico que ignora la respuesta acierta 249/498 candidatos (50%, azar 25%), por lo que no aísla estilo ni consistencia multi-turno. Solo 97/498 preguntas requieren rechazo: no rechazar nunca ya daría 80,52% de accuracy. Ditto-72B sí logra 92,78% de recall en esas preguntas, pero rechaza erróneamente 85 de 401 preguntas válidas. El repositorio publica el test, una respuesta de Ditto-72B y 25 archivos de puntuación, pero no el corpus de entrenamiento, código de simulación/ajuste ni checkpoints. Varios resultados omiten o duplican personajes porque el evaluador pierde silenciosamente futuros fallidos. En suma, el trabajo aporta evidencia útil de mejora de role-play en Qwen y un benchmark interesante, pero no demuestra que los LLM sean literalmente una superposición de personajes, que la identidad sea estable o que Ditto logre role-play arbitrario y seguro.

English

Ditto asks an LLM to generate its own role-play supervision. For each character it collects Wikidata attributes and a Wikipedia profile, pairs characters to produce relevant and incompatible questions, gives the full profile to the same model for response simulation, and finally fine-tunes it with only a short introduction rather than the detailed profile. The paper applies this process to Qwen-Chat at 1.8B, 7B, 14B and 72B. WikiRole is reported as 3,902 roles, 7,086 English/Chinese sessions and 36,164 turns; the test holds out 100 characters, 53 English and 47 Chinese, not used for training, with 498 turns generated by GPT-4. GPT-4-1106-preview judges three dimensions: identifying the character among four candidates, scoring evidence-supported knowledge from 1 to 10, and classifying whether the model rejects a question outside the character's era or scope. Ditto improves all three reported figures at every size. Qwen-72B moves from 0.54/4.92/0.67 to 0.90/6.64/0.82 for identity/knowledge/rejection and from 8.13 to 8.43 on the MT-Bench role-play subset. Qwen-Max nevertheless scores 0.92/8.33/0.91, and GPT-4 exceeds Ditto-72B on knowledge and rejection. The 4 x 4 cross-supervision experiment suggests that role-play format or style can be learned even from a smaller supervisor, while knowledge depends more on the seed model. This is plausible but descriptive: there are no intervals, tests or seed replications. Artifact auditing reveals important limits. Identity is judged one turn at a time and the judge also sees the user question; an answer-blind lexical baseline selects the correct candidate for 249/498 turns (50%, versus 25% chance), so the metric does not isolate style or multi-turn consistency. Only 97/498 questions require rejection, meaning never rejecting already yields 80.52% accuracy. Ditto-72B does achieve 92.78% recall on those unknown questions, but falsely rejects 85 of 401 answerable questions. The repository publishes the test, one Ditto-72B response set and 25 score files, but not the training corpus, simulation/fine-tuning code or checkpoints. Several outputs omit or duplicate roles because evaluator failures can disappear silently. Overall, the paper provides useful evidence of improved Qwen role-play and an interesting benchmark, but it does not show that LLMs are literally superpositions of characters, that identity is stable, or that Ditto achieves arbitrary and safe role-play.

Pregunta de investigación

¿Puede un LLM mejorar su role-play generando conversaciones a partir de perfiles que ya sabe leer y ajustándose después con ellas, y qué revela la supervisión cruzada sobre la transferencia de estilo frente a los límites del conocimiento del modelo base?

Método

Ditto extrae perfiles de Wikidata/Wikipedia, empareja personajes, genera tres preguntas específicas o contrastivas, simula respuestas con el perfil completo y ajusta el mismo Qwen con una introducción breve. Evalúa cuatro tamaños en 100 roles no solapados y 498 turnos. GPT-4-1106-preview realiza tres juicios por turno sobre identidad, conocimiento y rechazo; se añade MT-Bench role-play y una cuadrícula 4x4 de supervisor por modelo semilla.

Muestra: El entrenamiento declarado contiene 3.902 roles y 7.086 sesiones, 3.902 inglesas y 3.184 chinas, con 36.164 turnos. El test tiene 100 roles no solapados, 53 en inglés y 47 en chino, y 498 turnos: 401 preguntas contestables y 97 que requieren rechazo. Cada conversación aporta entre uno y seis turnos.

Hallazgos

  • Ditto mejora identidad, conocimiento y rechazo en los cuatro tamaños de Qwen evaluados.
  • Qwen-1,8B pasa de 0,60/3,13/0,65 a 0,78/3,81/0,73; MT-Bench role-play, de 5,85 a 6,34.
  • Qwen-7B pasa de 0,52/3,87/0,70 a 0,82/4,97/0,76; MT-Bench, de 6,73 a 6,90.
  • Qwen-14B pasa de 0,52/4,15/0,68 a 0,90/6,03/0,80; MT-Bench, de 7,10 a 7,65.
  • Qwen-72B pasa de 0,54/4,92/0,67 a 0,90/6,64/0,82; MT-Bench, de 8,13 a 8,43.
  • Qwen-Max conserva el mejor resultado de Table 2, 0,92/8,33/0,91; Ditto-72B no domina a los sistemas propietarios en todas las métricas.
  • Añadir conocimiento completo al simular datos para Qwen-1,8B mejora especialmente conocimiento, 3,77 a 4,40, y rechazo, 0,73 a 0,79.
  • La cuadrícula cruzada muestra que la identidad identificable puede mejorar con supervisión más débil; conocimiento y rechazo siguen más ligados a la capacidad del modelo semilla.
  • La auditoría reproduce los principales agregados Qwen y varios propietarios a partir de los archivos publicados, aunque algunos usan denominadores incompletos.

Limitaciones

  • 'Superposición de todos los personajes' es una metáfora motivadora, no un mecanismo demostrado.
  • Los 100 roles son entidades públicas de Wikipedia previsiblemente presentes en preentrenamiento; no prueban role-play arbitrario.
  • Los tres resultados dependen del mismo GPT-4-1106-preview como juez y no son medidas independientes de sesgo del evaluador.
  • Identidad se juzga por turno, no por contradicciones o deriva a lo largo de una conversación.
  • El juez de identidad ve la pregunta, que a menudo revela el personaje; un baseline sin respuesta logra 50% frente a 25% al azar.
  • Conocimiento mide coherencia con evidencia del mismo perfil generador, no verdad histórica verificada independientemente.
  • Las 97 preguntas de rechazo son solo 19,48% del test; raw accuracy oculta recall, especificidad y sobrerrechazo.
  • Ditto-72B logra 92,78% de recall de preguntas desconocidas, pero rechaza erróneamente 85 de 401 preguntas contestables.
  • No se reportan intervalos, significación, corrección múltiple ni variación por semilla.
  • La anotación humana no informa número de anotadores, acuerdo, adjudicación ni etiquetas de calidad por ítem.
  • Faltan el corpus WikiRole de 36.164 turnos, selección exacta de roles, código de simulación/entrenamiento y checkpoints.
  • El pool público tiene 7.511 metadatos y no permite reconstruir el subconjunto de 3.902 roles entrenados.
  • Varios outputs pierden roles; Xingchen duplica Edward III y omite Freddy Krueger.
  • El código ignora futuros fallidos y nunca alcanza la escritura del archivo de fallos tras relanzar la excepción.
  • La métrica de conocimiento se calcula también en 97 preguntas deliberadamente no contestables y sin evidencia.
  • El texto principal y el apéndice discrepan entre learning rate 2e-7 e inicial 2e-6/mínimo 2e-7.
  • Los checkpoints Qwen degradados usados como base no son públicos y las APIs propietarias no están completamente controladas entre sí.
  • No se evalúan seguridad, sesgos, privacidad, copyright, suplantación o daño al representar personas reales.
  • El propio paper advierte que los modelos pueden generar contenido tóxico o dañino bajo inducción.
  • Solo se estudian inglés, chino, Qwen y personajes con perfiles Wiki.

Qué no demuestra

  • No demuestra que los LLM sean literalmente una superposición de todos los personajes.
  • No demuestra role-play arbitrario para cualquier persona, personaje, lengua o familia de modelos.
  • No convierte 0,90 de identidad en evidencia de consistencia multi-turno estable.
  • No demuestra que WikiRoleEval sea objetivo o ajeno al sesgo del juez LLM.
  • No demuestra que Ditto-72B iguale o supere globalmente a GPT-4, GPT-4-Turbo o Qwen-Max.
  • No valida conocimiento como factualidad independiente o ausencia de alucinaciones.
  • No prueba como ley general que el estilo sea fácil de transferir y el conocimiento esté limitado por capacidad.
  • No demuestra que raw rejection accuracy mida adecuadamente límites cognitivos.
  • No permite reproducir el entrenamiento ni todos los resultados de extremo a extremo.
  • No establece seguridad para despliegue ni ausencia de riesgos al suplantar personas reales.
  • No generaliza más allá de roles Wiki en inglés/chino y la familia Qwen evaluada.

Trazabilidad

Alcance: Texto completo

Versión: ACL 2024 Volume 1, pages 7828-7840; arXiv:2401.12474v1 and official GitHub/LFS artifacts audited separately

Fuente consultada: https://aclanthology.org/2024.acl-long.423/

Revisión: Codex 13-page visual, official-ACL, arXiv-v1, GitHub-LFS, public-fallback-archive, all-25-judge-output, denominator, query-leakage, rejection-imbalance, silent-failure, construct, statistics, safety and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Qwen-1.8B-Chat
  • Qwen-7B-Chat
  • Qwen-14B-Chat
  • Qwen-72B-Chat
  • GPT-4-1106-preview evaluator
  • GPT-4 test-data generator
  • OpenChat-3.5-1210
  • Mistral-7B-Instruct-v0.2
  • Mixtral-7x8B-Instruct-v0.1
  • Claude 2.1
  • Wenxin 4.0
  • GPT-3.5-Turbo
  • GPT-4
  • GPT-4-Turbo
  • Qwen-Max
  • CharacterGLM
  • Xingchen

Instrumentos y métricas

  • WikiRoleEval consistent role identity
  • WikiRoleEval evidence-grounded role knowledge
  • WikiRoleEval unknown-question rejection
  • Four-candidate GPT-4-Turbo identity judgment
  • One-to-ten GPT-4-Turbo knowledge judgment
  • Human rejection-required labels
  • MT-Bench role-play subset
  • Four-by-four cross-supervision matrix
  • Four-hundred-query human quality audit

Datos utilizados

  • WikiRole train: reported 3,902 roles, 7,086 sessions and 36,164 turns
  • WikiRoleEval test: 100 held-out roles and 498 turns
  • Public role metadata pool: 7,511 rows and 7,493 unique labels
  • Public Ditto-Qwen-72B response set: 100 roles and 498 turns
  • Twenty-five public collapsed GPT-4-1106-preview judge-output files
  • MT-Bench role-play subset

Evidencia y localización

  • Metadatos, DOI, licencia y abstract exacto: ACL Anthology 2024.acl-long.423
  • Método, métricas, configuración, tablas, limitaciones, ética y apéndices: ACL 2024 PDF, 13 páginas, sha256 669ddfd495ebe9dcd123a9abab5ec8e67edfd161a2a7b1ba1bb44bfb2330aca7
  • Versión, historial y materias oficiales: arXiv:2401.12474v1
  • Código, benchmark, respuestas, salidas del juez, fallos y reproducibilidad: github.com/OFA-Sys/Ditto commit 7d4cb56ba5f058865ab5b1890b5b3916d2b042a6
  • Integridad y forma del fallback público: ditto_data.zip, sha256 c68bfaf20893a1cf966e988bddbbc1273d926bf636bab962d934a48a7f15d2f4
  • Auditoría de leakage, desbalance, denominadores, datos, código, juez y límites de afirmación: reports/verification/article-245-acl-ditto-wikirole-judge-leakage-missing-training-data-and-claim-audit.json