Ditto propone que un LLM genere su propio entrenamiento de role-play. Para cada personaje recoge atributos de Wikidata y un perfil de Wikipedia, empareja personajes para producir preguntas pertinentes y preguntas incompatibles, entrega el perfil completo al mismo modelo para simular respuestas y finalmente lo ajusta con una introducción breve, sin el perfil detallado. El paper aplica el proceso a Qwen-Chat de 1,8B, 7B, 14B y 72B. WikiRole se describe como 3.902 roles, 7.086 sesiones en inglés/chino y 36.164 turnos; el test separa 100 personajes, 53 ingleses y 47 chinos, no presentes en entrenamiento, con 498 turnos generados por GPT-4. GPT-4-1106-preview juzga tres dimensiones: identificar al personaje entre cuatro candidatos, puntuar de 1 a 10 el conocimiento apoyado por evidencia y clasificar si rechaza una pregunta fuera de su época o ámbito. Ditto mejora las tres cifras en los cuatro tamaños. Qwen-72B pasa de 0,54/4,92/0,67 a 0,90/6,64/0,82 en identidad/conocimiento/rechazo y de 8,13 a 8,43 en el subset role-play de MT-Bench. Aun así, Qwen-Max obtiene 0,92/8,33/0,91 y GPT-4 supera a Ditto-72B en conocimiento y rechazo. El experimento cruzado 4x4 sugiere que el formato o estilo de role-play puede aprenderse incluso de un supervisor menor, mientras el conocimiento depende más del modelo base. Esa interpretación es plausible, pero descriptiva: no hay intervalos, tests ni repeticiones por semilla. La auditoría del artefacto detecta límites esenciales. La métrica de identidad evalúa cada turno por separado y muestra al juez también la pregunta; un baseline léxico que ignora la respuesta acierta 249/498 candidatos (50%, azar 25%), por lo que no aísla estilo ni consistencia multi-turno. Solo 97/498 preguntas requieren rechazo: no rechazar nunca ya daría 80,52% de accuracy. Ditto-72B sí logra 92,78% de recall en esas preguntas, pero rechaza erróneamente 85 de 401 preguntas válidas. El repositorio publica el test, una respuesta de Ditto-72B y 25 archivos de puntuación, pero no el corpus de entrenamiento, código de simulación/ajuste ni checkpoints. Varios resultados omiten o duplican personajes porque el evaluador pierde silenciosamente futuros fallidos. En suma, el trabajo aporta evidencia útil de mejora de role-play en Qwen y un benchmark interesante, pero no demuestra que los LLM sean literalmente una superposición de personajes, que la identidad sea estable o que Ditto logre role-play arbitrario y seguro.
Pregunta de investigación
¿Puede un LLM mejorar su role-play generando conversaciones a partir de perfiles que ya sabe leer y ajustándose después con ellas, y qué revela la supervisión cruzada sobre la transferencia de estilo frente a los límites del conocimiento del modelo base?