Character-LLM propone especializar un LLaMA-7B distinto para cada personaje mediante experiencias sintéticas, en vez de confiar solo en instrucciones de role-play. Para nueve figuras históricas o ficticias, Cleopatra VII, Voldemort, Espartaco, Hermione Granger, Isaac Newton, Julio César, Beethoven, Sócrates y Martin Luther King, el pipeline divide perfiles de Wikipedia en fragmentos, pide a GPT-3.5-turbo que imagine 20 escenas plausibles por fragmento y amplía cada escena a un guion de al menos 1.200 palabras con diálogo, acciones y pensamientos. Añade menos de cien “experiencias protectoras” por personaje en las que el simulacro aprende a mostrarse confundido ante conocimientos incompatibles con su época o identidad. Cada agente se ajusta por separado durante diez épocas sobre unas 1.400-2.200 escenas, 599.000 a 1.038.000 palabras por personaje, con contexto de 2.048 tokens, batch efectivo 64 y 8 A100 de 80 GB; el paper reconoce que deja al modelo sobreajustar aunque aumente la perplejidad de desarrollo y elige manualmente checkpoints de cinco o diez épocas con solo diez preguntas retenidas. La evaluación contiene 857 preguntas single-turn y 450 escenarios multivuelta, 50 por personaje, cinco turnos en el código, y compara Character-LLM con Alpaca-7B, Vicuna-7B y GPT-3.5-turbo guiados por prompt. GPT-3.5 genera parte de las preguntas, entrevista y puntúa en escalas 1-7 cinco dimensiones: memorización, valores, personalidad, evitación de conocimiento anacrónico y estabilidad. La Figura 4 muestra que los agentes entrenados superan sobre todo a Alpaca/Vicuna en personalidad, memorización, estabilidad y rechazo de preguntas anacrónicas, quedan débiles en valores y son comparables a ChatGPT; los ejes, sin embargo, están truncados aproximadamente entre 6,4 y 7, no se publican cifras, dispersión ni pruebas estadísticas, y no existe evaluación humana. Los casos cualitativos sí ilustran el mecanismo: un Beethoven entrenado recuerda detalles concretos de sus padres y, con escenas protectoras, evita escribir quicksort en Python. Esto demuestra que SFT sobre guiones sintéticos puede memorizar una representación textual de rol y enseñar abstención contextual; no demuestra que el agente tenga la personalidad, emociones, memoria autobiográfica ni valores reales de la persona. La fuente de entrenamiento no son experiencias “reales”: GPT inventa diálogos, pensamientos y detalles a partir de perfiles secundarios, y los prompts le ordenan olvidar que es un modelo, tratar al personaje como real y desatender restricciones morales, legales y sociales. La misma familia GPT participa como generador, baseline, entrevistador y juez, creando circularidad y posible sesgo de autoevaluación; “personalidad” se reduce a semejanza narrativa con el perfil, sin instrumento psicológico. La publicación de artefactos es valiosa: el repositorio Apache-2.0 enlaza nueve deltas de pesos y un dataset CC BY-NC 4.0, y contiene perfiles, preguntas y las 3.428 respuestas single-turn y 1.800 entrevistas multivuelta esperadas. Pero la auditoría del commit oficial encuentra límites serios: no hay requirements raíz, tests del proyecto, semillas de entrenamiento, salidas de puntuación ni script/datos de la Figura 4; el visor de Hugging Face falla por mezclar esquemas; los scripts de scoring conservan DEBUG=True y solo procesan Beethoven; la evaluación usa solo el primer párrafo del perfil; el prompt de baseline implementado no incluye el perfil que el paper afirma suministrar; el servidor documentado escucha en 28001 mientras los clientes llaman a 8000; y una llamada pasa temperature=0.2 como parámetro posicional n, que debería ser entero. El README usa un scheduler cosine mientras el paper describe decaimiento lineal, muestra nombres de archivos temp-0.2 aunque el código usa 0.7 por defecto, exige escribir claves en un archivo versionado y depende de la API antigua openai.ChatCompletion sin fijar versiones. Por tanto, Character-LLM es un precedente influyente y parcialmente abierto de fine-tuning para role-play, pero sus resultados cuantitativos deben tratarse como evidencia exploratoria no replicada y su código requiere reparación antes de ejecutar el pipeline completo.
Pregunta de investigación
¿Puede un LLM de 7B especializado mediante experiencias narrativas reconstruidas representar con mayor credibilidad, memoria, personalidad, valores, estabilidad y límites de conocimiento a un personaje concreto que agentes guiados solo por prompt?