Character-LLM: A Trainable Agent for Role-Playing

Personas, identidad y agentes2023arXivRevisión editorial aprobada

Autores: Yunfan Shao, Linyang Li, Junqi Dai, Xipeng Qiu

Palabras clave: role-playing agents, character simulation, LLM agents, experience reconstruction, personality embodiment, interactive characters, human simulacra

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
28
Hallazgos
54
Limitaciones
26
Evidencias

Resumen editorial

Español

Character-LLM propone especializar un LLaMA-7B distinto para cada personaje mediante experiencias sintéticas, en vez de confiar solo en instrucciones de role-play. Para nueve figuras históricas o ficticias, Cleopatra VII, Voldemort, Espartaco, Hermione Granger, Isaac Newton, Julio César, Beethoven, Sócrates y Martin Luther King, el pipeline divide perfiles de Wikipedia en fragmentos, pide a GPT-3.5-turbo que imagine 20 escenas plausibles por fragmento y amplía cada escena a un guion de al menos 1.200 palabras con diálogo, acciones y pensamientos. Añade menos de cien “experiencias protectoras” por personaje en las que el simulacro aprende a mostrarse confundido ante conocimientos incompatibles con su época o identidad. Cada agente se ajusta por separado durante diez épocas sobre unas 1.400-2.200 escenas, 599.000 a 1.038.000 palabras por personaje, con contexto de 2.048 tokens, batch efectivo 64 y 8 A100 de 80 GB; el paper reconoce que deja al modelo sobreajustar aunque aumente la perplejidad de desarrollo y elige manualmente checkpoints de cinco o diez épocas con solo diez preguntas retenidas. La evaluación contiene 857 preguntas single-turn y 450 escenarios multivuelta, 50 por personaje, cinco turnos en el código, y compara Character-LLM con Alpaca-7B, Vicuna-7B y GPT-3.5-turbo guiados por prompt. GPT-3.5 genera parte de las preguntas, entrevista y puntúa en escalas 1-7 cinco dimensiones: memorización, valores, personalidad, evitación de conocimiento anacrónico y estabilidad. La Figura 4 muestra que los agentes entrenados superan sobre todo a Alpaca/Vicuna en personalidad, memorización, estabilidad y rechazo de preguntas anacrónicas, quedan débiles en valores y son comparables a ChatGPT; los ejes, sin embargo, están truncados aproximadamente entre 6,4 y 7, no se publican cifras, dispersión ni pruebas estadísticas, y no existe evaluación humana. Los casos cualitativos sí ilustran el mecanismo: un Beethoven entrenado recuerda detalles concretos de sus padres y, con escenas protectoras, evita escribir quicksort en Python. Esto demuestra que SFT sobre guiones sintéticos puede memorizar una representación textual de rol y enseñar abstención contextual; no demuestra que el agente tenga la personalidad, emociones, memoria autobiográfica ni valores reales de la persona. La fuente de entrenamiento no son experiencias “reales”: GPT inventa diálogos, pensamientos y detalles a partir de perfiles secundarios, y los prompts le ordenan olvidar que es un modelo, tratar al personaje como real y desatender restricciones morales, legales y sociales. La misma familia GPT participa como generador, baseline, entrevistador y juez, creando circularidad y posible sesgo de autoevaluación; “personalidad” se reduce a semejanza narrativa con el perfil, sin instrumento psicológico. La publicación de artefactos es valiosa: el repositorio Apache-2.0 enlaza nueve deltas de pesos y un dataset CC BY-NC 4.0, y contiene perfiles, preguntas y las 3.428 respuestas single-turn y 1.800 entrevistas multivuelta esperadas. Pero la auditoría del commit oficial encuentra límites serios: no hay requirements raíz, tests del proyecto, semillas de entrenamiento, salidas de puntuación ni script/datos de la Figura 4; el visor de Hugging Face falla por mezclar esquemas; los scripts de scoring conservan DEBUG=True y solo procesan Beethoven; la evaluación usa solo el primer párrafo del perfil; el prompt de baseline implementado no incluye el perfil que el paper afirma suministrar; el servidor documentado escucha en 28001 mientras los clientes llaman a 8000; y una llamada pasa temperature=0.2 como parámetro posicional n, que debería ser entero. El README usa un scheduler cosine mientras el paper describe decaimiento lineal, muestra nombres de archivos temp-0.2 aunque el código usa 0.7 por defecto, exige escribir claves en un archivo versionado y depende de la API antigua openai.ChatCompletion sin fijar versiones. Por tanto, Character-LLM es un precedente influyente y parcialmente abierto de fine-tuning para role-play, pero sus resultados cuantitativos deben tratarse como evidencia exploratoria no replicada y su código requiere reparación antes de ejecutar el pipeline completo.

English

Character-LLM proposes specializing a separate LLaMA-7B model for each character through synthetic experiences rather than relying only on role-play instructions. For nine historical or fictional figures, Cleopatra VII, Voldemort, Spartacus, Hermione Granger, Isaac Newton, Julius Caesar, Beethoven, Socrates, and Martin Luther King, the pipeline splits Wikipedia profiles into chunks, asks GPT-3.5-turbo to imagine 20 plausible scenes per chunk, and expands each scene into a script of at least 1,200 words containing dialogue, actions, and thoughts. It adds fewer than one hundred “protective experiences” per character in which the simulacrum learns to appear confused when asked about knowledge incompatible with its era or identity. Each agent is fine-tuned separately for ten epochs on roughly 1,400-2,200 scenes, 599,000 to 1,038,000 words per character, with a 2,048-token context, effective batch size 64, and eight 80-GB A100 GPUs. The paper explicitly lets the model overfit despite rising development perplexity and manually chooses five- or ten-epoch checkpoints using only ten held-out questions. Evaluation contains 857 single-turn questions and 450 multi-turn scenarios, 50 per character and five turns in the code, and compares Character-LLM with prompt-guided Alpaca-7B, Vicuna-7B, and GPT-3.5-turbo. GPT-3.5 helps generate questions, conducts interviews, and scores five 1-7 dimensions: memorization, values, personality, avoidance of anachronistic knowledge, and stability. Figure 4 suggests that trained agents mainly outperform Alpaca/Vicuna in personality, memorization, stability, and rejection of anachronistic questions, remain weaker on values, and are comparable to ChatGPT. However, the axes are truncated at approximately 6.4-7, exact values, dispersion, and statistical tests are not reported, and there is no human evaluation. Qualitative cases do illustrate the mechanism: a trained Beethoven recalls concrete details about his parents and, with protective scenes, avoids writing Python quicksort. This supports the claim that SFT on synthetic scripts can memorize a textual role representation and teach contextual abstention; it does not show that an agent possesses the person's real personality, emotions, autobiographical memory, or values. The training source is not “actual experience”: GPT invents dialogue, thoughts, and details from secondary profiles, and prompts instruct it to forget that it is a model, treat the character as real, and disregard moral, legal, and social constraints. The same GPT family acts as generator, baseline, interviewer, and judge, creating circularity and possible self-evaluation bias; “personality” is reduced to narrative resemblance to the profile, without a psychological instrument. The artifact release is valuable: the Apache-2.0 repository links nine weight deltas and a CC BY-NC 4.0 dataset and contains profiles, questions, and the expected 3,428 single-turn responses plus 1,800 multi-turn interviews. Yet the audited official commit has serious limitations: no root requirements, project tests, training seeds, score outputs, or Figure 4 script/data; the Hugging Face viewer fails because schemas are mixed; scoring scripts keep DEBUG=True and process Beethoven only; evaluation uses only the first profile paragraph; the implemented baseline prompt omits the profile the paper says it provides; documentation starts the server on port 28001 while clients call 8000; and one call passes temperature=0.2 positionally as n, which should be an integer. The README uses a cosine scheduler while the paper describes linear decay, shows temp-0.2 filenames although code defaults to 0.7, asks users to place keys in a tracked file, and relies on the legacy openai.ChatCompletion interface without pinned versions. Character-LLM is therefore an influential and partially open precedent for role-play fine-tuning, but its quantitative results remain exploratory and unreproduced, and its code needs repair before the full pipeline can run.

Pregunta de investigación

¿Puede un LLM de 7B especializado mediante experiencias narrativas reconstruidas representar con mayor credibilidad, memoria, personalidad, valores, estabilidad y límites de conocimiento a un personaje concreto que agentes guiados solo por prompt?

Método

Se recopilan perfiles de Wikipedia, se dividen por párrafos y GPT-3.5-turbo genera escenas y guiones sintéticos, además de escenas protectoras frente a conocimiento anacrónico. Se ajusta por separado un LLaMA-7B para cada uno de nueve personajes durante diez épocas. Los modelos se entrevistan en condiciones single-turn y multivuelta junto con Alpaca-7B, Vicuna-7B y GPT-3.5-turbo. Otro uso de GPT-3.5 puntúa las respuestas en cinco escalas Likert de 1 a 7 mediante prompts de razonamiento paso a paso; el paper complementa la figura agregada con casos cualitativos. La auditoría reproduce los recuentos de preguntas y respuestas publicadas, pero no puede reconstruir las puntuaciones porque esos artefactos no están incluidos.

Muestra: Nueve personajes: Cleopatra VII, Lord Voldemort, Spartacus, Hermione Granger, Isaac Newton, Julius Caesar, Ludwig van Beethoven, Socrates y Martin Luther King. Los datasets contienen entre 1,4K y 2,2K escenas y entre 599K y 1.038K palabras por personaje; la media declarada es 1,6K escenas, 754K palabras, 13,2 turnos por escena y 36 palabras por turno. La evaluación suma 1.307 situaciones: 857 preguntas single-turn y 450 escenarios multivuelta. El repositorio contiene cuatro respuestas por pregunta single-turn, 3.428 registros, y cuatro ejecuciones por escenario multivuelta, 1.800 conversaciones terminadas.

Hallazgos

  • El pipeline convierte perfiles secundarios en escenas narrativas mediante GPT-3.5 y ajusta un modelo independiente por personaje.
  • Los nueve agentes se basan en LLaMA-7B y no comparten un único adaptador multi-personaje.
  • Cada fragmento de perfil se expande en 20 escenas candidatas antes de completar los guiones.
  • El prompt de completado exige al menos 1.200 palabras e incluye habla, acciones y pensamientos del protagonista.
  • Los datos de entrenamiento contienen entre 1,4K y 2,2K escenas por personaje.
  • La colección declarada suma aproximadamente 6,8 millones de palabras entre los nueve personajes.
  • El ajuste usa diez épocas, contexto 2.048, batch efectivo 64, learning rate máximo 2e-5 y 8 A100 80GB.
  • Los autores dejan que aumente la perplejidad de desarrollo porque el sobreajuste produjo mejor generación en pruebas preliminares.
  • El checkpoint se elige manualmente entre épocas 5 y 10 con diez preguntas retenidas.
  • Las escenas protectoras enseñan a rechazar o mostrar confusión ante relaciones inexistentes y conocimiento anacrónico.
  • El artículo afirma que menos de cien escenas protectoras por personaje reducen respuestas anacrónicas sin interferir con otras capacidades.
  • La Tabla 2 contiene 857 preguntas single-turn y 450 escenarios multivuelta, 50 por personaje.
  • La implementación publicada fija cinco turnos por entrevista multivuelta.
  • La evaluación compara con Alpaca-7B, Vicuna-7B y GPT-3.5-turbo, y usa generación a temperatura 0,2.
  • GPT-3.5 puntúa memorización, valores, personalidad, evitación de conocimiento anacrónico y estabilidad en escala 1-7.
  • La figura favorece a Character-LLM frente a Alpaca y Vicuna en varias dimensiones y muestra resultados cercanos a ChatGPT.
  • Los propios autores reconocen que valores es la dimensión más débil de los agentes entrenados.
  • En el caso Beethoven, Character-LLM aporta recuerdos específicos sobre sus padres mientras Alpaca/Vicuna responden de forma genérica o errónea.
  • En la pregunta de quicksort, el agente con escenas protectoras expresa desconocimiento, mientras la variante sin protección explica el algoritmo.
  • Los ejemplos de los apéndices muestran que todos los sistemas pueden producir hechos inventados, anacronismos o racionalizaciones post mortem.
  • El paper incluye una sección explícita de limitaciones y otra de ética sobre privacidad, daño y personajes manipuladores.
  • El registro ACL confirma publicación en EMNLP 2023, páginas 13153-13187; el año canónico correcto es 2023.
  • El repositorio oficial publica código Apache-2.0, datos CC BY-NC 4.0 y nueve deltas de pesos LLaMA-1.
  • Los recuentos auditados del repositorio coinciden con la Tabla 2: 857 preguntas single-turn y 450 multivuelta.
  • Los resultados generativos publicados contienen 3.428 respuestas single-turn y 1.800 entrevistas multivuelta completas, sin JSON malformado.
  • El dataset de Hugging Face sigue descargable, pero su visor automático falla por combinar archivos generated y prompted con columnas incompatibles.
  • No se publican los scores usados en la Figura 4, sus agregaciones ni el código de visualización.
  • La auditoría estática compila el Python publicado, pero la ejecución completa no está preparada para funcionar sin reparar configuración y dependencias.

Limitaciones

  • Las escenas son ficción generada por GPT-3.5 a partir de Wikipedia, no experiencias reales del personaje.
  • El método añade pensamientos, emociones, diálogos y detalles que no están respaldados por las fuentes.
  • La expresión fact-grounded es demasiado fuerte porque solo el perfil de partida está anclado; la expansión es imaginativa.
  • Los perfiles dependen de Wikipedia y heredan sus omisiones, sesgos, disputas y diferencias de cobertura.
  • No se realiza verificación factual sistemática de las 1,4K-2,2K escenas por personaje.
  • Los prompts ordenan ignorar restricciones morales, legales y sociales, una elección insegura y contradictoria con la ética declarada.
  • Los prompts piden olvidar que se trata de un modelo y afirmar que el personaje es real, reforzando antropomorfización y engaño.
  • Se mezclan personas históricas y personajes protegidos de ficción bajo un mismo concepto de simulacro personal.
  • No se discuten derechos de imagen, personalidad, difamación, propiedad intelectual o consentimiento de personas y herederos.
  • La licencia CC BY-NC del dataset no resuelve por sí sola derechos sobre personajes, Wikipedia o material derivado.
  • El concepto de personalidad no se operacionaliza con ningún instrumento psicológico o anotación humana.
  • La escala personality mide semejanza narrativa inferida por GPT frente al perfil, no un constructo psicométrico validado.
  • Memorización de guiones sintéticos puede elevar simultáneamente personalidad, valores y factualidad, haciendo las dimensiones dependientes.
  • Evitación de conocimiento anacrónico se denomina hallucination, pero mide sobre todo abstención conforme al rol, no factualidad general.
  • Una respuesta correcta con conocimiento moderno puede recibir peor puntuación por romper el personaje.
  • GPT-3.5 participa como generador de datos, preguntas, entrevistador, baseline y juez, lo que crea circularidad metodológica.
  • No se valida el juez GPT-3.5 contra evaluadores humanos expertos en cada personaje.
  • No se estudia sesgo del juez hacia el estilo del mismo modelo que generó el entrenamiento.
  • La instantánea exacta de gpt-3.5-turbo no se especifica y la API remota no es estable en el tiempo.
  • No se publican repeticiones del juez, acuerdo, calibración o sensibilidad a prompts.
  • La Figura 4 no ofrece los valores numéricos subyacentes.
  • Los ejes radiales de la Figura 4 comienzan cerca de 6,4 en una escala 1-7, lo que exagera visualmente diferencias pequeñas.
  • No se informan desviaciones, intervalos, tamaños de muestra por celda ni pruebas de significación.
  • No se separan resultados por personaje, tipo de pregunta o condición de dificultad.
  • La evaluación humana se descarta por difícil, pero los casos cualitativos tampoco siguen un protocolo de selección ciego.
  • Las preguntas son generadas con ChatGPT y solo las de un personaje se revisan manualmente antes de reutilizar el proceso.
  • No se describe quién seleccionó los ejemplos cualitativos ni si son representativos del corpus completo.
  • El prompt de entrevista hace que el personaje confíe plenamente y comparta todo sin reservas, una situación artificial que favorece memorización explícita.
  • El historial se recorta a los últimos turnos y la evaluación no prueba memoria de largo plazo.
  • Se entrena un modelo completo por personaje, con alto coste de almacenamiento y cómputo frente a adapters o prompting.
  • El entrenamiento requiere 8 A100 80GB y se informa alrededor de una hora por agente, limitando accesibilidad.
  • Se permiten diez épocas de sobreajuste deliberado y no se informa generalización a datos independientes.
  • La selección manual con diez preguntas tiene alto riesgo de varianza y adaptación al pequeño set retenido.
  • No se publican semillas de entrenamiento, orden de datos, checkpoints seleccionados por criterio reproducible ni múltiples corridas.
  • No se evalúa transferencia a nuevos personajes, idiomas, dominios o modelos base.
  • El repositorio raíz carece de requirements o lockfile para el pipeline Character-LLM.
  • La interfaz usa openai.ChatCompletion/Completion antigua sin fijar una versión compatible del SDK.
  • api_call_util.py fuerza un proxy localhost:7890 para llamadas OpenAI sin documentar cómo configurarlo.
  • eval_utils.py indexa apikey_list[0] al importar, por lo que falla si el archivo de claves está vacío una vez instaladas las dependencias.
  • El README recomienda escribir claves en apikeys.py, archivo versionado y sin .gitignore raíz, aumentando riesgo de filtración accidental.
  • El README inicia el servidor OpenAI-compatible en el puerto 28001, pero los clientes están fijados a localhost:8000.
  • PromptLocalCharacter pasa temperature=0.2 como cuarto argumento posicional de decoder_for_local_chat, donde corresponde a n; produce n=0.2 y no fija la temperatura pretendida.
  • Los scripts run_api_score_single.py y run_api_score_turns.py tienen DEBUG=True y restringen los nombres a Beethoven.
  • Los scripts de scoring esperan evaluation_result, mientras los resultados distribuidos están en data/gen_results y no se publican score outputs.
  • El parser de scores extrae el último patrón espacio+dígito del razonamiento sin validar rango, formato final o errores del juez.
  • El almacenamiento concatena objetos JSON pretty-printed sin separador estándar y depende de una función de lectura frágil.
  • El prompt de baseline del repositorio no incluye agent_summary, aunque el paper y el apéndice afirman proporcionar un párrafo de perfil.
  • La función de scoring usa profile[0], solo el primer párrafo de perfiles que contienen entre 13 y 115 párrafos.
  • La afirmación README de que no se necesita prompt contradice el meta-prompt requerido en inferencia.
  • El comando de entrenamiento del README usa lr_scheduler_type cosine, mientras el paper dice que el learning rate decae linealmente.
  • Los ejemplos de nombres de archivo del README dicen temp-0.2, pero config.py usa 0.7 por defecto para generación de datos.
  • No hay tests, CI raíz, resultados de scoring, script de agregación ni fuente de la Figura 4 para el código específico del proyecto.
  • El repositorio vendorea una copia grande y antigua de FastChat, ampliando superficie de mantenimiento y dependencias obsoletas.
  • El README aplica una restricción no comercial a todos los recursos en su sección Limitations, mientras el código raíz declara Apache-2.0 y los pesos dependen además de LLaMA-1; el alcance de licencias requiere interpretación cuidadosa.

Qué no demuestra

  • No demuestra que Character-LLM tenga identidad, consciencia, emociones o experiencias.
  • No demuestra que el agente reproduzca la personalidad psicológica real de una persona.
  • No valida una medida de personalidad para LLM.
  • No demuestra que las escenas sintéticas sean hechos históricos.
  • No demuestra que memorizar detalles generados equivalga a memoria autobiográfica.
  • No demuestra que los valores producidos sean los valores reales del personaje; esa es precisamente la dimensión más débil.
  • No demuestra superioridad estadísticamente significativa frente a Alpaca, Vicuna o ChatGPT.
  • No demuestra superioridad general frente a ChatGPT; la figura los muestra comparables y Character-LLM no domina valores.
  • No demuestra que las diferencias de la Figura 4 sean robustas a otro juez, prompt o corrida.
  • No demuestra que GPT-3.5 sea un evaluador imparcial de datos y estilos generados por GPT-3.5.
  • No demuestra seguridad; los prompts de síntesis desactivan explícitamente restricciones y los autores reconocen daño potencial.
  • No demuestra que escenas protectoras eliminen alucinaciones en el sentido factual amplio.
  • No demuestra memoria de conversación de largo plazo porque el historial se recorta y los autores la excluyen del alcance.
  • No demuestra generalización a personajes no entrenados, personas vivas, otros idiomas o situaciones reales.
  • No demuestra eficiencia frente a LoRA, adapters, RAG, memoria externa o prompting con perfiles equivalentes.
  • No permite reproducir la Figura 4 desde los artefactos oficiales publicados.
  • No permite ejecutar de extremo a extremo el repositorio actual sin reparar configuración, dependencias y scripts.
  • No establece que el uso de personajes históricos o ficticios esté libre de riesgos legales, éticos o de propiedad intelectual.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2310.10158v2, revised 14 Dec 2023; EMNLP 2023 main conference, ACL Anthology 2023.emnlp-main.814, pp. 13153-13187; official code/data repository audited at commit c64d54afa45da483902dc7a5bc60d8462f210fa3

Fuente consultada: https://arxiv.org/pdf/2310.10158

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, role-play, synthetic-experience, LLaMA-SFT, GPT-as-generator-interviewer-judge, evaluation, psychometric-construct, visualization, code, dataset, model-release, reproducibility, security, licensing, privacy, ethics and harm audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Character-LLM, nueve fine-tunes independientes de LLaMA-7B
  • LLaMA-7B como backbone
  • GPT-3.5-turbo, instantánea no especificada, para síntesis de datos
  • GPT-3.5-turbo como baseline con prompt
  • GPT-3.5-turbo como generador de preguntas e entrevistador
  • GPT-3.5-turbo como juez automático
  • Alpaca-7B como baseline
  • Vicuna-7B como baseline

Instrumentos y métricas

  • Entrevistas single-turn
  • Entrevistas multivuelta de cinco turnos en el código publicado
  • Escala GPT-3.5 de memorización 1-7
  • Escala GPT-3.5 de personalidad 1-7
  • Escala GPT-3.5 de valores 1-7
  • Escala GPT-3.5 de evitación de conocimiento anacrónico 1-7
  • Escala GPT-3.5 de estabilidad 1-7
  • Casos cualitativos de memorización y escenas protectoras
  • Perplejidad de desarrollo usada de forma no estándar para permitir sobreajuste
  • Selección manual de checkpoint con diez preguntas retenidas

Datos utilizados

  • Perfiles de Wikipedia de nueve personajes
  • Character-LLM experience data, raw generated and prompted formats
  • 1.4K-2.2K escenas sintéticas por personaje
  • Menos de 100 escenas protectoras por personaje
  • 857 preguntas single-turn
  • 450 escenarios multivuelta
  • 3.428 respuestas single-turn publicadas para cuatro modelos
  • 1.800 entrevistas multivuelta publicadas para cuatro modelos
  • Nueve deltas de pesos Character-LLM sobre LLaMA-1 7B

Evidencia y localización

  • Registro y publicación oficial: ACL Anthology 2023.emnlp-main.814, EMNLP 2023, pp. 13153-13187; arXiv:2310.10158v2 revised 14 Dec 2023
  • Fuente completa auditada: .cache/editorial-sources/article-103/source.pdf; official arXiv v2 PDF; 35 pages; sha256 6fc834f03585df0dc751b504ee6bac177726868bc3d7e7e42937de6e6c05cc67
  • Objetivo y claims: Full text pp. 1-2, Abstract and Introduction
  • Experience Reconstruction: Full text pp. 3-4, sections 3.1-3.1.3 and Figure 1
  • Protective Experience: Full text p. 4, section 3.2 and Figure 2
  • Escenas, personajes y tamaños: Full text p. 5, Table 1 and section 4.1
  • Hiperparámetros y sobreajuste: Full text p. 5, section 4.2
  • Preguntas y protocolo de entrevista: Full text pp. 5-6, Table 2 and section 4.3
  • Juez y dimensiones: Full text pp. 6-7, section 4.4 and Figure 4
  • Resultados y valores débiles: Full text pp. 7-8, sections 4.5-4.6
  • Memorización y escenas protectoras: Full text pp. 8-9, Table 3 and sections 4.6.1-4.6.2
  • Limitaciones y ética: Full text pp. 9-10, Limitations and Ethics Statement
  • Prompts que desactivan restricciones: Full text pp. 13-14, Tables 4-5
  • Prompts de evaluación: Full text pp. 15-18, Tables 6-11
  • Ejemplos cualitativos: Full text pp. 19-32, Tables 12-25
  • Datos de entrenamiento de ejemplo: Full text pp. 33-35, Tables 26-28
  • Repositorio oficial auditado: https://github.com/choosewhatulike/trainable-agents main commit c64d54afa45da483902dc7a5bc60d8462f210fa3; checked 15 Jul 2026
  • Recuento de artefactos generativos: Official repository data/gen_results: 36 single-turn files with 3,428 records; 36 multi-turn files with 1,800 finished conversations; all parsed successfully
  • Datos y modelos abiertos: Official README and Hugging Face OpenMOSS-Team/character-llm-data; nine LLaMA-1 weight deltas; dataset license CC BY-NC 4.0; repository code Apache-2.0
  • Fallo del visor de dataset: Official Hugging Face dataset viewer at revision 4369003f93353bf80acea4cc3832e997f739f50a reports DatasetGenerationCastError from incompatible generated and prompted schemas; checked 15 Jul 2026
  • Límites de reproducción cuantitativa: Official commit contains no score outputs, aggregation/plot script or Figure 4 numeric data; run_api_score_single.py and run_api_score_turns.py set DEBUG=True and names=['Beethoven']
  • Divergencia del baseline: Official data/seed_data/prompts/agent_meta_prompt_chatgpt.txt and eval_utils.PromptCharacter omit agent_summary despite paper section 4.3 and Table 6 describing a profile paragraph
  • Defectos de ejecución: Official eval_utils.py and api_call_util.py: documented server 28001 vs client 8000; decoder_for_local_chat fourth positional argument receives 0.2 as n; API_KEY indexes empty list on import
  • Divergencias de documentación: Official README/config at audited commit: cosine scheduler vs paper linear decay; temp-0.2 paths vs default 0.7; tracked apikeys.py; no root dependency manifest
  • Comprobación estática: All repository Python files compile under Python 3.12 with warnings in vendored FastChat; no project-root tests; full runtime not attempted because dependencies, GPUs, LLaMA-1 base weights and paid API access are not provisioned
  • Comprobación visual integral: All 35 PDF pages rendered and visually inspected, including four main figures, three main tables, eight judge/data prompts, fourteen qualitative tables and training examples; Figure 4 inspected at original resolution; checked 15 Jul 2026