Test-Time-Matching (TTM) construye un agente de rol a partir del texto de una novela sin actualizar los pesos del modelo. En una fase offline divide el libro en chunks de 512 tokens con solapamiento 64, identifica diálogos y personajes, extrae una descripción de personalidad, un background estructurado y preferencias lingüísticas, y crea una base de memoria por libro junto con un índice de enunciados históricos por personaje. En conversación usa Qwen3-32B en tres etapas: primero genera una respuesta sin estilo desde personalidad y background; luego reescribe la consulta, recupera pasajes del libro y corrige o amplía la respuesta; por último recupera enunciados similares y reescribe progresivamente cada segmento para imitar el estilo. Es training-free solo porque no ajusta parámetros: procesar un libro de unos 2 MB requiere según el paper entre dos y tres horas en cuatro RTX 3090, más hasta tres horas para extraer background, y cada turno usa cuatro o cinco llamadas LLM más retrieval. La evaluación principal escoge seis personajes literarios, tres chinos y tres ingleses. Genera una única conversación de 4-6 turnos por combinación disponible de personaje y método: 37 diálogos en total. Doce participantes generales y cinco especialistas en lingüística puntúan consistencia del personaje, precisión del conocimiento y calidad conversacional de 0 a 10. Frente al Qwen3-32B directo, TTM sube de 6,50/6,57/6,43 a 7,26/7,49/7,07 entre participantes generales y de 5,43/7,37/6,00 a 6,43/7,60/6,30 entre especialistas. En este último grupo Gemini-2.5-pro obtiene 6,40 en calidad conversacional y supera el 6,30 de TTM. GPT-4.1 también puntúa TTM por encima del mismo modelo base: 9,21/9,56/9,27 frente a 8,03/8,47/8,21. Sin embargo, esos no son 62 outputs independientes: el script vuelve a puntuar las mismas seis conversaciones contra cada rival y en ambos órdenes, y promedia sus 62 apariciones. TTM además es mucho más verboso. En las tres conversaciones inglesas, sus ficheros promedian unas 1.346 palabras, frente a 946 de Gemini, 896 de Qwen3-235B, 863 de Qwen3-32B, 432 de GPT-4o y 424 de CoSER. El propio paper reconoce que GPT-4.1 favorece respuestas largas y que los humanos sufrieron fatiga; no hay control de longitud. Un segundo estudio pide a 21 personas identificar una frase generada insertada entre tres frases reales. En 504 selecciones repetidas eligen TTM 78 veces, 15,48%, y Qwen2.5 125, 24,80%; una selección menor es compatible con mayor parecido estilístico, pero no hay datos crudos, modelo de medidas repetidas, prueba estadística ni análisis de posición. El paper tampoco publica intervalos, significación, acuerdo entre jueces, datos demográficos o protocolo ético. Por ello la conclusión fiel es estrecha: en una sola muestra por personaje, la pila completa de perfil, memoria y reescritura mejora las medias de Qwen3-32B. No demuestra que personalidad, memoria y estilo estén realmente desacoplados: no hay métricas de fuga, intervenciones, swaps ni evaluación de combinaciones. El repositorio MIT contiene una implementación sustantiva, prompts, outputs y registros del juez, pero no tests o CI; 41 de 46 dependencias quedan sin versión. El dataset público de 6,42 GB carece de una ficha válida de procedencia y distribuye chunks y diálogos derivados de obras, incluidas Harry Potter y novelas modernas chinas, sin documentar ediciones, base jurídica o licencias del texto subyacente.
Pregunta de investigación
¿Puede una tubería sin ajuste de pesos extraer de novelas personalidad, memoria y estilo, aplicarlos por etapas en inferencia y mejorar la fidelidad de un agente de rol frente a prompting directo y otros sistemas?