Test-Time-Matching: Decouple Personality, Memory, and Linguistic Style in LLM-based Role-Playing Language Agent

Personas, identidad y agentes2025arXivRevisión editorial aprobada

Autores: Xiaoyu Zhan, Xinyu Fu, Hao Sun, Yuanqi Li, Jie Guo, Yanwen Guo

Palabras clave: Test-time scaling, Role-playing agents, Retrieval-augmented generation, Personality-memory-style decoupling, Text style transfer

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
7
Hallazgos
21
Limitaciones
5
Evidencias

Resumen editorial

Español

Test-Time-Matching (TTM) construye un agente de rol a partir del texto de una novela sin actualizar los pesos del modelo. En una fase offline divide el libro en chunks de 512 tokens con solapamiento 64, identifica diálogos y personajes, extrae una descripción de personalidad, un background estructurado y preferencias lingüísticas, y crea una base de memoria por libro junto con un índice de enunciados históricos por personaje. En conversación usa Qwen3-32B en tres etapas: primero genera una respuesta sin estilo desde personalidad y background; luego reescribe la consulta, recupera pasajes del libro y corrige o amplía la respuesta; por último recupera enunciados similares y reescribe progresivamente cada segmento para imitar el estilo. Es training-free solo porque no ajusta parámetros: procesar un libro de unos 2 MB requiere según el paper entre dos y tres horas en cuatro RTX 3090, más hasta tres horas para extraer background, y cada turno usa cuatro o cinco llamadas LLM más retrieval. La evaluación principal escoge seis personajes literarios, tres chinos y tres ingleses. Genera una única conversación de 4-6 turnos por combinación disponible de personaje y método: 37 diálogos en total. Doce participantes generales y cinco especialistas en lingüística puntúan consistencia del personaje, precisión del conocimiento y calidad conversacional de 0 a 10. Frente al Qwen3-32B directo, TTM sube de 6,50/6,57/6,43 a 7,26/7,49/7,07 entre participantes generales y de 5,43/7,37/6,00 a 6,43/7,60/6,30 entre especialistas. En este último grupo Gemini-2.5-pro obtiene 6,40 en calidad conversacional y supera el 6,30 de TTM. GPT-4.1 también puntúa TTM por encima del mismo modelo base: 9,21/9,56/9,27 frente a 8,03/8,47/8,21. Sin embargo, esos no son 62 outputs independientes: el script vuelve a puntuar las mismas seis conversaciones contra cada rival y en ambos órdenes, y promedia sus 62 apariciones. TTM además es mucho más verboso. En las tres conversaciones inglesas, sus ficheros promedian unas 1.346 palabras, frente a 946 de Gemini, 896 de Qwen3-235B, 863 de Qwen3-32B, 432 de GPT-4o y 424 de CoSER. El propio paper reconoce que GPT-4.1 favorece respuestas largas y que los humanos sufrieron fatiga; no hay control de longitud. Un segundo estudio pide a 21 personas identificar una frase generada insertada entre tres frases reales. En 504 selecciones repetidas eligen TTM 78 veces, 15,48%, y Qwen2.5 125, 24,80%; una selección menor es compatible con mayor parecido estilístico, pero no hay datos crudos, modelo de medidas repetidas, prueba estadística ni análisis de posición. El paper tampoco publica intervalos, significación, acuerdo entre jueces, datos demográficos o protocolo ético. Por ello la conclusión fiel es estrecha: en una sola muestra por personaje, la pila completa de perfil, memoria y reescritura mejora las medias de Qwen3-32B. No demuestra que personalidad, memoria y estilo estén realmente desacoplados: no hay métricas de fuga, intervenciones, swaps ni evaluación de combinaciones. El repositorio MIT contiene una implementación sustantiva, prompts, outputs y registros del juez, pero no tests o CI; 41 de 46 dependencias quedan sin versión. El dataset público de 6,42 GB carece de una ficha válida de procedencia y distribuye chunks y diálogos derivados de obras, incluidas Harry Potter y novelas modernas chinas, sin documentar ediciones, base jurídica o licencias del texto subyacente.

English

Test-Time-Matching (TTM) constructs a role-playing agent from a novel without updating model weights. Offline, it splits the book into 512-token chunks with 64-token overlap, identifies dialogue and characters, extracts a personality description, structured background and linguistic preferences, and builds one memory database per book plus a historical-utterance index per character. During conversation it uses Qwen3-32B in three stages: generate a styleless reply from personality and background; rewrite the query, retrieve book passages and correct or enrich that reply; then retrieve similar utterances and progressively rewrite each segment in the target style. It is training-free only in the no-parameter-update sense: the paper reports two to three hours on four RTX 3090 GPUs for a roughly 2 MB book, plus up to three hours for background extraction, while each dialogue turn uses four or five LLM calls plus retrieval. The main evaluation selects six literary characters, three Chinese and three English. It generates only one 4-6 turn conversation per available character-method pair, 37 dialogues in total. Twelve general participants and five linguistics experts rate persona consistency, knowledge accuracy and conversation quality from 0 to 10. Relative to direct Qwen3-32B, TTM rises from 6.50/6.57/6.43 to 7.26/7.49/7.07 for general participants and from 5.43/7.37/6.00 to 6.43/7.60/6.30 for experts. In the latter group Gemini-2.5-pro scores 6.40 for conversation quality, above TTM's 6.30. GPT-4.1 also rates TTM above the same base model: 9.21/9.56/9.27 versus 8.03/8.47/8.21. Those are not 62 independent outputs, however: the script repeatedly scores the same six TTM conversations against each opponent in both orders and averages their 62 appearances. TTM is also far more verbose. Across the three English conversations its files average roughly 1,346 words, versus 946 for Gemini, 896 for Qwen3-235B, 863 for Qwen3-32B, 432 for GPT-4o and 424 for CoSER. The paper acknowledges that GPT-4.1 favors longer responses and that humans experienced reading fatigue; there is no length-matched test. A second study asks 21 people to identify a generated sentence inserted among three genuine sentences. Across 504 repeated selections they choose TTM 78 times, 15.48%, and Qwen2.5 125 times, 24.80%. Lower selection is compatible with closer style matching, but raw data, a repeated-measures model, significance test and position analysis are absent. The paper also provides no intervals, significance tests, inter-rater agreement, participant demographics or ethics protocol. The faithful conclusion is therefore narrow: on one sample per character, the complete profile-memory-rewriting stack improves Qwen3-32B's mean ratings. It does not demonstrate actual disentanglement of personality, memory and style: there are no leakage metrics, interventions, swaps or evaluations of recombinations. The MIT repository provides substantial implementation code, prompts, outputs and judge records, but no tests or CI, and 41 of 46 dependencies are unpinned. The public 6.42 GB cache has no valid provenance card and distributes chunks and dialogue derived from works including Harry Potter and modern Chinese novels without documenting source editions, legal basis or licenses for the underlying text.

Pregunta de investigación

¿Puede una tubería sin ajuste de pesos extraer de novelas personalidad, memoria y estilo, aplicarlos por etapas en inferencia y mejorar la fidelidad de un agente de rol frente a prompting directo y otros sistemas?

Método

TTM extrae perfiles y memoria con Qwen2.5-32B-Instruct, construye RAG y usa Qwen3-32B para respuesta sin estilo, corrección por memoria y reescritura estilística progresiva. Compara 37 conversaciones únicas de seis personajes con dos grupos humanos y GPT-4.1; añade una tarea de detección estilística con 21 respuestas y 504 decisiones repetidas.

Muestra: Doce participantes generales y cinco especialistas en lingüística calificaron 37 diálogos; 21 respuestas participaron en una tarea de 24 ítems, 504 selecciones. El paper no informa reclutamiento, demografía, idioma nativo, cualificación exacta, exclusiones, solapamiento, compensación, consentimiento o revisión ética.

Hallazgos

  • TTM mejora al Qwen3-32B directo en las nueve medias publicadas: tres dimensiones por GPT-4.1, participantes generales y especialistas.
  • Entre participantes generales, TTM logra 7,26 en personaje, 7,49 en conocimiento y 7,07 en conversación, frente a 6,50/6,57/6,43 del mismo modelo base.
  • Entre especialistas, TTM logra 6,43/7,60/6,30 frente a 5,43/7,37/6,00; Gemini obtiene la mejor calidad conversacional, 6,40.
  • GPT-4.1 da a TTM 9,21/9,56/9,27 frente a 8,03/8,47/8,21, reutilizando cada diálogo en múltiples comparaciones.
  • La detección de frases selecciona TTM en 78/504 casos, 15,48%, y Qwen2.5 en 125/504, 24,80%.
  • TTM promedia unas 1.346 palabras en los tres outputs ingleses, aproximadamente 1,5 veces el siguiente método y más de tres veces GPT-4o o CoSER.
  • El repositorio actual incluye una ablación automatizada adicional donde las etapas posteriores mejoran las medias de GPT-4.1, pero no una ablación humana.

Limitaciones

  • Solo se genera un diálogo por personaje y método; no hay repetición por seed ni estimación de varianza de generación.
  • No se publican intervalos, errores estándar, pruebas de hipótesis, corrección múltiple ni modelo de medidas repetidas pese al lenguaje de significación.
  • No se reporta acuerdo entre jueces ni fiabilidad de las tres escalas.
  • Las valoraciones están cruzadas por participante, personaje y método, pero se reducen a medias simples.
  • El juez GPT reutiliza los mismos diálogos contra varios rivales y en ambos órdenes: 62 puntuaciones no equivalen a 62 muestras independientes.
  • El código del juez trunca Harry_Potter a Harry y Pride_and_Prejudice a Pride al construir el prompt desde el nombre del directorio.
  • TTM es mucho más largo; el propio paper reconoce sesgo de longitud del juez y fatiga humana, sin evaluación igualada por longitud.
  • Los modelos universales no reciben el mismo perfil, libro completo, RAG e historial de enunciados, por lo que el contraste más interpretable es TTM frente a Qwen3-32B.
  • La separación de personalidad, memoria y estilo es una arquitectura, no un desacoplamiento medido con leakage, intervención, swaps u ortogonalidad.
  • No se evalúan las combinaciones libres de personalidad, memoria y estilo que promete el abstract.
  • La tarea estilística trata 504 decisiones repetidas de solo 21 personas como proporciones crudas; faltan incertidumbre, análisis por participante y datos de posición.
  • Un 15,48% por debajo del azar de 25% puede reflejar similitud, pero también sesgos de ítem o posición que no se descartan.
  • Seis roles literarios no representan personajes arbitrarios, figuras públicas, identidades demográficas o otros dominios.
  • La base de memoria común por libro puede mezclar conocimiento de narrador u otros personajes y no modela cronología, filtrando hechos futuros.
  • La extracción LLM de personalidad/background no se valida contra perfiles gold ni conserva incertidumbre.
  • Training-free no significa barato: la construcción usa horas de cuatro GPUs y el turno usa varias llamadas; faltan latencia, energía, coste y throughput.
  • No se documentan participantes, consentimiento, compensación, IRB o protocolo ético.
  • No se evalúan seguridad, impersonación, dependencia emocional, manipulación, copyright o privacidad.
  • El código no tiene tests, CI, lockfile o contenedor; 41 de 46 dependencias quedan sin pin.
  • Faltan scripts/prompts exactos y seeds para generar todos los baselines, y no se liberan valoraciones humanas o cuestionarios.
  • El cache público carece de ficha de procedencia válida y no separa la licencia MIT del copyright de los textos literarios derivados.

Qué no demuestra

  • No demuestra desacoplamiento estadístico o causal de personalidad, memoria y estilo.
  • No demuestra combinaciones fluidas entre rasgos, memoria y estilo no observadas.
  • No demuestra significación estadística ni robustez entre seeds.
  • No es el mejor sistema en toda métrica: Gemini gana calidad conversacional para especialistas.
  • No prueba que las ventajas sobrevivan a igualar longitud y contexto recuperado.
  • No generaliza más allá de seis personajes literarios chinos e ingleses.
  • No demuestra acuerdo humano fiable.
  • No garantiza memoria cronológica, ausencia de leakage o conocimiento exclusivo del personaje.
  • No demuestra eficiencia por ser training-free.
  • No establece seguridad para compañía, figuras públicas o despliegue real.
  • No permite reproducir valoraciones humanas ni todos los baselines de extremo a extremo.
  • No acredita que la distribución pública de derivados de libros tenga procedencia y licencia completas.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2507.16799v2, submitted 2025-07-22 and revised 2025-07-23; code, saved evaluations and cache dataset audited separately

Fuente consultada: https://arxiv.org/abs/2507.16799

Revisión: Codex 13-page visual, official-arXiv-v2, full-method, single-sample, repeated-measures, GPT-judge-pseudoreplication, length-bias, style-detection, decoupling, code, dependency, cached-data, copyright, reproducibility and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Qwen3-32B, TTM dialogue base
  • Qwen2.5-32B-Instruct, extraction and analysis
  • Qwen3-Embedding-0.6B
  • bge-large-zh-v1.5
  • Qwen3-235B-A22B
  • GPT-4o
  • Gemini-2.5-pro
  • ChatHaruhi with Qwen3-32B
  • CoSER with Llama-3.1-70B
  • GPT-4.1 as judge

Instrumentos y métricas

  • Three-stage styleless, memory-checked and stylized generation pipeline
  • Graph-based RAG and hybrid BM25/embedding retrieval
  • Three 0-10 rating dimensions: persona consistency, knowledge accuracy and conversation quality
  • GPT-4.1 pairwise scoring in both presentation orders
  • Generated-sentence detection among three historical utterances
  • Repository output-length and score-arithmetic audit

Datos utilizados

  • Six-character evaluation: Lin Daiyu, Duan Yu, Xuzhu, Dumbledore, Hermione and Elizabeth Bennet
  • Thirty-seven single-sample multi-turn dialogues across seven methods
  • Public asinmhk/TTM_cache, 441 files and about 6.42 GB
  • Saved GPT-4.1 pairwise evaluation records in ZhanxyR/TTM
  • Unreleased participant-level human ratings and style-detection responses

Evidencia y localización

  • Metadatos, versión, autores, licencia y abstract: arXiv:2507.16799v2
  • Método, modelos, evaluación, tabla, limitaciones, recursos y apéndice: arXiv v2 PDF, 13 páginas, sha256 e76340999c05c4bf436493ac97d98bd3eb2b63647c7ecef81bf2a192b228f0bb
  • Implementación, prompts, outputs, registros del juez, dependencias y bug de título: ZhanxyR/TTM commit 32823bb27675a36caa65dde817d35d8e2420b749
  • Tamaño, acceso, contenido y metadatos del cache: asinmhk/TTM_cache commit 4284156233adb7255f5049d86414bdc7d379da07
  • Auditoría de desacoplamiento, muestra humana, longitud, código, datos y fronteras: reports/verification/article-248-arxiv-ttm-decoupling-human-evaluation-length-bias-code-data-and-claim-audit.json