Test-Time Adaptation for LLM Agents via Environment Interaction

Inducción y control de rasgos2026OpenReviewRevisión editorial aprobada

Autores: Arthur Chen, Zuxin Liu, Jianguo Zhang, Akshara Prabhakar, Zhiwei Liu, Shelby Heinecke, Silvio Savarese, Victor Zhong, Caiming Xiong

Palabras clave: Test-Time Adaptation, LLM Agents, Environment Interaction, Syntactic Alignment, Dynamics Grounding

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

9
Autores
6
Hallazgos
8
Limitaciones
6
Evidencias

Resumen editorial

Español

Este artículo de ICLR 2026 aborda la adaptación de agentes basados en LLM a entornos desconocidos durante el despliegue. No es, en sentido sustantivo, un estudio sobre personalidad sintética: las «personas» solo sirven para generar objetivos de exploración diversos y descubrir reglas de sitios web. El trabajo distingue dos fallos. El primero es sintáctico: el modelo no se ajusta al formato de observaciones, acciones o llamadas a funciones del entorno. El segundo es semántico: desconoce qué transición de estado producirá una acción. Para el primero propone Syntactic Alignment (SA), que añade un pequeño vector de adaptación a los estados del modelo y lo actualiza en línea mediante la pérdida del lenguaje sobre el contexto de la tarea; el vector se reinicia entre episodios. Para el segundo propone Dynamics Grounding (DG): antes de resolver tareas, un LLM sintetiza perfiles y metas de exploración, ejecuta recorridos, extrae de las transiciones reglas del entorno, elimina reglas repetitivas o triviales e incorpora las restantes al prompt como un modelo del mundo no paramétrico. La evaluación cubre WebArena, BFCLv3 y Tau-Bench; WebVoyager aparece en el título de una tabla y en datos del repositorio, pero el artículo no presenta una fila de resultados de WebVoyager. En WebArena, GPT-4.1 pasa globalmente de 30 % a 35 % con DG y en BFCLv3 de 55,5 % a 64 %. El titular de 2 % a 23 % corresponde únicamente al subconjunto multi-site de WebArena, no al resultado total. Además, DG no mejora todos los sitios: con GPT-4.1 baja en GitLab, Shopping Admin y Shopping, y sube en Reddit, Map y multi-site. GPT-4o mini mejora en WebArena de 12 % a 18 %. Para Qwen2.5-14B, SA, DG y su combinación llevan WebArena de 17 % a 18 %, 20 % y 21 %, respectivamente; en BFCLv3 el punto de partida es 18,5 %, DG alcanza 22 % y la combinación baja a 21 %, por lo que el método híbrido no domina siempre. En Tau-Bench, donde solo se evalúa SA y se usan cinco semillas, Qwen sube de 21,6 % a 25,2 % en airline y de 43,3 % a 44,9 % en retail. Para WebArena y BFCLv3 se informan estimaciones puntuales sobre tareas fijas, sin repeticiones, intervalos ni pruebas de significación. La sobrecarga comunicada para SA es de alrededor del 3 % con un paso y del 15,6 % con cinco; DG requiere una fase previa amortizable y el artículo estima unos siete millones de tokens y 7,5 horas por sitio. El repositorio oficial permite inspeccionar personas, configuraciones, reglas extraídas y una bifurcación de BFCL, pero no reproduce los resultados de extremo a extremo: faltan trayectorias, salidas, puntuaciones, registros de ejecución y la integración de Tau-Bench. La ruta SA publicada contiene fallos bloqueantes, atributos sin definir, rutas de reinicio incompatibles y un enmascarado de gradiente incorrecto; la guía de WebArena ejecuta en realidad OpenAI con DG, no SA; y una URL devtunnels.ms está codificada en el cliente. La columna de reglas sin filtrar de la Tabla 7 tampoco coincide con los archivos oficiales salvo para GitLab. La evidencia respalda que SA y DG pueden mejorar promedios concretos en estas configuraciones, pero no que creen personalidad, mejoren toda tarea o entorno, ni que el artefacto publicado permita verificar todas las tablas sin reparación.

English

This ICLR 2026 paper studies how LLM-based agents can adapt to unfamiliar environments at deployment time. It is not substantively a synthetic-personality study: “personas” are used only to generate diverse exploration goals for discovering website rules. The paper separates two failure modes. The first is syntactic: the model does not match an environment's observation, action, or function-call format. The second is semantic: it does not know which state transition an action will cause. For the first, Syntactic Alignment (SA) adds a small adaptation vector to model states and updates it online through language-model loss on the current task context; the vector is reset between episodes. For the second, Dynamics Grounding (DG) has an LLM synthesize exploration profiles and goals before task execution, run exploratory trajectories, extract rules from observed transitions, filter repetitive or trivial rules, and inject the remainder into the prompt as a nonparametric world model. The evaluation covers WebArena, BFCLv3, and Tau-Bench. WebVoyager is named in a table caption and represented by data in the repository, but no WebVoyager result row is reported. On WebArena, GPT-4.1 improves overall from 30% to 35% with DG, and on BFCLv3 from 55.5% to 64%. The headline 2%-to-23% gain applies only to WebArena's multi-site subset, not the aggregate result. DG also does not improve every website: for GPT-4.1 it lowers success on GitLab, Shopping Admin, and Shopping while raising it on Reddit, Map, and multi-site tasks. GPT-4o mini improves from 12% to 18% on WebArena. For Qwen2.5-14B, SA, DG, and their hybrid move WebArena from a 17% baseline to 18%, 20%, and 21%, respectively. On BFCLv3, the baseline is 18.5%, DG reaches 22%, and the hybrid falls to 21%, so combining the methods is not uniformly best. On Tau-Bench, where only SA is tested and five seeds are used, Qwen rises from 21.6% to 25.2% on airline and from 43.3% to 44.9% on retail. WebArena and BFCLv3 are reported as point estimates on fixed tasks without reruns, confidence intervals, or significance tests. Reported SA latency overhead is about 3% for one step and 15.6% for five steps; DG has an amortizable exploration phase estimated at about seven million tokens and 7.5 hours per website. The official repository exposes personas, configurations, extracted dynamics, and a BFCL fork, but it does not reproduce the paper end to end: raw trajectories, task outputs, scores, execution ledgers, and Tau-Bench integration are missing. The released SA path has blocking defects, including undefined attributes, incompatible reset-file paths, and incorrect gradient masking. The WebArena instructions actually select OpenAI with DG rather than SA, and the client contains a hardcoded devtunnels.ms endpoint. Table 7's unfiltered dynamics counts also disagree with the official files for every site except GitLab. The evidence supports the narrower claim that SA and DG can improve benchmark averages in these configurations. It does not show that the method creates personality, improves every task or environment, or that the released artifact can verify every reported table without repair.

Pregunta de investigación

¿Pueden agentes LLM adaptarse durante el despliegue a la sintaxis y a las dinámicas causales de entornos no vistos, usando una adaptación paramétrica ligera y un modelo del mundo extraído mediante exploración previa?

Método

SA aprende en línea un vector de adaptación añadido a los estados del LLM mediante la pérdida del contexto y lo reinicia por episodio. DG genera personas y metas para explorar el entorno, resume transiciones observadas, filtra reglas repetitivas o triviales e inserta las reglas depuradas en el prompt de ejecución. Se comparan los métodos por separado y, donde procede, combinados, con tasas de éxito en navegación web, llamadas a funciones y tareas de atención al cliente con herramientas.

Muestra: WebArena comprende 812 tareas: 187 de Shopping, 182 de Shopping Admin, 180 de GitLab, 109 de Map, 106 de Reddit y 48 multi-site. BFCLv3 cubre ocho dominios de API en su conjunto multi-turn base. Tau-Bench evalúa los dominios airline y retail con cinco semillas en la configuración descrita.

Hallazgos

  • DG eleva GPT-4.1 de 30 % a 35 % en WebArena global y de 55,5 % a 64 % en BFCLv3; el salto 2 %-23 % es solo el subconjunto multi-site.
  • Los efectos son heterogéneos: con GPT-4.1, DG reduce la tasa en tres de seis grupos de WebArena y la aumenta en los otros tres.
  • Qwen2.5-14B mejora con SA y DG, pero la combinación no domina: en BFCLv3 obtiene 21 %, por debajo del 22 % de DG solo.
  • En Tau-Bench, SA mejora Qwen de 21,6 % a 25,2 % en airline y de 43,3 % a 44,9 % en retail, con cinco semillas.
  • Una actualización SA añade cerca de 3 % de latencia; cinco, 15,6 %. DG traslada el coste a una exploración previa reutilizable.
  • El repositorio contiene material explicativo útil, pero sus fallos de ejecución y artefactos ausentes impiden verificar de extremo a extremo los resultados publicados.

Limitaciones

  • WebArena y BFCLv3 carecen de repeticiones, intervalos de confianza y pruebas de significación; sus diferencias son estimaciones puntuales.
  • SA se estudia sobre todo con Qwen2.5, por lo que no se demuestra generalización entre arquitecturas abiertas.
  • DG presupone transiciones de estado explícitas y no se adapta directamente a tareas conversacionales sin ese tipo de respuesta.
  • La combinación SA-DG es heurística y no mejora todas las configuraciones.
  • No se evalúa humanamente la exactitud, comprensibilidad, seguridad o vigencia de las reglas extraídas.
  • No hay desglose completo de coste, fallos, reintentos ni cómputo para reconstruir la ejecución.
  • El repositorio no incluye resultados brutos, integración Tau-Bench ni una ruta SA ejecutable tal como se publica.
  • La Tabla 7 no coincide con los conteos sin filtrar del artefacto oficial.

Qué no demuestra

  • No demuestra inducción, medición ni persistencia de una personalidad psicológica; las personas son estrategias de exploración.
  • No prueba que DG mejore cada sitio, tarea, benchmark o modelo.
  • No permite leer el 2 %-23 % como mejora global de WebArena.
  • No demuestra que combinar SA y DG sea siempre superior.
  • No establece que las reglas extraídas sean un modelo causal completo o transferible.
  • No acredita reproducibilidad integral de las tablas con el código oficial sin corregir defectos y reconstruir artefactos ausentes.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2511.04847v4; ICLR 2026 camera-ready

Fuente consultada: https://arxiv.org/pdf/2511.04847

Revisión: Codex 33-page visual, arXiv-v4/ICLR-publication, full-method, benchmark-table, site-heterogeneity, statistical-design, scope, official-code, notebook, dependency, reset-path, gradient-mask, artifact and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • GPT-4.1
  • GPT-4o mini
  • Qwen2.5-14B-Instruct
  • Qwen2.5-7B-Instruct
  • Qwen2.5-32B-Instruct
  • o3 as a dynamics-filtering model

Instrumentos y métricas

  • Syntactic Alignment adaptation vector
  • Dynamics Grounding exploration and extraction pipeline
  • Programmatic task success rate
  • BFCLv3 evaluation pipeline
  • Tau-Bench best-of-five self-critique evaluation
  • Latency overhead

Datos utilizados

  • WebArena: 812 tasks across five self-hosted websites and multi-site tasks
  • Berkeley Function Calling Leaderboard v3 multi-turn base
  • Tau-Bench airline and retail
  • WebVoyager task data appears in the artifact but no result is reported

Evidencia y localización

  • Publicación, título, autores y alcance: full text title page and abstract, p. 1; OpenReview forum OH4PE0TDo0
  • Definición de Syntactic Alignment y Dynamics Grounding: full text sections 2.1-2.2, pp. 2-4
  • Benchmarks, modelos y configuración: full text section 3 and Appendix A, pp. 4-6 and 17-18
  • Resultados principales, heterogeneidad por sitio y ablaciones: full text Tables 2-6 and sections 4-5, pp. 6-10
  • Conteos de dinámicas y prompts: full text Appendix B and Table 7, pp. 18-33
  • Auditoría de alcance, código, datos, métricas, discrepancia de Tabla 7 y fronteras de afirmación: reports/verification/article-257-iclr-test-time-adaptation-environment-interaction-code-data-and-claim-audit.json