Este artículo de ICLR 2026 aborda la adaptación de agentes basados en LLM a entornos desconocidos durante el despliegue. No es, en sentido sustantivo, un estudio sobre personalidad sintética: las «personas» solo sirven para generar objetivos de exploración diversos y descubrir reglas de sitios web. El trabajo distingue dos fallos. El primero es sintáctico: el modelo no se ajusta al formato de observaciones, acciones o llamadas a funciones del entorno. El segundo es semántico: desconoce qué transición de estado producirá una acción. Para el primero propone Syntactic Alignment (SA), que añade un pequeño vector de adaptación a los estados del modelo y lo actualiza en línea mediante la pérdida del lenguaje sobre el contexto de la tarea; el vector se reinicia entre episodios. Para el segundo propone Dynamics Grounding (DG): antes de resolver tareas, un LLM sintetiza perfiles y metas de exploración, ejecuta recorridos, extrae de las transiciones reglas del entorno, elimina reglas repetitivas o triviales e incorpora las restantes al prompt como un modelo del mundo no paramétrico. La evaluación cubre WebArena, BFCLv3 y Tau-Bench; WebVoyager aparece en el título de una tabla y en datos del repositorio, pero el artículo no presenta una fila de resultados de WebVoyager. En WebArena, GPT-4.1 pasa globalmente de 30 % a 35 % con DG y en BFCLv3 de 55,5 % a 64 %. El titular de 2 % a 23 % corresponde únicamente al subconjunto multi-site de WebArena, no al resultado total. Además, DG no mejora todos los sitios: con GPT-4.1 baja en GitLab, Shopping Admin y Shopping, y sube en Reddit, Map y multi-site. GPT-4o mini mejora en WebArena de 12 % a 18 %. Para Qwen2.5-14B, SA, DG y su combinación llevan WebArena de 17 % a 18 %, 20 % y 21 %, respectivamente; en BFCLv3 el punto de partida es 18,5 %, DG alcanza 22 % y la combinación baja a 21 %, por lo que el método híbrido no domina siempre. En Tau-Bench, donde solo se evalúa SA y se usan cinco semillas, Qwen sube de 21,6 % a 25,2 % en airline y de 43,3 % a 44,9 % en retail. Para WebArena y BFCLv3 se informan estimaciones puntuales sobre tareas fijas, sin repeticiones, intervalos ni pruebas de significación. La sobrecarga comunicada para SA es de alrededor del 3 % con un paso y del 15,6 % con cinco; DG requiere una fase previa amortizable y el artículo estima unos siete millones de tokens y 7,5 horas por sitio. El repositorio oficial permite inspeccionar personas, configuraciones, reglas extraídas y una bifurcación de BFCL, pero no reproduce los resultados de extremo a extremo: faltan trayectorias, salidas, puntuaciones, registros de ejecución y la integración de Tau-Bench. La ruta SA publicada contiene fallos bloqueantes, atributos sin definir, rutas de reinicio incompatibles y un enmascarado de gradiente incorrecto; la guía de WebArena ejecuta en realidad OpenAI con DG, no SA; y una URL devtunnels.ms está codificada en el cliente. La columna de reglas sin filtrar de la Tabla 7 tampoco coincide con los archivos oficiales salvo para GitLab. La evidencia respalda que SA y DG pueden mejorar promedios concretos en estas configuraciones, pero no que creen personalidad, mejoren toda tarea o entorno, ni que el artefacto publicado permita verificar todas las tablas sin reparación.
Pregunta de investigación
¿Pueden agentes LLM adaptarse durante el despliegue a la sintaxis y a las dinámicas causales de entornos no vistos, usando una adaptación paramétrica ligera y un modelo del mundo extraído mediante exploración previa?