Aligning LLM agents with human learning and adjustment behavior: A dual agent approach

Personas, identidad y agentes2026ElsevierRevisión editorial aprobada

Autores: Tianming Liu, Jirong Yang, Yafeng Yin, Manzi Li, Linghao Wang, Zheng Zhu

Palabras clave: LLM Traveler Agents, Learnable Persona, Online Calibration, Route Choice, Behavioral Simulation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
6
Hallazgos
8
Limitaciones
6
Evidencias

Resumen editorial

Español

Publicado en 2026 en Transportation Research Part C, este trabajo propone calibrar agentes viajeros basados en GPT-4o para que predigan cómo una persona cambia de ruta en un juego repetido de congestión. Cada agente viajero combina una memoria corta de cuatro periodos, una memoria larga de 24 y una «persona» textual libre que describe preferencias, umbrales y reglas de decisión. Un segundo agente GPT-4o actúa como calibrador: cada periodo reevalúa la persona sobre una ventana de ocho observaciones, redacta «pseudogradientes» textuales para explicar errores, sintetiza direcciones de cambio, genera personas candidatas, vuelve a simularlas y conserva una candidata solo si reduce el error. Después la suaviza con un resumen de hasta 80 periodos. La persona es, por tanto, una política verbal aprendida para una tarea binaria; no equivale a una personalidad psicológica validada. La evaluación reutiliza un experimento de laboratorio con 15 estudiantes que eligen durante 160 turnos entre una vía rápida y una de dos vías locales. Se usan los primeros 80 turnos como entrenamiento y los últimos 80 como evaluación para esas mismas personas. El método obtiene accuracy 0,655 y F1 ponderado por grupo 0,635, frente a 0,549 y 0,544 del mejor baseline: mejoras absolutas de 10,6 y 9,1 puntos, o relativas de 19,3 % y 16,7 %. Supera a cada baseline para entre 10 y 12 de los 15 participantes según la métrica, pero no es mejor para todos. En una medida bidimensional de comportamiento, cambiar tras perder y mantenerse tras ganar, alcanza similitud coseno media 0,974, apenas 0,004 sobre Bounded-LLM, y queda último para tres participantes. Esta similitud está casi saturada en todos los métodos, mide solo el ángulo del vector y no observa un mecanismo cognitivo. En la simulación agregada que proporciona a todos los modelos el estado real anterior, el MAPE baja de 42,3 % a 40,0 % y la cantidad denominada MSE de 7,49 a 5,94. Sin embargo, la fórmula de la versión arXiv inspeccionada promedia una norma L2 sin elevarla al cuadrado, por lo que no define un error cuadrático medio; el código ausente impide resolver la discrepancia. La simulación libre, sin estados reales previos, solo se presenta mediante gráficas y comentarios cualitativos. La auditoría del dato público confirma 2.400 registros únicos, 15 personas por 160 turnos y ningún hueco. También revela que la Tabla 1 está mal rotulada: dice «primeros/últimos 20 días», pero sus porcentajes se calculan con los primeros/últimos 80 turnos. Aunque el artículo habla de datos «reales», se trata de un juego de laboratorio de unos 45 minutos; de los cinco grupos humanos disponibles se selecciona uno sin justificarlo. No hay pruebas estadísticas, intervalos, repeticiones de GPT-4o, ablaciones ni evaluación con personas nuevas, otros modelos o redes de transporte. El dato humano original es público, pero no se han publicado el código de calibración, prompts, versión exacta de GPT-4o, predicciones, historiales de personas, pérdidas ni costes. El estudio respalda una mejora de predicción temporal para estas 15 personas y esta configuración, no la recuperación de su cognición ni la generalización a viajeros reales.

English

Published in Transportation Research Part C in 2026, this paper proposes calibrating GPT-4o traveler agents to predict how an individual changes routes in a repeated congestion game. Each traveler agent combines a four-period short memory, a 24-period long memory, and a free-form textual “persona” describing preferences, thresholds, and decision rules. A second GPT-4o agent acts as a calibrator. At each period it reevaluates the persona over an eight-observation window, writes textual “pseudo-gradients” attributing prediction errors, synthesizes update directions, generates candidate personas, re-simulates them, and retains a candidate only if it lowers loss. The result is then smoothed with a summary of up to 80 periods. Persona here is therefore a learned verbal policy for a binary task, not a validated psychological personality. The evaluation reuses a laboratory experiment with 15 students making 160 repeated choices between an expressway and one of two local roads. The first 80 periods are used for training and the last 80 for evaluation on the same individuals. The method reports 0.655 accuracy and 0.635 group-weighted F1, compared with 0.549 and 0.544 for the best baseline: absolute gains of 10.6 and 9.1 percentage points, or relative gains of 19.3% and 16.7%. It beats each baseline for 10 to 12 of the 15 participants depending on the metric, but is not best for everyone. On a two-dimensional behavior measure, switching after a loss and staying after a win, it reaches mean cosine similarity 0.974, only 0.004 above Bounded-LLM, and ranks last for three participants. This similarity is near saturation for every method, measures vector angle rather than magnitude, and does not observe cognition. In the aggregate simulation where all models receive the true previous system state, MAPE falls from 42.3% to 40.0% and the quantity called MSE from 7.49 to 5.94. However, the inspected arXiv formula averages an unsquared L2 norm, so it does not define mean squared error; missing code prevents resolving the discrepancy. The free-running simulation without true previous states is presented only through plots and qualitative discussion. An audit of the public input confirms 2,400 unique records, 15 people by 160 periods, with no missing participant-period pair. It also shows that Table 1 is mislabeled: its headings say first/last 20 days, but its percentages are calculated from the first/last 80 periods. Although the paper calls the input “real-world” data, it is a roughly 45-minute laboratory game. One of five available human groups is selected without a reported rationale. There are no significance tests, intervals, repeated GPT-4o runs, component ablations, or evaluation on unseen people, other models, or transport networks. The original human input is public, but the calibration code, prompts, exact GPT-4o snapshot, predictions, persona histories, losses, and cost accounting are not. The study supports improved temporal prediction for these 15 people in this setup, not recovery of their cognition or generalization to real travelers.

Pregunta de investigación

¿Puede un agente calibrador basado en LLM aprender y actualizar una persona textual individual para que otro agente LLM prediga mejor la evolución de las elecciones de ruta de viajeros humanos?

Método

Quince agentes viajeros GPT-4o reciben una persona textual y memorias de 4 y 24 periodos. Otro GPT-4o calibra cada persona mediante evaluación en ventana móvil, atribuciones de error textuales, generación y selección de candidatos y suavizado con contexto largo. Se compara con Base-LLM, Recursive-LLM y Bounded-LLM sobre un corte temporal 80/80 del mismo grupo humano y se evalúan decisiones individuales, un vector de ajuste y flujos agregados.

Muestra: Un grupo seleccionado de 15 estudiantes, 9 en el OD con local 1 y 6 en el OD con local 2, realiza 160 elecciones en un juego de laboratorio. El análisis usa 1.200 observaciones de los turnos 1-80 para entrenamiento y 1.200 de los turnos 81-160 para evaluación sobre las mismas personas.

Hallazgos

  • El método alcanza 0,655 de accuracy y 0,635 de F1, frente a 0,549 y 0,544 de Base-LLM; son mejoras absolutas de 10,6 y 9,1 puntos.
  • Supera a cada baseline para entre 10/15 y 12/15 participantes, pero las comparaciones carecen de incertidumbre y no gana en todas las personas.
  • La similitud coseno media del vector de comportamiento es 0,974 frente a 0,970 del baseline más cercano; el método queda último en tres casos.
  • Con dinámica controlada, MAPE pasa de 42,3 % a 40,0 % y la cantidad llamada MSE de 7,49 a 5,94; la fórmula publicada no corresponde a un MSE.
  • La simulación libre reproduce cualitativamente algunas tendencias, pero no tiene tabla cuantitativa ni comparación completa de baselines.
  • El dato público confirma la integridad del grupo usado y revela que la Tabla 1 resume 80+80 turnos pese a rotularlos como 20+20 días.

Limitaciones

  • Solo se usa uno de cinco grupos humanos disponibles, con 15 estudiantes, y no se justifica la selección ni se prueba en los otros grupos.
  • El corte temporal mantiene las mismas personas; no demuestra generalización a individuos nuevos, otros entornos o movilidad natural.
  • Solo se evalúa GPT-4o y no se especifican snapshot, temperatura, semillas ni repeticiones.
  • No hay pruebas de significación, intervalos ni un modelo de dependencia temporal y social de las 1.200 decisiones de evaluación.
  • No hay ablaciones de persona, memorias, pseudogradientes, selección de candidatos o suavizado.
  • La similitud coseno bidimensional está cerca del techo y no valida mecanismos cognitivos.
  • La fórmula de MSE y el rótulo temporal de la Tabla 1 son inconsistentes con sus definiciones y datos.
  • Faltan código, prompts, predicciones, personas completas por periodo, resultados brutos y contabilidad de coste del método nuevo.

Qué no demuestra

  • No demuestra que la persona textual sea una personalidad psicológica o el mecanismo cognitivo real del participante.
  • No prueba significación estadística pese al uso del término significant.
  • No demuestra generalización a viajeros no observados, los otros cuatro grupos, otros LLM o redes reales.
  • No permite interpretar la mejora agregada cuantitativa como resultado de una simulación totalmente libre.
  • No acredita que el valor llamado MSE sea un error cuadrático medio bajo la fórmula publicada.
  • No ofrece una reproducción integral del método con artefactos públicos.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2511.00993v1; journal publication metadata checked for TRC 2026

Fuente consultada: https://arxiv.org/pdf/2511.00993

Revisión: Codex 32-page visual, current journal-publication, full-method, 15-participant x 160-period public-data, temporal-label, metric-formula, benchmark, statistical-design, construct-validity, artifact-search and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • GPT-4o as traveler-agent core
  • GPT-4o as calibration, critique, integration, editing and smoothing core

Instrumentos y métricas

  • Online textual pseudo-gradient persona optimization
  • Short-term and long-term memory retrieval
  • Binary choice accuracy
  • OD-group-weighted F1
  • Cosine similarity of switch-after-loss/stay-after-win vectors
  • Route-flow MAPE
  • Quantity labeled MSE with a formula inconsistency

Datos utilizados

  • Human group 1 from Comparing AI and human decision-making mechanisms in daily collaborative experiments
  • Zenodo 10.5281/zenodo.15307283
  • Controlled two-OD repeated route-choice laboratory game

Evidencia y localización

  • Arquitectura de agente viajero y persona: arXiv v1 sections 3.1-3.2, pp. 6-10
  • Calibración por pseudogradientes, candidatos y suavizado: arXiv v1 section 3.3 and Algorithm 2, pp. 10-13
  • Muestra, corte 80/80, GPT-4o y métricas: arXiv v1 sections 4.1-4.3 and Table 1, pp. 13-16
  • Resultados individuales y personas aprendidas: arXiv v1 Tables 2-6, pp. 17-24
  • Resultados agregados controlados y simulación libre: arXiv v1 Figures 5-6 and Table 7, pp. 24-28
  • Auditoría de publicación, dato público, rótulo 20/80, fórmula MSE, artefactos, validez y fronteras de afirmación: reports/verification/article-258-trc-dual-agent-traveler-persona-data-metric-artifact-and-claim-audit.json