Publicado en 2026 en Transportation Research Part C, este trabajo propone calibrar agentes viajeros basados en GPT-4o para que predigan cómo una persona cambia de ruta en un juego repetido de congestión. Cada agente viajero combina una memoria corta de cuatro periodos, una memoria larga de 24 y una «persona» textual libre que describe preferencias, umbrales y reglas de decisión. Un segundo agente GPT-4o actúa como calibrador: cada periodo reevalúa la persona sobre una ventana de ocho observaciones, redacta «pseudogradientes» textuales para explicar errores, sintetiza direcciones de cambio, genera personas candidatas, vuelve a simularlas y conserva una candidata solo si reduce el error. Después la suaviza con un resumen de hasta 80 periodos. La persona es, por tanto, una política verbal aprendida para una tarea binaria; no equivale a una personalidad psicológica validada. La evaluación reutiliza un experimento de laboratorio con 15 estudiantes que eligen durante 160 turnos entre una vía rápida y una de dos vías locales. Se usan los primeros 80 turnos como entrenamiento y los últimos 80 como evaluación para esas mismas personas. El método obtiene accuracy 0,655 y F1 ponderado por grupo 0,635, frente a 0,549 y 0,544 del mejor baseline: mejoras absolutas de 10,6 y 9,1 puntos, o relativas de 19,3 % y 16,7 %. Supera a cada baseline para entre 10 y 12 de los 15 participantes según la métrica, pero no es mejor para todos. En una medida bidimensional de comportamiento, cambiar tras perder y mantenerse tras ganar, alcanza similitud coseno media 0,974, apenas 0,004 sobre Bounded-LLM, y queda último para tres participantes. Esta similitud está casi saturada en todos los métodos, mide solo el ángulo del vector y no observa un mecanismo cognitivo. En la simulación agregada que proporciona a todos los modelos el estado real anterior, el MAPE baja de 42,3 % a 40,0 % y la cantidad denominada MSE de 7,49 a 5,94. Sin embargo, la fórmula de la versión arXiv inspeccionada promedia una norma L2 sin elevarla al cuadrado, por lo que no define un error cuadrático medio; el código ausente impide resolver la discrepancia. La simulación libre, sin estados reales previos, solo se presenta mediante gráficas y comentarios cualitativos. La auditoría del dato público confirma 2.400 registros únicos, 15 personas por 160 turnos y ningún hueco. También revela que la Tabla 1 está mal rotulada: dice «primeros/últimos 20 días», pero sus porcentajes se calculan con los primeros/últimos 80 turnos. Aunque el artículo habla de datos «reales», se trata de un juego de laboratorio de unos 45 minutos; de los cinco grupos humanos disponibles se selecciona uno sin justificarlo. No hay pruebas estadísticas, intervalos, repeticiones de GPT-4o, ablaciones ni evaluación con personas nuevas, otros modelos o redes de transporte. El dato humano original es público, pero no se han publicado el código de calibración, prompts, versión exacta de GPT-4o, predicciones, historiales de personas, pérdidas ni costes. El estudio respalda una mejora de predicción temporal para estas 15 personas y esta configuración, no la recuperación de su cognición ni la generalización a viajeros reales.
Pregunta de investigación
¿Puede un agente calibrador basado en LLM aprender y actualizar una persona textual individual para que otro agente LLM prediga mejor la evolución de las elecciones de ruta de viajeros humanos?