ATLAS es un trabajo aceptado como Spotlight en ICML 2026 que propone sustituir la evaluación estática de modelos por computerised adaptive testing basado en teoría de respuesta al ítem. Esta revisión usa la versión v3 completa de 24 páginas, inspecciona visualmente sus 24 páginas y audita el repositorio oficial en el commit c0bc19b. El repositorio publica parámetros, resultados y un ZIP de 87 MB con matrices de respuesta, aunque el README afirma por error que esas matrices no están incluidas.
El estudio parte de respuestas ya calculadas del Open LLM Leaderboard para WinoGrande, TruthfulQA, HellaSwag, GSM8K y ARC. Retiene modelos con respuestas completas, elimina la cola inferior por debajo del percentil 0,1 y divide los modelos en diez estratos para un 90% de calibración y 10% de prueba. Filtra ítems casi constantes, con más de 95% de aciertos o correlación punto-biserial inferior a 0,1. Ajusta modelos IRT 3PL en particiones, intenta enlazarlas mediante common-person mean–sigma linking y obtiene una habilidad de referencia con WLE sobre el banco filtrado. Para cada modelo de prueba, ATLAS comienza en θ=0, selecciona entre los cinco ítems de mayor información de Fisher, actualiza θ por EAP y se detiene tras al menos 30 ítems cuando el error estándar baja de 0,1, 0,2 o 0,3, con máximo 500. No ejecuta los LLM: busca las respuestas de los ítems elegidos en una matriz completa ya existente.
En las tablas publicadas, ATLAS usa de media 30–89 ítems. En WinoGrande, TruthfulQA y HellaSwag obtiene MAE de habilidad de 0,155/0,166/0,179, 0,064/0,073/0,071 y 0,157/0,163/0,165 para los tres umbrales. En GSM8K no supera en MAE a MetaBench-Secondary: ATLAS queda en 0,150–0,177 frente a 0,096; en ARC el umbral 0,1 sí obtiene el menor MAE, 0,084. El IES favorece sistemáticamente a ATLAS porque multiplica el error relativo por el número de ítems relativo a Random100; puede mejorar aunque aumente el error absoluto. La reconstrucción p-IRT queda por debajo de 5 puntos porcentuales de MAE, pero mezcla respuestas observadas con probabilidades IRT para los ítems no administrados y la compara con accuracy cruda de un banco que, en varios benchmarks, contiene ítems eliminados de la calibración. Los experimentos de generalización solo se realizan en ARC: el holdout de la familia Mixtral mantiene MAE de 0,091–0,109, mientras el corte temporal empeora a 0,126–0,162.
La auditoría del código identifica un problema que afecta al núcleo de la validación. Si la escala enlazada es θref=A·θk+B y mirt usa el predictor a·θ+d, la transformación que conserva la curva es a*=a/A y d*=d−aB/A. El código y el README usan d*=A·d+B·a. Por tanto, los interceptos enlazados no representan los mismos ítems en la escala de referencia. La correlación que el script imprime después del linking no detecta el error porque correlacionar θref con una transformación afín de θk es invariante al desplazamiento y escala. Como el WLE de banco completo, la selección adaptativa, las probabilidades p-IRT y la mayoría de los baselines usan esos parámetros combinados, el fallo contamina el referente contra el que se afirma que ATLAS coincide.
Hay dos errores adicionales de reporte. La Tabla 1 llama RMSEA a valores de TinyBenchmarks entre 364,24 y 646,82, aunque RMSEA no puede tomar esa escala; además, el script liberado para TinyBenchmarks no calcula M2 ni RMSEA. Y la exposición media se calcula solo sobre ítems que aparecieron al menos una vez, omitiendo los ceros pese a que la fórmula del paper promedia sobre todo el banco. Por ejemplo, HellaSwag SE≤0,1 se reporta como 3,86%, pero el promedio correcto sobre 5.600 ítems es 0,73%; 4.542 ítems no se usan y el ítem más expuesto llega a 40,67%. En GSM8K, el máximo llega a 56,43%. La métrica publicada no demuestra utilización amplia ni evita concentración. En consecuencia, ATLAS ofrece una idea prometedora y artefactos más completos de lo habitual, pero sus cifras no validan todavía un sistema listo para reemplazar benchmarks estáticos: requieren corregir el linking, rehacer los resultados y evaluar prospectivamente coste, contenido y validez externa.