Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks

Evaluación y validez psicométrica2026ICML ProceedingsRevisión editorial aprobada

Autores: Peiyu Li, Xiuxiu Tang, Si Chen, Ying Cheng, Ronald Metoyer, Ting Hua, Nitesh V. Chawla

Palabras clave: Large Language Models, Adaptive Testing, Psychometrics, Item Response Theory, Model Evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

7
Autores
40
Hallazgos
99
Limitaciones
15
Evidencias

Resumen editorial

Español

ATLAS es un trabajo aceptado como Spotlight en ICML 2026 que propone sustituir la evaluación estática de modelos por computerised adaptive testing basado en teoría de respuesta al ítem. Esta revisión usa la versión v3 completa de 24 páginas, inspecciona visualmente sus 24 páginas y audita el repositorio oficial en el commit c0bc19b. El repositorio publica parámetros, resultados y un ZIP de 87 MB con matrices de respuesta, aunque el README afirma por error que esas matrices no están incluidas.

El estudio parte de respuestas ya calculadas del Open LLM Leaderboard para WinoGrande, TruthfulQA, HellaSwag, GSM8K y ARC. Retiene modelos con respuestas completas, elimina la cola inferior por debajo del percentil 0,1 y divide los modelos en diez estratos para un 90% de calibración y 10% de prueba. Filtra ítems casi constantes, con más de 95% de aciertos o correlación punto-biserial inferior a 0,1. Ajusta modelos IRT 3PL en particiones, intenta enlazarlas mediante common-person mean–sigma linking y obtiene una habilidad de referencia con WLE sobre el banco filtrado. Para cada modelo de prueba, ATLAS comienza en θ=0, selecciona entre los cinco ítems de mayor información de Fisher, actualiza θ por EAP y se detiene tras al menos 30 ítems cuando el error estándar baja de 0,1, 0,2 o 0,3, con máximo 500. No ejecuta los LLM: busca las respuestas de los ítems elegidos en una matriz completa ya existente.

En las tablas publicadas, ATLAS usa de media 30–89 ítems. En WinoGrande, TruthfulQA y HellaSwag obtiene MAE de habilidad de 0,155/0,166/0,179, 0,064/0,073/0,071 y 0,157/0,163/0,165 para los tres umbrales. En GSM8K no supera en MAE a MetaBench-Secondary: ATLAS queda en 0,150–0,177 frente a 0,096; en ARC el umbral 0,1 sí obtiene el menor MAE, 0,084. El IES favorece sistemáticamente a ATLAS porque multiplica el error relativo por el número de ítems relativo a Random100; puede mejorar aunque aumente el error absoluto. La reconstrucción p-IRT queda por debajo de 5 puntos porcentuales de MAE, pero mezcla respuestas observadas con probabilidades IRT para los ítems no administrados y la compara con accuracy cruda de un banco que, en varios benchmarks, contiene ítems eliminados de la calibración. Los experimentos de generalización solo se realizan en ARC: el holdout de la familia Mixtral mantiene MAE de 0,091–0,109, mientras el corte temporal empeora a 0,126–0,162.

La auditoría del código identifica un problema que afecta al núcleo de la validación. Si la escala enlazada es θref=A·θk+B y mirt usa el predictor a·θ+d, la transformación que conserva la curva es a*=a/A y d*=d−aB/A. El código y el README usan d*=A·d+B·a. Por tanto, los interceptos enlazados no representan los mismos ítems en la escala de referencia. La correlación que el script imprime después del linking no detecta el error porque correlacionar θref con una transformación afín de θk es invariante al desplazamiento y escala. Como el WLE de banco completo, la selección adaptativa, las probabilidades p-IRT y la mayoría de los baselines usan esos parámetros combinados, el fallo contamina el referente contra el que se afirma que ATLAS coincide.

Hay dos errores adicionales de reporte. La Tabla 1 llama RMSEA a valores de TinyBenchmarks entre 364,24 y 646,82, aunque RMSEA no puede tomar esa escala; además, el script liberado para TinyBenchmarks no calcula M2 ni RMSEA. Y la exposición media se calcula solo sobre ítems que aparecieron al menos una vez, omitiendo los ceros pese a que la fórmula del paper promedia sobre todo el banco. Por ejemplo, HellaSwag SE≤0,1 se reporta como 3,86%, pero el promedio correcto sobre 5.600 ítems es 0,73%; 4.542 ítems no se usan y el ítem más expuesto llega a 40,67%. En GSM8K, el máximo llega a 56,43%. La métrica publicada no demuestra utilización amplia ni evita concentración. En consecuencia, ATLAS ofrece una idea prometedora y artefactos más completos de lo habitual, pero sus cifras no validan todavía un sistema listo para reemplazar benchmarks estáticos: requieren corregir el linking, rehacer los resultados y evaluar prospectivamente coste, contenido y validez externa.

English

ATLAS is an ICML 2026 Spotlight paper proposing to replace static model evaluation with Item Response Theory-based computerized adaptive testing. This review uses the complete 24-page v3 paper, visually inspects all 24 pages, and audits the official repository at commit c0bc19b. The repository releases parameters, results, and an 87 MB ZIP containing response matrices, although the README incorrectly says those matrices are not committed.

The study starts from precomputed Open LLM Leaderboard responses for WinoGrande, TruthfulQA, HellaSwag, GSM8K, and ARC. It retains complete-response models, removes the bottom 0.1 percentile, and performs a ten-bin stratified 90/10 model calibration/test split. It filters nearly constant items, items above 95% accuracy, and items with point-biserial correlation below 0.1. It fits partitioned 3PL IRT models, attempts to align them through common-person mean–sigma linking, and obtains a whole-bank WLE reference ability over the filtered bank. For each test model, ATLAS starts at θ=0, samples among the five highest-Fisher-information items, updates θ by EAP, and stops after at least 30 items when SE falls below 0.1, 0.2, or 0.3, with a maximum of 500. It does not run the LLMs; it looks up selected-item responses in an already complete response matrix.

In the published tables, ATLAS uses an average of 30–89 items. WinoGrande, TruthfulQA, and HellaSwag ability MAEs are 0.155/0.166/0.179, 0.064/0.073/0.071, and 0.157/0.163/0.165 at the three thresholds. On GSM8K, ATLAS does not beat MetaBench-Secondary in absolute MAE: ATLAS is 0.150–0.177 versus 0.096; on ARC, the 0.1 threshold does obtain the lowest MAE, 0.084. IES systematically favors ATLAS because it multiplies relative error by item count relative to Random100; it can improve even while absolute error worsens. p-IRT reconstruction remains below five percentage points MAE, but it blends observed responses with IRT probabilities for unadministered items and compares the result with raw accuracy over a bank that, for several benchmarks, contains items excluded from calibration. Generalization experiments cover ARC only: strict Mixtral-family holdout yields MAE 0.091–0.109, while the temporal split worsens to 0.126–0.162.

The code audit finds a problem at the core of the validation. If the linked scale is θref=A·θk+B and mirt uses predictor a·θ+d, the curve-preserving transformation is a*=a/A and d*=d−aB/A. The code and README instead use d*=A·d+B·a. The linked intercepts therefore do not represent the same items on the reference scale. The script's post-link correlation does not detect this because correlation between θref and an affine transform of θk is invariant to shift and scale. Since whole-bank WLE, adaptive selection, p-IRT probabilities, and most baselines use the combined parameters, this error contaminates the reference ATLAS is said to match.

Two further reporting errors are material. Table 1 labels TinyBenchmarks values from 364.24 to 646.82 as RMSEA even though RMSEA cannot be on that scale; the released TinyBenchmarks fitting script does not calculate M2 or RMSEA at all. Average item exposure is also computed only over items selected at least once, omitting zeros despite the paper's formula averaging over the entire bank. For HellaSwag at SE≤0.1, 3.86% is reported but the correct full-bank mean over 5,600 items is 0.73%; 4,542 items are never used and the most exposed item reaches 40.67%. GSM8K maximum exposure reaches 56.43%. The published statistic therefore does not establish broad utilization or prevent concentration. ATLAS is a promising idea with unusually substantial artifacts, but its numbers do not yet validate a production-ready replacement for static benchmarks; the linking must be corrected, results rerun, and prospective cost, content, and external validity evaluated.

Pregunta de investigación

¿Puede un test adaptativo 3PL que selecciona ítems por información de Fisher estimar la habilidad IRT y reconstruir la accuracy de modelos con muchos menos ítems que un benchmark estático, manteniendo ranking, precisión y transferencia a familias o periodos de modelos no usados en calibración?

Método

Análisis retrospectivo de matrices binarias del Open LLM Leaderboard para cinco benchmarks. Se filtran modelos e ítems, se divide por modelos en calibración/prueba, se ajustan modelos 3PL por bloques y se enlazan con personas comunes. WLE sobre todo el banco filtrado actúa como referencia. CAT usa EAP, randomesque top-5, mínimo 30, máximo 500 y umbrales SE 0,1/0,2/0,3. Se compara MAE de θ, IES y reconstrucción p-IRT con Random100, TinyBenchmarks y dos subconjuntos MetaBench; se añaden split por familia Mixtral, split temporal, split-half, Q3, 2PL/3PL, WLE/EAP y extensión MMLU.

Muestra: No hay participantes humanos ni nuevas llamadas a modelos. Las unidades son entradas de modelos y checkpoints del Open LLM Leaderboard, incluidas variantes, fine-tunes, cuantizaciones y modelos emparentados. Tras filtros, se usan 4.680/521 entradas de calibración/prueba en WinoGrande, 4.635/516 en TruthfulQA, 3.467/386 en HellaSwag, 3.775/420 en GSM8K y 3.747/417 en ARC. El split temporal de ARC usa 2.998 entradas anteriores y 322 posteriores al 1 de mayo de 2024, excluyendo 844 sin fecha.

Hallazgos

  • La versión vigente es arXiv v3, revisada el 13 de julio de 2026 y aceptada como Spotlight en ICML 2026.
  • El PDF lleva aviso de Proceedings of the 43rd ICML, PMLR 306, 2026.
  • El trabajo es evaluación adaptativa de capacidades de LLM, no medición de personalidad; la keyword Personality del registro antiguo era incorrecta.
  • ATLAS opera retrospectivamente sobre respuestas completas y no reduce en este experimento el coste ya incurrido para obtenerlas.
  • Los cinco bancos calibrados publicados tienen 1.045, 627, 5.600, 1.306 y 839 parámetros, no todos los conteos redondeados o inconsistentes del paper y README.
  • Las matrices de test crudas contienen 1.045, 644, 5.711, 1.306 y 844 ítems respectivamente.
  • La reconstrucción ATLAS promedia sobre el banco calibrado, mientras actual_accuracy se calcula sobre la matriz cruda; los estimandos difieren para TruthfulQA, HellaSwag y ARC.
  • En WinoGrande, ATLAS alcanza MAE 0,155 con 70 ítems, 0,166 con 37 y 0,179 con 32.
  • En TruthfulQA alcanza 0,064 con 48 ítems y aproximadamente 0,07 con el mínimo de 30.
  • En HellaSwag alcanza 0,157 con 41 ítems y 0,163–0,165 con 30.
  • En GSM8K, MetaBench-Secondary obtiene menor MAE absoluto, 0,096, que las tres configuraciones ATLAS, 0,150–0,177.
  • En ARC, ATLAS SE≤0,1 obtiene el menor MAE de habilidad, 0,084 con 89 ítems; los umbrales relajados aumentan MAE a 0,120 y 0,117.
  • El IES de ATLAS es el menor porque combina error y longitud multiplicativamente; no implica siempre el menor error.
  • La reconstrucción p-IRT queda por debajo de 0,05 MAE en las cinco tareas, pero ATLAS no es siempre mejor que baselines estáticos en accuracy.
  • En TruthfulQA, Random100 y MetaBench-P tienen menor MAE de accuracy que ATLAS; en GSM8K las cuatro alternativas estáticas superan a ATLAS.
  • El 23–31% de cambios de más de diez posiciones describe diferencia entre rankings, no prueba que θ sea más correcto.
  • La referencia whole-bank θ está definida por el mismo modelo IRT y parámetros usados por ATLAS, de modo que el test valida aproximación interna, no validez externa de capacidad.
  • La estabilidad split-half de rankings IRT es mayor que la de accuracy en los resultados reportados.
  • Las correlaciones entre GSM8K y MMLU Mathematics y entre dos subconjuntos de química MMLU aumentan con θ, pero solo se estudian dos pares relacionados.
  • El holdout Mixtral en ARC mantiene MAE 0,091–0,109 frente a 0,084–0,117 en split aleatorio.
  • El split temporal de ARC empeora MAE a 0,126–0,162; la reconstrucción de accuracy cambia menos, a 0,044–0,045.
  • La extensión MMLU muestra que en algunas materias SE≤0,1 usa prácticamente todo el banco, por lo que el ahorro no es uniforme.
  • El script selecciona el primer ítem aleatoriamente dentro de ±0,5 de dificultad, mientras el algoritmo del paper prescribe el ítem determinísticamente más cercano a θ=0.
  • El baseline Random100 usa una única muestra fija con seed 42, no múltiples subconjuntos aleatorios.
  • Los errores estándar de las tablas son dispersión de errores entre modelos dividida por raíz de n, no incertidumbre por repetición de selección o calibración.
  • El linking de interceptos implementado no conserva el predictor 3PL bajo la transformación de escala declarada.
  • La correlación post-link que imprime el script es incapaz de validar el intercepto transformado.
  • El error de linking afecta parámetros combinados, WLE de referencia, CAT, p-IRT y baselines derivados.
  • La Tabla 1 etiqueta como RMSEA valores TinyBenchmarks de 364,24 a 646,82, escala imposible para RMSEA.
  • El script TinyBenchmarks liberado no ejecuta M2 ni RMSEA, por lo que esos cinco números no son reproducibles desde el código presentado.
  • Los RMSEA de ATLAS se promedian entre particiones; un promedio aceptable puede ocultar particiones o dimensiones con peor ajuste.
  • El promedio de exposición publicado omite todos los ítems jamás seleccionados y contradice la fórmula del apéndice.
  • HellaSwag SE≤0,1 se publica como 3,86% de exposición media; incluyendo los ceros es 0,73%, con 4.542 de 5.600 ítems nunca usados.
  • Los máximos de exposición alcanzan 40,67% en HellaSwag y 56,43% en GSM8K, incompatibles con interpretar el promedio publicado como ausencia de concentración.
  • Los tiempos de 9–76 segundos miden selección y lookup sobre respuestas existentes, no inferencia de LLM, calibración ni evaluación end-to-end.
  • El repositorio contiene 436 archivos, matrices, parámetros, resultados, scripts y paths adaptativos, pero no declara licencia.
  • El README dice que las matrices no están committed, aunque data/data.zip contiene las 11 matrices de calibración y prueba.
  • No existe script público que derive las matrices crudas, documente su versión exacta del leaderboard y reproduzca todos los filtros y splits desde la fuente original.
  • No hay lockfile, renv, contenedor, tests automatizados ni CI para fijar el entorno R/Python.
  • El repositorio permite auditar muchas cifras intermedias, pero no reproducir de forma fiable la conclusión principal sin corregir el código y volver a calcular los resultados.

Limitaciones

  • La evaluación es retrospectiva; el modelo ya respondió a todos los ítems antes de simular el test adaptativo.
  • No se mide coste real de llamadas, tokens, latencia, batching, fallos o reintentos de una evaluación prospectiva.
  • Selection time no es runtime end-to-end pese al lenguaje usado en el cuerpo del artículo.
  • El método presupone un banco calibrado con miles de evaluaciones históricas completas.
  • No se cuantifica el punto de equilibrio entre el coste de calibración y el ahorro por modelo nuevo.
  • Los modelos de calibración y prueba proceden del mismo ecosistema de leaderboard y harness.
  • Los rows no son unidades independientes: incluyen familias, checkpoints, fine-tunes, merges y cuantizaciones relacionados.
  • La dependencia entre personas-modelo puede sesgar parámetros e incertidumbre y no se estudia.
  • Q3 examina dependencia local entre ítems, no dependencia genealógica entre modelos.
  • Retener solo modelos con respuesta completa introduce selección por disponibilidad.
  • Eliminar la cola inferior pero conservar la superior modifica asimétricamente la distribución de habilidad.
  • El split estratificado comparte distribución y puede sobreestimar transferencia ordinaria.
  • La transferencia por arquitectura y fecha solo se prueba en ARC.
  • Solo se retiene fuera una familia, Mixtral; no hay replicación con Llama, Qwen, Gemma u otras familias.
  • El split temporal excluye 844 entradas sin fecha y no analiza el sesgo de esa exclusión.
  • No se publican intervalos de incertidumbre para la diferencia entre splits aleatorio, familiar y temporal.
  • No hay validación prospectiva con modelos realmente nuevos después de congelar parámetros.
  • El modelo 3PL unidimensional puede ser inadecuado para benchmarks que mezclan subhabilidades.
  • No se evalúa dimensionalidad antes de interpretar un único θ como capacidad.
  • El M2 se calcula por particiones, no como ajuste conjunto de todo el banco enlazado.
  • Promediar RMSEA entre particiones no garantiza ajuste global ni invariancia de parámetros.
  • CFI y TLI de varias particiones son bajos, especialmente en WinoGrande y ARC, aunque la narrativa destaca RMSEA.
  • La Tabla 1 de TinyBenchmarks contiene valores imposibles bajo la etiqueta RMSEA.
  • El pipeline TinyBenchmarks no publica el cálculo que generó la Tabla 1.
  • La afirmación de severe misfit de TinyBenchmarks no es verificable con el artefacto liberado.
  • El filtrado por correlación punto-biserial no documenta si usa correlación item-total corregida; el pipeline de preprocessing no está publicado.
  • Si la puntuación total incluye el ítem, la correlación se infla por solapamiento parte-todo.
  • Eliminar correlaciones negativas puede borrar subhabilidades o claves problemáticas sin auditoría de contenido.
  • Accuracy superior a 95% se trata como poco informativa, pero no se analiza cobertura de capacidades fáciles esenciales.
  • No hay revisión manual de ítems descartados por error, ambigüedad o contenido.
  • El parámetro pseudo-guessing 3PL no tiene interpretación única para LLM y puede capturar priors, formato, memorización o heurísticas.
  • La sensibilidad 2PL/3PL muestra que 3PL no mejora uniformemente MAE.
  • No se propaga incertidumbre de parámetros del ítem al SE usado para detener el CAT.
  • No se propaga incertidumbre del linking al SE ni a MAE.
  • No hay bootstrap por calibración, ítem, familia de modelo o selección adaptativa.
  • El mínimo arbitrario de 30 ítems domina muchas condiciones y hace que SE≤0,2 y SE≤0,3 coincidan.
  • El máximo 500 puede truncar modelos extremos sin diagnóstico separado.
  • La prior de EAP y sus parámetros no reciben un análisis detallado de sensibilidad.
  • La comparación WLE/EAP del apéndice no corrige el error previo de linking.
  • El primer ítem del código no coincide con el algoritmo descrito en el paper.
  • Randomesque usa una única semilla por modelo y no informa variación entre repeticiones.
  • Random100 es una única muestra fija, por lo que no representa la distribución de baselines aleatorios.
  • Los SE tabulados entre modelos no son intervalos de repetibilidad del método.
  • Los baselines usan tamaños distintos y, para TinyBenchmarks, parámetros recalibrados o bancos con conteos diferentes.
  • Los n_all_items de baselines varían respecto del banco ATLAS, reduciendo comparabilidad del IES y p-IRT.
  • La fórmula de linking de d en código y README es incompatible con la parametrización a·θ+d y θref=A·θk+B.
  • La validación por correlación después del linking es tautológica respecto a una transformación afín y no prueba equivalencia de curvas.
  • El primer bloque se elige como referencia arbitraria sin análisis de sensibilidad al bloque de referencia.
  • No se usan common-item anchors; la estabilidad depende de personas-modelo comunes y de que sus scores por bloque sean comparables.
  • El WLE whole-bank llamado ground truth es una estimación dependiente del mismo modelo, filtros y linking.
  • La comparación CAT contra ese WLE es validación interna circular, no verdad externa de capacidad.
  • Los rank shifts respecto de accuracy son esperables cuando IRT repondera dificultad y discriminación.
  • No hay criterio externo que determine si los cambios de ranking son mejoras o distorsiones.
  • Las correlaciones entre benchmarks relacionados cubren solo matemáticas y dos materias de química.
  • No hay tests formales o intervalos para las diferencias de correlación entre accuracy y θ.
  • Split-half ranking stability mide fiabilidad relativa, no validez de constructo.
  • p-IRT reconstruye respuestas no observadas con el mismo modelo que define θ y puede heredar su misfit.
  • La comparación de p-IRT usa accuracy cruda de matrices que incluyen ítems fuera del banco filtrado.
  • No se reporta calibración probabilística de las predicciones por ítem.
  • MAE agregado puede ocultar error sistemático en modelos de alta o baja habilidad.
  • La figura de identidad no sustituye análisis de sesgo, cobertura o límites de acuerdo.
  • IES es un índice nuevo y arbitrario que multiplica dos ratios sin validación externa.
  • IES puede disminuir al usar menos ítems aunque MAE empeore de forma material.
  • La etiqueta strongest accuracy–efficiency tradeoff depende enteramente de esa función y del único Random100.
  • La exposición media definida sobre todo el banco es algebraicamente longitud media dividida por tamaño del banco.
  • El código calcula la media solo entre ítems observados al menos una vez y por eso no implementa la fórmula publicada.
  • El promedio de exposición no informa el máximo, cola o concentración real.
  • Los máximos reconstruidos superan 40% en las cinco tareas y llegan a 56,43% en GSM8K.
  • El test overlap bajo no demuestra cobertura temática o ausencia de sesgo de contenido.
  • No se imponen constraints de contenido, dominio, dificultad secundaria, formato o fairness en los experimentos.
  • La discusión dice que el marco soporta content balancing, pero no lo implementa ni evalúa.
  • La reducción adaptativa puede concentrarse en subdominios informativos y perder validez de contenido.
  • Baja exposición durante el CAT no reduce contaminación de entrenamiento de ítems públicos ya conocidos por los modelos.
  • No se evalúan bancos secretos, rotación temporal ni compromiso de ítems.
  • No se documenta con precisión la versión, snapshot, fecha y harness del Open LLM Leaderboard usado.
  • No hay data card con procedencia, licencias y transformación de cada benchmark.
  • No se publica código para reconstruir las matrices desde resultados originales del leaderboard.
  • El ZIP contiene datos que el README declara ausentes, señal de documentación desincronizada.
  • La cantidad de ítems difiere entre paper, README, matrices crudas, parámetros y resúmenes.
  • No hay licencia del repositorio para reutilizar código, parámetros o matrices.
  • No hay versiones fijadas de mirt, catR, R, pandas o numpy.
  • Los scripts instalan paquetes en runtime y no proporcionan un entorno inmutable.
  • No hay tests de unidad para probabilidad 3PL, linking, mapping, stopping, exposure o IES.
  • No hay CI que ejecute el pipeline o compruebe las tablas.
  • No hay test de regresión que hubiera detectado los RMSEA imposibles o la exposición mal promediada.
  • La ejecución completa requiere descomprimir manualmente datos y selected_items, además de recursos R considerables.
  • Los archivos de resultados derivan de múltiples scripts y convenciones de nombres inconsistentes.
  • El script de resumen resta vectores por posición, no hace join por model id, aunque los archivos principales auditados conservan el mismo orden.
  • El manejo de NA en 02_wle_scoring crea data_clean pero luego vuelve a operar sobre data, anulando esa limpieza.
  • Los rows no convergentes de WLE restantes se reemplazan por la mediana sin flag por modelo en el output.
  • No se cuantifica cuántas imputaciones por mediana ocurrieron en los resultados publicados.
  • La extensión MMLU no presenta el mismo conjunto completo de baselines, fit, Q3 y splits de generalización.
  • En algunas materias MMLU el umbral estricto usa casi o exactamente todos los ítems.
  • El claim de aproximadamente 80% de reducción en MMLU se refiere al umbral relajado y no a todos los settings.
  • No hay evaluación de preguntas generativas, métricas no binarias, jueces LLM o tareas abiertas.
  • No hay evaluación de seguridad, sesgo, multilingüismo o variación de prompts.
  • No se demuestra que θ sea comparable entre benchmarks distintos; cada banco tiene su propia escala.
  • No se analiza drift de parámetros cuando cambian modelos, harnesses o contaminación del banco.
  • No existe estrategia empírica de recalibración online o detección de pérdida de invariancia.

Qué no demuestra

  • No establece que ATLAS pueda reemplazar benchmarks estáticos sin corregir y recalcular el linking.
  • No demuestra una reducción real de coste end-to-end porque la simulación usa respuestas ya disponibles.
  • No demuestra que los tiempos publicados incluyan inferencia de LLM.
  • No establece que θ sea ground truth de capacidad general.
  • No demuestra que los rank shifts sean más válidos que el ranking por accuracy.
  • No demuestra el menor MAE absoluto en todos los benchmarks o métricas.
  • No demuestra que ATLAS supere a MetaBench-Secondary en GSM8K.
  • No demuestra que reconstructed accuracy use exactamente el mismo banco que raw accuracy en todas las tareas.
  • No demuestra buen fit de TinyBenchmarks con una comparación RMSEA válida o reproducible.
  • No demuestra broad item utilization con el promedio de exposición implementado.
  • No demuestra baja exposición máxima; algunos ítems aparecen en más de la mitad de los tests.
  • No demuestra cobertura temática, fairness o content balancing.
  • No demuestra menor contaminación de pretraining sobre benchmarks públicos.
  • No demuestra generalización a todas las familias, fechas, tareas o leaderboards.
  • No demuestra validez externa con outcomes independientes de los mismos benchmarks.
  • No permite reproducir desde la fuente original la construcción completa de las matrices y splits.
  • No ofrece actualmente un artefacto con licencia y entorno fijado listo para adopción de producción.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2511.04689v3, revised 13 July 2026; ICML 2026 Spotlight with PMLR 306 proceedings notice; 24 pages; official repository commit c0bc19b33aaa11703b8258377abb367533b8a824 audited as supplement

Fuente consultada: https://arxiv.org/pdf/2511.04689v3

Revisión: Codex ICML-version reconciliation, complete bilingual full-text fidelity pass, all-page PDF visual inspection, table and formula audit, independent metric recomputation, raw-versus-filtered bank reconciliation, construct and generalization audit, and official-repository code/data audit at pinned commit; summaries written from the complete paper and artifacts rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • 4,680 calibration and 521 test leaderboard model entries for WinoGrande
  • 4,635 calibration and 516 test leaderboard model entries for TruthfulQA
  • 3,467 calibration and 386 test leaderboard model entries for HellaSwag
  • 3,775 calibration and 420 test leaderboard model entries for GSM8K
  • 3,747 calibration and 417 test leaderboard model entries for ARC
  • 321 Mixtral-family ARC entries used only in strict architecture-family holdout testing
  • 322 post-2024-05-01 ARC entries used in temporal testing after excluding 844 entries without release dates
  • No LLM is queried prospectively by the released ATLAS experiments

Instrumentos y métricas

  • Three-parameter logistic Item Response Theory model in mirt parameterization
  • Partitioned calibration with common-person mean–sigma linking
  • Whole-filtered-bank WLE reference ability
  • EAP adaptive ability updates
  • Fisher-information item ranking with random sampling from the top five
  • SE stopping thresholds 0.1, 0.2 and 0.3, minimum 30 and maximum 500 items
  • Ability MAE and standard error across model-level absolute errors
  • p-IRT reconstructed accuracy from observed items and modeled unobserved probabilities
  • Information Efficiency Score relative to a single Random100 subset
  • Limited-information M2, RMSEA and 2PL Q3 local-dependence diagnostics
  • Split-half Spearman ranking stability and related-benchmark rank correlation
  • Average item exposure, test overlap and adaptive-selection-loop time

Datos utilizados

  • Open LLM Leaderboard-derived WinoGrande response matrix: 5,201 model rows before 90/10 split; 1,045 calibrated items after filters
  • Open LLM Leaderboard-derived TruthfulQA response matrix: 5,151 model rows; 627 calibrated items after filters
  • Open LLM Leaderboard-derived HellaSwag response matrix: 3,853 model rows; 5,600 calibrated items after filters
  • Open LLM Leaderboard-derived GSM8K response matrix: 4,195 model rows; 1,306 calibrated items after filters
  • Open LLM Leaderboard-derived ARC response matrix: 4,164 model rows; 839 calibrated items in released parameter bank
  • Five released test matrices contain 521, 516, 386, 420 and 417 complete model response rows
  • MMLU per-subject appendix extension without the same full baseline and diagnostic reporting
  • Official repository data/data.zip with 11 CSVs totaling approximately 87 MB
  • Official repository selected_items.zip archives with per-model adaptive paths for all five benchmarks

Evidencia y localización

  • Versión v3, autoría, revisión del 13 de julio de 2026 e ICML 2026 Spotlight: arXiv:2511.04689v3 metadata and PDF front matter, page 1
  • Selección de modelos, split, filtros, particiones y CAT: Paper Sections 3.1–3.4, Algorithm 1 and Appendix C
  • Resultados principales de habilidad, IES y accuracy: Paper Tables 2, 3, 9 and 10; repository summary_theta_mae_sd_se.csv and summary_pirt_mae_sd_se.csv
  • Split-half, related benchmarks and rank shifts: Paper Sections 4.4–4.5 and Table 4
  • Family and temporal generalization: Paper Section 4.6 and Table 5; repository experiments/arc_by_family_mixtral
  • MMLU extension and 2PL/3PL sensitivity: Paper Appendix G.3–G.5, Tables 12–14
  • Incorrect d transformation in mean–sigma linking: Official repository commit c0bc19b: scripts/02_wle_scoring.r lines 69–78 and README IRT Model equations; compared with paper's mirt predictor aθ+d
  • Impossible TinyBenchmarks RMSEA and missing released computation: Paper Table 1; repository experiments/baseline_compare/irt_tinybenchmark_items.r, which fits 3PL but never calls M2 or RMSEA
  • Exposure implementation omits never-selected items: Paper Appendix E equations 5–6 and Table 11; repository scripts/03_atlas_cat.r lines 454–504 and scripts/analysis/calculate_item_overlap.py lines 105–132
  • Recomputed exposure, unused items and maxima: All five repository selected_items.zip archives at commit c0bc19b; independent aggregation over the complete published parameter-bank sizes
  • Single Random100 sample: Repository experiments/baseline_compare/random_100.r lines 65–66 and one selected-items CSV per benchmark
  • Retrospective score lookup and selection-only timing: Repository scripts/03_atlas_cat.r item administration and time measurement; paper Appendix G.2
  • Raw versus calibrated bank count mismatch: Repository data/data.zip CSV headers, irt_item_parameters_combined.csv row counts, scripts/04_pirt_accuracy.r and scripts/05_compute_actual_acc.r
  • Artifact coverage, missing preprocessing provenance, environment and license: Complete file tree and git metadata of official repository commit c0bc19b; 436 tracked files
  • Visual inspection: All 24 pages of arXiv:2511.04689v3 rendered and visually inspected on 15 July 2026