El artículo pregunta cuándo un benchmark de personas LLM puede ocupar el mismo lugar que un experimento de campo dentro del bucle de desarrollo de un método. Su respuesta no es que las personas reproduzcan a los humanos. Define una equivalencia mucho más estrecha: para el método que envía un artefacto y recibe feedback, cambiar evaluación humana por evaluación con personas es un simple cambio de panel si se cumplen dos condiciones. La observación solo agregada (AO) exige que el método vea únicamente el score final, sin votos individuales, identidades estables, orden ni canales laterales. La evaluación ciega al método (MB) exige que la distribución del score dependa solo del artefacto enviado, no del algoritmo que lo produjo, su identidad, procedencia o historial. Bajo esta definición, las leyes de todas las transcripciones adaptativas factorizan mediante un kernel condicionado por el artefacto. El paper prueba que esta propiedad, llamada just panel change (JPC), equivale a AO+MB y ofrece un contraejemplo donde filtrar votos individuales permite distinguir dos benchmarks con el mismo score agregado. El propio texto reconoce que el teorema puede parecer casi tautológico: JPC se define mediante la factorización que AO y MB proporcionan. Su aportación útil es convertir una afirmación ambigua de sustitución en dos requisitos de protocolo auditables. La construcción recíproca con un panel auxiliar demuestra equivalencia observacional, no que personas y humanos compartan mecanismo ni distribución de scores.
Después separa validez de interfaz y utilidad estadística. Para pares de artefactos separados al menos por una distancia r elegida por el usuario, fija una distribución de pares y define discriminabilidad mediante un cuantil inferior de divergencia KL. Bajo scores gaussianos con la misma varianza, esa cantidad se reduce a una relación señal-ruido robusta, kappa_Q(q). Si cada artefacto se evalúa L veces de forma independiente y se comparan medias, la probabilidad de invertir un par aleatorio queda acotada por q + exp(-L*kappa/2); elegir L mayor o igual que 2/kappa por log(1/delta) deja el límite en q+delta. Es una garantía distribucional sobre los pares elegidos, después de tolerar una fracción q de pares poco distinguibles, no una garantía uniforme para cualquier artefacto. L es el número por prompt, de modo que comparar dos requiere 2L evaluaciones. La fórmula principal supone paneles frescos e independientes, gaussianidad, varianza constante y comparación pareada no adaptativa. El anexo deriva la KL heterocedástica, pero no rehace con ella la calibración. Con q=0,05 y delta=0,05, el error total acotado es 0,10; no debe presentarse como una garantía del 95%.
El único estudio aplicado es una prueba de concepto sobre TextBO, no un experimento con personas. TextBO mejora prompts para generar anuncios en ocho campañas sintéticas. Cada anuncio se puntúa muestreando 200 perfiles de Twin-2K-500, condicionando Gemini 2.5 Flash con las respuestas de encuesta de cada perfil y la imagen, convirtiendo las log-probabilidades de 1 a 5 en un score esperado y promediando. El anexo usa diez pasos de mejora y diez variantes por paso: 100 pares por escenario. Para q=delta=0,05, la tabla da tamaños por prompt de 1.180, 259, 46, 637, 203, 46, 1.303 y 80. Cinco de ocho superan las 200 personas empleadas y tres superan 500. Hay además un error interno: el texto afirma rango 46-1.180 y media 460,25, pero la tabla y la fórmula dan 46-1.303 y media 469,25. El paper no informa cuántas repeticiones independientes se usaron para estimar medias y varianzas, cómo se obtuvo el cuantil con solo 100 pares, ni intervalos para kappa o L. Tampoco corrige selección adaptativa, comparaciones múltiples o incertidumbre del cuantil inferior, que depende aproximadamente de los cinco casos menos discriminables de cada escenario.
La auditoría de artefactos estrecha aún más la lectura. La versión completa actual de Twin-2K-500 contiene 2.058 PIDs y 2.058 resúmenes únicos, sin nulos ni duplicados; los resúmenes miden entre 11.602 y 18.482 caracteres y codifican demografía, actitudes y numerosas respuestas previas. Hugging Face solo ofrece un split llamado data. El código de TextBO crea su propio 80/20 ordenando lexicográficamente nombres pid_<número>: con la revisión auditada produce 1.646 perfiles train y 412 test, concentra 1.111 PID que empiezan por 1 en train y deja test únicamente con prefijos 6-9. No es un split aleatorio ni estratificado. Dentro de cada evaluación toma 200 perfiles sin reemplazo, aproximadamente 12,2% del pool, mientras la derivación supone evaluadores i.i.d. El script descarga siempre la revisión más reciente y el paper no fija la usada para la tabla.
El repositorio relacionado de TextBO compila, pero no incluye el cálculo de kappa, los scores de la Tabla 1, logs, imágenes, inputs de personas, seeds exactas ni un entorno bloqueado. Tampoco tiene tests, CI, tags o archivo de licencia; Ruff detecta 27 incidencias. El README reconoce que faltan carpetas y assets de rutas fijas. Los fallos de API o log-probabilidades se sustituyen silenciosamente por una distribución uniforme cuyo score es 3, aplanando el benchmark sin exponer el número de errores. El seed base se genera al azar, Gemini usa un alias no fechado y las dependencias solo tienen mínimos. Por tanto, la aritmética de la tabla es comprobable, pero el experimento no es reproducible de extremo a extremo. La evidencia sólida es conceptual: AO y MB son buenas preguntas de higiene y el tamaño necesario puede variar mucho según el canal sintético. No hay datos humanos, clicks, conversiones ni efectos causales. Más personas reducen ruido de muestreo alrededor del juez sintético; no corrigen sesgo sistemático, población no representativa ni invalidez del constructo.