LLM Personas as a Substitute for Field Experiments in Method Benchmarking

Personas, identidad y agentes2025arXivRevisión editorial aprobada

Autores: Enoch Hyunwook Kang

Palabras clave: LLM personas, Field-experiment benchmarking, Aggregate-only observation, Method-blind evaluation, KL discriminability, Sample complexity, TextBO, Digital twins

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

1
Autores
12
Hallazgos
19
Limitaciones
5
Evidencias

Resumen editorial

Español

El artículo pregunta cuándo un benchmark de personas LLM puede ocupar el mismo lugar que un experimento de campo dentro del bucle de desarrollo de un método. Su respuesta no es que las personas reproduzcan a los humanos. Define una equivalencia mucho más estrecha: para el método que envía un artefacto y recibe feedback, cambiar evaluación humana por evaluación con personas es un simple cambio de panel si se cumplen dos condiciones. La observación solo agregada (AO) exige que el método vea únicamente el score final, sin votos individuales, identidades estables, orden ni canales laterales. La evaluación ciega al método (MB) exige que la distribución del score dependa solo del artefacto enviado, no del algoritmo que lo produjo, su identidad, procedencia o historial. Bajo esta definición, las leyes de todas las transcripciones adaptativas factorizan mediante un kernel condicionado por el artefacto. El paper prueba que esta propiedad, llamada just panel change (JPC), equivale a AO+MB y ofrece un contraejemplo donde filtrar votos individuales permite distinguir dos benchmarks con el mismo score agregado. El propio texto reconoce que el teorema puede parecer casi tautológico: JPC se define mediante la factorización que AO y MB proporcionan. Su aportación útil es convertir una afirmación ambigua de sustitución en dos requisitos de protocolo auditables. La construcción recíproca con un panel auxiliar demuestra equivalencia observacional, no que personas y humanos compartan mecanismo ni distribución de scores.

Después separa validez de interfaz y utilidad estadística. Para pares de artefactos separados al menos por una distancia r elegida por el usuario, fija una distribución de pares y define discriminabilidad mediante un cuantil inferior de divergencia KL. Bajo scores gaussianos con la misma varianza, esa cantidad se reduce a una relación señal-ruido robusta, kappa_Q(q). Si cada artefacto se evalúa L veces de forma independiente y se comparan medias, la probabilidad de invertir un par aleatorio queda acotada por q + exp(-L*kappa/2); elegir L mayor o igual que 2/kappa por log(1/delta) deja el límite en q+delta. Es una garantía distribucional sobre los pares elegidos, después de tolerar una fracción q de pares poco distinguibles, no una garantía uniforme para cualquier artefacto. L es el número por prompt, de modo que comparar dos requiere 2L evaluaciones. La fórmula principal supone paneles frescos e independientes, gaussianidad, varianza constante y comparación pareada no adaptativa. El anexo deriva la KL heterocedástica, pero no rehace con ella la calibración. Con q=0,05 y delta=0,05, el error total acotado es 0,10; no debe presentarse como una garantía del 95%.

El único estudio aplicado es una prueba de concepto sobre TextBO, no un experimento con personas. TextBO mejora prompts para generar anuncios en ocho campañas sintéticas. Cada anuncio se puntúa muestreando 200 perfiles de Twin-2K-500, condicionando Gemini 2.5 Flash con las respuestas de encuesta de cada perfil y la imagen, convirtiendo las log-probabilidades de 1 a 5 en un score esperado y promediando. El anexo usa diez pasos de mejora y diez variantes por paso: 100 pares por escenario. Para q=delta=0,05, la tabla da tamaños por prompt de 1.180, 259, 46, 637, 203, 46, 1.303 y 80. Cinco de ocho superan las 200 personas empleadas y tres superan 500. Hay además un error interno: el texto afirma rango 46-1.180 y media 460,25, pero la tabla y la fórmula dan 46-1.303 y media 469,25. El paper no informa cuántas repeticiones independientes se usaron para estimar medias y varianzas, cómo se obtuvo el cuantil con solo 100 pares, ni intervalos para kappa o L. Tampoco corrige selección adaptativa, comparaciones múltiples o incertidumbre del cuantil inferior, que depende aproximadamente de los cinco casos menos discriminables de cada escenario.

La auditoría de artefactos estrecha aún más la lectura. La versión completa actual de Twin-2K-500 contiene 2.058 PIDs y 2.058 resúmenes únicos, sin nulos ni duplicados; los resúmenes miden entre 11.602 y 18.482 caracteres y codifican demografía, actitudes y numerosas respuestas previas. Hugging Face solo ofrece un split llamado data. El código de TextBO crea su propio 80/20 ordenando lexicográficamente nombres pid_<número>: con la revisión auditada produce 1.646 perfiles train y 412 test, concentra 1.111 PID que empiezan por 1 en train y deja test únicamente con prefijos 6-9. No es un split aleatorio ni estratificado. Dentro de cada evaluación toma 200 perfiles sin reemplazo, aproximadamente 12,2% del pool, mientras la derivación supone evaluadores i.i.d. El script descarga siempre la revisión más reciente y el paper no fija la usada para la tabla.

El repositorio relacionado de TextBO compila, pero no incluye el cálculo de kappa, los scores de la Tabla 1, logs, imágenes, inputs de personas, seeds exactas ni un entorno bloqueado. Tampoco tiene tests, CI, tags o archivo de licencia; Ruff detecta 27 incidencias. El README reconoce que faltan carpetas y assets de rutas fijas. Los fallos de API o log-probabilidades se sustituyen silenciosamente por una distribución uniforme cuyo score es 3, aplanando el benchmark sin exponer el número de errores. El seed base se genera al azar, Gemini usa un alias no fechado y las dependencias solo tienen mínimos. Por tanto, la aritmética de la tabla es comprobable, pero el experimento no es reproducible de extremo a extremo. La evidencia sólida es conceptual: AO y MB son buenas preguntas de higiene y el tamaño necesario puede variar mucho según el canal sintético. No hay datos humanos, clicks, conversiones ni efectos causales. Más personas reducen ruido de muestreo alrededor del juez sintético; no corrigen sesgo sistemático, población no representativa ni invalidez del constructo.

English

The paper asks when an LLM-persona benchmark can occupy the same position as a field experiment inside a method-development loop. Its answer is not that personas reproduce humans. It defines a much narrower equivalence: for a method that submits an artifact and receives feedback, replacing human evaluation with persona evaluation is merely a panel change if two conditions hold. Aggregate-only observation (AO) requires the method to see only the final score, without individual votes, stable identities, ordering, or side channels. Method-blind evaluation (MB) requires the score distribution to depend only on the submitted artifact, not on the algorithm that produced it, its identity, provenance, or interaction history. Under this definition, every adaptive transcript law factorizes through an artifact-conditioned kernel. The paper proves that this property, called just panel change (JPC), is equivalent to AO+MB and supplies a counterexample in which leaking individual votes distinguishes two benchmarks with the same aggregate score. The text itself acknowledges that the theorem can look almost tautological: JPC is defined through the factorization supplied by AO and MB. Its useful contribution is to turn an ambiguous substitution claim into two auditable protocol requirements. The converse auxiliary-panel construction proves observational equivalence, not that personas and humans share a mechanism or score distribution.

The paper then separates interface validity from statistical usefulness. For artifact pairs separated by at least a user-chosen distance r, it fixes a pair distribution and defines discriminability through a lower quantile of KL divergence. Under Gaussian scores with common variance, this becomes a q-robust signal-to-noise quantity, kappa_Q(q). If each artifact is evaluated independently L times and sample means are compared, the misordering probability for a random pair is bounded by q + exp(-L*kappa/2); choosing L at least 2/kappa times log(1/delta) makes the bound q+delta. This is a distributional guarantee over the chosen pairs after tolerating a q fraction of poorly separated pairs, not a uniform guarantee for every artifact. L is per prompt, so a comparison uses 2L persona evaluations. The main rule assumes fresh independent panels, Gaussianity, constant variance, and a non-adaptive pairwise comparison. An appendix derives heteroscedastic Gaussian KL but does not redo the reported calibration with it. With q=0.05 and delta=0.05, the total bound is 0.10; it should not be described as a 95% guarantee.

The only applied study is a TextBO proof of concept, not a human experiment. TextBO improves image-generation prompts for eight synthetic advertising campaigns. Each ad is scored by sampling 200 Twin-2K-500 profiles, conditioning Gemini 2.5 Flash on each profile's survey responses and the image, converting log-probabilities over 1-5 to an expected score, and averaging. The appendix uses ten improvement steps and ten variants per step, yielding 100 pairs per scenario. At q=delta=0.05, the table gives per-prompt sizes of 1,180, 259, 46, 637, 203, 46, 1,303, and 80. Five of eight exceed the deployed panel of 200 and three exceed 500. The paper also contains an internal error: the prose says a 46-1,180 range and 460.25 mean, while the table and formula give 46-1,303 and 469.25. It does not report how many independent repetitions estimated each mean and variance, how the lower quantile was estimated from only 100 pairs, or intervals for kappa and L. It also does not account for adaptive selection, multiple comparisons, or lower-tail quantile uncertainty, which is driven by roughly the five least-discriminable cases in each scenario.

Artifact auditing narrows the interpretation further. The current complete Twin-2K-500 full-persona snapshot has 2,058 unique PIDs and 2,058 unique nonempty summaries; summaries range from 11,602 to 18,482 characters and encode demographics, attitudes, and many prior survey answers. Hugging Face exposes only a split named data. TextBO creates its own 80/20 split by lexicographically sorting pid_<number> filenames: at the audited revision this yields 1,646 train and 412 test profiles, places 1,111 PIDs beginning with 1 in train, and leaves only prefixes 6-9 in test. It is not random or stratified. Each evaluation samples 200 profiles without replacement, about 12.2% of the pool, whereas the derivation assumes i.i.d. evaluators. The download script always selects the latest dataset revision, and the paper does not pin the revision used for its table.

The related TextBO repository compiles, but it contains no kappa calculation, Table 1 scores, logs, images, persona inputs, exact seeds, or locked environment. It also has no tests, CI, tags, or repository license file; Ruff reports 27 findings. The README acknowledges missing fixed-path folders and assets. API or log-probability failures are silently replaced by a uniform distribution with expected score 3, flattening the benchmark without exposing the error count. The base seed is randomly generated, Gemini uses an undated alias, and dependencies have only minimum versions. The table arithmetic can therefore be checked, but the experiment cannot be reproduced end to end. The supported contribution is conceptual: AO and MB are useful benchmark-hygiene questions, and the required panel size can vary widely with the synthetic channel. There are no human outcomes, clicks, conversions, or causal effects. Larger persona panels reduce sampling noise around the synthetic judge; they do not correct systematic bias, unrepresentative personas, or construct invalidity.

Pregunta de investigación

¿Bajo qué condiciones de interfaz puede sustituirse un panel humano por personas LLM sin cambiar la estructura de feedback que observa un método adaptativo, y cuántas evaluaciones persona necesita ese canal sintético para distinguir pares de artefactos a una resolución elegida?

Método

Trabajo teórico con una calibración aplicada. Modela el benchmark como panel, microinstrumento, agregación y kernel observable; define AO, MB y JPC; prueba JPC si y solo si AO+MB y presenta un contraejemplo por fuga de votos. Define un cuantil inferior de KL y, bajo scores gaussianos homocedásticos, deriva una cota de inversión pareada y una regla de tamaño muestral. El anexo aplica la regla a 800 pares TextBO, 100 por cada uno de ocho escenarios publicitarios sintéticos, evaluados con perfiles Twin-2K-500 y Gemini 2.5 Flash.

Muestra: No hay participantes humanos ni resultados de campo. La calibración declara ocho escenarios, diez pasos y diez variantes por paso: 100 pares por escenario y 800 en total. Cada score TextBO promedia 200 perfiles. La revisión completa actual de Twin-2K-500 tiene 2.058 perfiles; el código relacionado crea 1.646 train y 412 test mediante orden lexicográfico de PID, aunque la revisión exacta usada en la tabla no está fijada.

Hallazgos

  • JPC equivale a AO+MB en la interfaz definida: el método solo ve un agregado y el score depende del artefacto, no del método o procedencia.
  • La equivalencia permite que personas y humanos produzcan distribuciones de score completamente diferentes; no prueba concordancia.
  • La fuga de votos o identidades puede romper JPC incluso si el kernel agregado coincide.
  • Bajo gaussianidad homocedástica, L crece como 2/kappa por log(1/delta), con error distribucional acotado por q+delta.
  • Con q=delta=0,05, la cota total es 0,10, no 0,05.
  • Los tamaños de la tabla son 1.180, 259, 46, 637, 203, 46, 1.303 y 80 por prompt.
  • Cinco escenarios requieren más de 200 y tres más de 500 según la propia tabla.
  • El rango y media correctos son 46-1.303 y 469,25; el prose 46-1.180 y 460,25 es erróneo.
  • La prueba de concepto solo calibra un juez sintético de anuncios; no contiene outcomes humanos.
  • El dataset completo auditado tiene 2.058 PIDs únicos y resúmenes no vacíos, pero no un split oficial train/test.
  • El split TextBO 80/20 reproduce 1.646/412 perfiles y está fuertemente estructurado por el texto del PID.
  • Los artefactos públicos no permiten reproducir el cálculo de kappa ni la Tabla 1.

Limitaciones

  • JPC es una propiedad de factorización de interfaz y no una prueba empírica sobre personas o humanos.
  • La necesidad de AO está incorporada en la propia definición observacional de JPC.
  • La construcción de panel auxiliar no preserva la estructura real de los protocolos humano y persona.
  • La regla principal supone gaussianidad y varianza constante entre artefactos.
  • La garantía es sobre un par aleatorio de una distribución elegida y tolera una fracción q de pares malos.
  • La distancia r y la distribución de pares son decisiones dependientes de tarea y método.
  • Un edit de prompt no valida una distancia estable entre imágenes generadas estocásticamente.
  • Los 100 pares por escenario proceden de la trayectoria adaptativa de TextBO y no de todos los pares de un edit.
  • El cuantil 5% depende de muy pocos casos y no tiene intervalo ni sensibilidad.
  • No se explica el estimador de medias, varianzas y kappa ni el número de repeticiones independientes.
  • No se propaga incertidumbre de kappa al tamaño L.
  • No se corrigen comparaciones múltiples, selección adaptativa o reutilización del benchmark.
  • El muestreo real TextBO es sin reemplazo dentro de un pool finito, no i.i.d. exacto.
  • El split por nombre de PID no es aleatorio ni estratificado.
  • El dataset y los modelos no están versionados en el experimento.
  • Los errores de API se convierten en score neutral y pueden reducir artificialmente discriminabilidad.
  • No hay logs, inputs, imágenes, seeds, scores ni script de Tabla 1 publicados.
  • No hay tests, CI, release, licencia de repositorio ni entorno bloqueado en TextBO.
  • Los resultados se limitan a ocho briefs sintéticos de anuncios y un juez multimodal.

Qué no demuestra

  • Que las personas LLM reproduzcan o representen válidamente a participantes humanos.
  • Que scores de personas y humanos coincidan, correlacionen o tengan el mismo ranking.
  • Que un benchmark de personas estime efectos causales o resultados de un A/B test.
  • Que AO y MB se cumplan empíricamente en TextBO, Twin-2K-500 o evaluación humana.
  • Que humanos y LLM compartan mecanismos internos de evaluación.
  • Que aumentar el panel corrija sesgo sistemático del juez o representatividad de la población.
  • Que la Tabla 1 sea una garantía al 95%.
  • Que 200 personas basten en los ocho escenarios.
  • Que 500 personas sean una elección conservadora uniforme.
  • Que el rango 46-1.180 o la media 460,25 del prose sean correctos.
  • Que el cuantil y L estimados tengan incertidumbre pequeña.
  • Que la cota pareada se transfiera sin ajuste a optimización adaptativa.
  • Que un edit textual mida una diferencia mínima significativa entre anuncios.
  • Que el split TextBO sea oficial, aleatorio o estratificado.
  • Que los artefactos publicados reproduzcan la calibración.
  • Que el preprint haya superado revisión por pares o tenga publicación archival confirmada.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2512.21080v3, 20 pages; related TextBO code and complete Twin-2K-500 full-persona snapshot also audited

Fuente consultada: https://arxiv.org/abs/2512.21080v3

Revisión: Codex 20-page full-text visual, theorem/proof, sample-complexity, Table 1 arithmetic, TextBO code, complete Twin-2K-500 Parquet and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Gemini 2.5 Flash multimodal persona-conditioned judge
  • TextBO prompt-optimization system
  • Imagen 4.0 Ultra preview in the related public TextBO implementation

Instrumentos y métricas

  • Panel-instrument-aggregation benchmark model
  • Aggregate-only observation (AO)
  • Method-blind evaluation (MB)
  • Just panel change (JPC) transcript factorization
  • Pairwise KL discriminability
  • q-robust signal-to-noise kappa_Q(q)
  • Homoscedastic Gaussian pairwise sample-complexity bound
  • Heteroscedastic Gaussian KL extension
  • Persona-conditioned 1-5 ad-effectiveness log-probability score
  • TextBO clause-level prompt-edit distance

Datos utilizados

  • LLM-Digital-Twin/Twin-2K-500 full_persona
  • TextBO-generated synthetic ad campaigns and prompt-improvement pairs (not released with the calibration)

Evidencia y localización

  • Versión, autoría, fechas, categorías, DOI arXiv y licencia: Official arXiv record 2512.21080v3 checked 2026-07-16
  • Definiciones, teoremas, pruebas, contraejemplo, supuestos, fórmula, calibración, tabla y límites declarados: arXiv:2512.21080v3 PDF, 20 pages; every page rendered and visually inspected
  • Código, split, muestreo, fallbacks, dependencias, reproducibilidad y artefactos ausentes: Enoch-H-Kang/TextBO commit d95178651c99f3006605336f486433f6bc1037fe; compileall, AST and Ruff audit on 2026-07-16
  • Filas, PIDs, nulos, duplicados, tamaños de perfil y split reproducido: Complete seven-Parquet audit of LLM-Digital-Twin/Twin-2K-500@f883165a3026fde855dfd448e0cd16443ab257b6
  • Aritmética de Tabla 1, independencia, selección, incertidumbre y límites de afirmación: reports/verification/article-272-arxiv-interface-equivalence-ao-mb-kl-sample-complexity-textbo-persona-independence-and-claim-audit.json