Quantifying Data Contamination in Psychometric Evaluations of LLMs

Evaluación y validez psicométrica2026arXivRevisión editorial aprobada

Autores: Jongwook Han, Woojung Song, Jonggeun Lee, Yohan Jo

Palabras clave: data contamination, psychometric evaluation, item memorization, scoring knowledge, target-score matching, LLM evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
4
Hallazgos
4
Limitaciones
3
Evidencias

Resumen editorial

Español

El trabajo propone medir una supuesta contaminación de evaluaciones psicométricas de LLM mediante tres familias de tareas: reconstrucción semántica o de palabras en ítems, recuperación de la relación entre ítems y dimensiones o puntuaciones, y ajuste de respuestas para alcanzar una puntuación objetivo. Evalúa 21 modelos con BFI-44, PVQ-40, MFQ y Short Dark Triad, a temperatura 0,7, tres ejecuciones y intervalos de confianza del 95 %. Los promedios globales son 0,31 en reconstrucción semántica, 0,39 en palabras clave, F1 0,94 para asociar ítem y dimensión, MAE 0,44 al recuperar puntuaciones de opciones y MAE 0,45 al igualar objetivos; algunos modelos avanzados alcanzan MAE cercanos a 0,1–0,2. BFI y PVQ muestran resultados mayores que MFQ y SD-3. Sin embargo, las tareas revelan el texto, las dimensiones, las opciones o el objetivo, y por tanto pueden resolverse mediante inferencia semántica y razonamiento sin que el inventario estuviera en los datos de entrenamiento. La propia línea base de descripción genérica de dimensiones logra 0,32 en reconstrucción semántica, ligeramente por encima del promedio que el artículo interpreta como memorización. No hay acceso a corpus de entrenamiento, canarios, inventarios nuevos emparejados ni un diseño causal que conecte estas puntuaciones con sesgo en evaluaciones posteriores. El estudio ofrece un diagnóstico útil de familiaridad y conocimiento funcional de instrumentos, pero no identifica por sí solo contaminación ni demuestra memorización. El repositorio oficial contiene código y 19 pruebas que pasan en un entorno limpio, aunque no incluye las salidas del artículo y la reproducción integral depende de APIs y modelos mutables.

English

The paper proposes measuring alleged contamination in LLM psychometric evaluation through three task families: semantic or keyword reconstruction of inventory items, recovery of item-to-dimension and option-scoring knowledge, and response adjustment to match a target score. It evaluates 21 models on the BFI-44, PVQ-40, MFQ, and Short Dark Triad at temperature 0.7, with three runs and 95% confidence intervals. Reported overall averages are 0.31 for semantic reconstruction, 0.39 for keyword recovery, 0.94 F1 for item–dimension association, 0.44 MAE for option-score recovery, and 0.45 MAE for target matching; some advanced models reach approximately 0.1–0.2 target MAE. BFI and PVQ generally yield stronger results than MFQ and SD-3. These tasks, however, expose item text, dimensions, response options, or targets, so semantic inference and reasoning can solve them without training-set exposure. The paper’s own generic dimension-description baseline scores 0.32 on semantic reconstruction, slightly above the 0.31 mean interpreted as memorization. The design provides no training-corpus access, canaries, matched newly written inventories, or causal link between task scores and bias in downstream evaluations. It therefore supplies a useful diagnostic of instrument familiarity and functional scoring knowledge, but does not by itself identify contamination or prove memorization. The official repository contains runnable code and 19 tests that pass in a clean environment, but it does not commit the paper’s result outputs, and full reproduction depends on live, mutable model APIs.

Pregunta de investigación

¿Hasta qué punto distintos LLM muestran familiaridad con ítems, reglas de puntuación y objetivos de cuatro inventarios psicométricos, y puede esa familiaridad interpretarse válidamente como contaminación?

Método

Veintiún modelos completan tareas de reconstrucción, asociación ítem-dimensión, recuperación de puntuaciones y ajuste a objetivos sobre BFI-44, PVQ-40, MFQ y SD-3. Se ejecutan tres réplicas a temperatura 0,7 y se informan similitud semántica, recuperación de palabras, F1 y MAE con intervalos del 95 %. La auditoría contrasta además las tareas con sus baselines y ejecuta las pruebas del repositorio oficial.

Muestra: Veintiún modelos, cuatro inventarios, tres ejecuciones por configuración y temperatura 0,7; el artículo compara descriptivamente familias y niveles de capacidad.

Hallazgos

  • La asociación ítem-dimensión es alta en promedio (F1 0,94), mientras la reconstrucción semántica media es 0,31.
  • Los modelos avanzados ajustan mejor puntuaciones objetivo, con MAE aproximados de 0,1–0,2 en varios casos.
  • BFI-44 y PVQ-40 muestran mayor familiaridad funcional que MFQ y SD-3.
  • La línea base semántica de 0,32 impide interpretar limpiamente el promedio de 0,31 como memorización.

Limitaciones

  • Las tareas permiten inferencia semántica porque exponen información decisiva.
  • No se observa el corpus de entrenamiento ni se usan canarios o inventarios novedosos emparejados.
  • Tres réplicas son insuficientes para caracterizar ampliamente variación estocástica.
  • El repositorio no contiene las salidas exactas y depende de servicios mutables.

Qué no demuestra

  • No prueba que los ítems estuvieran en los datos de entrenamiento.
  • No identifica memorización como causa frente a razonamiento o conocimiento general.
  • No demuestra que la familiaridad medida sesgue una evaluación psicométrica concreta.
  • No valida que las puntuaciones de inventarios representen rasgos internos del modelo.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2510.07175v2; Findings of EACL 2026; complete 19-page PDF and TeX source; official repository commit da921a5e9b43a031e95ad005e92af92dddd2e049

Fuente consultada: https://arxiv.org/abs/2510.07175v2

Revisión: Codex full-text, visual, construct-validity and repository audit, 2026-07-18

Aprobación: Codex fidelity pass, 2026-07-18

Modelos evaluados

  • 21 LLMs from major proprietary and open model families

Instrumentos y métricas

  • BFI-44
  • PVQ-40
  • Moral Foundations Questionnaire (MFQ)
  • Short Dark Triad (SD-3)

Datos utilizados

  • Original questionnaire items and scoring rules for four inventories

Evidencia y localización

  • Diseño, 21 modelos y cuatro inventarios: arXiv v2, sections 3–4 and Tables 1–2
  • Resultados agregados y por inventario: arXiv v2, section 5, Figures 2–5 and appendix tables
  • Baseline semántico y límites de identificación: arXiv v2, item-memorization experiments and Appendix; repository audit