El trabajo propone medir una supuesta contaminación de evaluaciones psicométricas de LLM mediante tres familias de tareas: reconstrucción semántica o de palabras en ítems, recuperación de la relación entre ítems y dimensiones o puntuaciones, y ajuste de respuestas para alcanzar una puntuación objetivo. Evalúa 21 modelos con BFI-44, PVQ-40, MFQ y Short Dark Triad, a temperatura 0,7, tres ejecuciones y intervalos de confianza del 95 %. Los promedios globales son 0,31 en reconstrucción semántica, 0,39 en palabras clave, F1 0,94 para asociar ítem y dimensión, MAE 0,44 al recuperar puntuaciones de opciones y MAE 0,45 al igualar objetivos; algunos modelos avanzados alcanzan MAE cercanos a 0,1–0,2. BFI y PVQ muestran resultados mayores que MFQ y SD-3. Sin embargo, las tareas revelan el texto, las dimensiones, las opciones o el objetivo, y por tanto pueden resolverse mediante inferencia semántica y razonamiento sin que el inventario estuviera en los datos de entrenamiento. La propia línea base de descripción genérica de dimensiones logra 0,32 en reconstrucción semántica, ligeramente por encima del promedio que el artículo interpreta como memorización. No hay acceso a corpus de entrenamiento, canarios, inventarios nuevos emparejados ni un diseño causal que conecte estas puntuaciones con sesgo en evaluaciones posteriores. El estudio ofrece un diagnóstico útil de familiaridad y conocimiento funcional de instrumentos, pero no identifica por sí solo contaminación ni demuestra memorización. El repositorio oficial contiene código y 19 pruebas que pasan en un entorno limpio, aunque no incluye las salidas del artículo y la reproducción integral depende de APIs y modelos mutables.
Pregunta de investigación
¿Hasta qué punto distintos LLM muestran familiaridad con ítems, reglas de puntuación y objetivos de cuatro inventarios psicométricos, y puede esa familiaridad interpretarse válidamente como contaminación?