Este trabajo propone usar LLM como respondedores virtuales para priorizar ítems psicométricos antes de una validación humana costosa. Su idea central son los mediadores: características, creencias, situaciones o valores que hacen que una misma puntuación de rasgo produzca respuestas distintas. GPT-4.1 genera mediadores libres, basados en las cinco categorías CAPS, condicionados por el ítem o derivados de preguntas del World Values Survey; perfiles demográficos reales forman otro baseline. GPT-4.1-mini simula 500 respondedores por condición, contesta cada ítem con dos órdenes de opciones y permite ordenar candidatos por su correlación de Spearman con la puntuación del rasgo en ítems oficiales. El estudio cubre Big Five, los diez valores de Schwartz y las 24 fortalezas VIA. Los ítems iniciales proceden de GPT-4o, GPT-4o-mini, Llama-3.1-8B y Llama-3.3-70B; se comparan selección aleatoria, juez LLM, ausencia de mediador, escalas oficiales y un oráculo definido con respuestas humanas.
La referencia humana procede de 339 participantes de Prolific, de los que 307 superan controles de duplicados y preguntas imposibles. Como los cuatro cuestionarios se administran por separado, cada matriz de validación contiene solo 75, 76, 80 y 76 personas. La estrategia de mediadores libres obtiene en Big Five CV=.632, percentil 99,3, NDCG=.568, DV=.294 y alfa=.904; en VIA obtiene CV=.586, percentil 88,5, NDCG=.657, DV=.296 y alfa=.803. Para Schwartz, CAPS es mejor en CV, .347 y percentil 87,1, con resultados y significación menos consistentes. En conjunto, los mediadores superan la selección aleatoria y la ausencia de mediador, la configuración completa suele ganar en las ablaciones y aumentar los respondedores hasta 500 mejora CV e ICR. Tres estudiantes de posgrado también consideran plausibles muestras de mediadores, aunque esa revisión no cubre todo el banco.
La conclusión válida es que la simulación puede servir como filtro de candidatos alrededor de un constructo y una escala ya existentes. No sustituye la validación psicométrica independiente. El criterio humano sigue limitado a 75-80 personas por encuesta y la selección y la evaluación reutilizan las mismas matrices de respuesta. La validez convergente es principalmente correlación con puntuaciones de ítems oficiales; no se demuestra estructura factorial, invariancia, validez de criterio, estabilidad test-retest o generalización a otra muestra. Las 500 simulaciones no crean 500 observaciones humanas independientes. Los mediadores son variables de prompt útiles, no pruebas de procesos cognitivos humanos ni de mediación causal, y el propio artículo reconoce que los LLM no reproducen perfectamente respuestas o psicología humanas.
La release MIT es amplia: código, prompts, respuestas, rankings y microdatos permiten inspeccionar el pipeline, pero no hay dependencias fijadas, tests científicos, CI de reproducción ni un comando end-to-end, y regenerar exige modelos y APIs no inmutables. La auditoría detecta además un problema serio de privacidad. Los cuatro CSV llamados anonymized conservan identificador, género, edad, país, ocupación, ingresos, educación, clase social y religión; la combinación de esos ocho campos es única para el 100% de las filas de cada encuesta. Aunque el paper informa de IRB, la release no aporta consentimiento, evaluación de riesgo de enlace ni justificación para publicar microdatos tan granulares. Los resultados agregados sostendrían la mayor parte de la reproducibilidad con mucho menor riesgo.