Psychometric Item Validation Using Virtual Respondents with Trait-Response Mediators

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Sungjib Lim, Woojung Song, Eun-Ju Lee, Yohan Jo

Palabras clave: Large Language Models, Psychometric item validation, Virtual respondents, Trait-response mediators, Construct validity, Survey development, Big Five, Schwartz values, Values in Action

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
9
Hallazgos
15
Limitaciones
5
Evidencias

Resumen editorial

Español

Este trabajo propone usar LLM como respondedores virtuales para priorizar ítems psicométricos antes de una validación humana costosa. Su idea central son los mediadores: características, creencias, situaciones o valores que hacen que una misma puntuación de rasgo produzca respuestas distintas. GPT-4.1 genera mediadores libres, basados en las cinco categorías CAPS, condicionados por el ítem o derivados de preguntas del World Values Survey; perfiles demográficos reales forman otro baseline. GPT-4.1-mini simula 500 respondedores por condición, contesta cada ítem con dos órdenes de opciones y permite ordenar candidatos por su correlación de Spearman con la puntuación del rasgo en ítems oficiales. El estudio cubre Big Five, los diez valores de Schwartz y las 24 fortalezas VIA. Los ítems iniciales proceden de GPT-4o, GPT-4o-mini, Llama-3.1-8B y Llama-3.3-70B; se comparan selección aleatoria, juez LLM, ausencia de mediador, escalas oficiales y un oráculo definido con respuestas humanas.

La referencia humana procede de 339 participantes de Prolific, de los que 307 superan controles de duplicados y preguntas imposibles. Como los cuatro cuestionarios se administran por separado, cada matriz de validación contiene solo 75, 76, 80 y 76 personas. La estrategia de mediadores libres obtiene en Big Five CV=.632, percentil 99,3, NDCG=.568, DV=.294 y alfa=.904; en VIA obtiene CV=.586, percentil 88,5, NDCG=.657, DV=.296 y alfa=.803. Para Schwartz, CAPS es mejor en CV, .347 y percentil 87,1, con resultados y significación menos consistentes. En conjunto, los mediadores superan la selección aleatoria y la ausencia de mediador, la configuración completa suele ganar en las ablaciones y aumentar los respondedores hasta 500 mejora CV e ICR. Tres estudiantes de posgrado también consideran plausibles muestras de mediadores, aunque esa revisión no cubre todo el banco.

La conclusión válida es que la simulación puede servir como filtro de candidatos alrededor de un constructo y una escala ya existentes. No sustituye la validación psicométrica independiente. El criterio humano sigue limitado a 75-80 personas por encuesta y la selección y la evaluación reutilizan las mismas matrices de respuesta. La validez convergente es principalmente correlación con puntuaciones de ítems oficiales; no se demuestra estructura factorial, invariancia, validez de criterio, estabilidad test-retest o generalización a otra muestra. Las 500 simulaciones no crean 500 observaciones humanas independientes. Los mediadores son variables de prompt útiles, no pruebas de procesos cognitivos humanos ni de mediación causal, y el propio artículo reconoce que los LLM no reproducen perfectamente respuestas o psicología humanas.

La release MIT es amplia: código, prompts, respuestas, rankings y microdatos permiten inspeccionar el pipeline, pero no hay dependencias fijadas, tests científicos, CI de reproducción ni un comando end-to-end, y regenerar exige modelos y APIs no inmutables. La auditoría detecta además un problema serio de privacidad. Los cuatro CSV llamados anonymized conservan identificador, género, edad, país, ocupación, ingresos, educación, clase social y religión; la combinación de esos ocho campos es única para el 100% de las filas de cada encuesta. Aunque el paper informa de IRB, la release no aporta consentimiento, evaluación de riesgo de enlace ni justificación para publicar microdatos tan granulares. Los resultados agregados sostendrían la mayor parte de la reproducibilidad con mucho menor riesgo.

English

This work proposes using LLMs as virtual respondents to prioritize psychometric items before costly human validation. Its central idea is the trait-response mediator: a characteristic, belief, situation, or value that can make the same trait level yield different item responses. GPT-4.1 generates free mediators, mediators based on the five CAPS categories, item-conditioned mediators, and mediators derived from World Values Survey questions; observed human demographic profiles form another baseline. GPT-4.1-mini simulates 500 respondents per condition, answers each item under two option orders, and enables candidate ranking by Spearman correlation with the intended trait score on official items. The study covers the Big Five, ten Schwartz values, and 24 VIA strengths. Initial items come from GPT-4o, GPT-4o-mini, Llama-3.1-8B, and Llama-3.3-70B; comparisons include random selection, an LLM judge, no mediator, official scales, and an oracle defined from human responses.

Human reference data come from 339 Prolific participants, 307 of whom pass duplicate and impossible-item attention checks. Because four questionnaires are administered separately, each validation matrix contains only 75, 76, 80, or 76 people. Free mediators reach CV=.632, the 99.3rd percentile, NDCG=.568, DV=.294, and alpha=.904 on Big Five; on VIA they reach CV=.586, the 88.5th percentile, NDCG=.657, DV=.296, and alpha=.803. CAPS is strongest on Schwartz CV at .347 and the 87.1st percentile, with less consistent results and significance comparisons. Overall, mediator conditions outperform random and no-mediator selection, the complete prompt usually wins the ablations, and increasing virtual respondents toward 500 improves CV and ICR. Three graduate students also judge sampled mediators plausible, although this review does not cover the full bank.

The defensible conclusion is that simulation can act as a candidate-screening heuristic around an existing construct and scale. It does not replace independent psychometric validation. The human criterion still contains only 75-80 people per survey, while selection and evaluation reuse the same response matrices. Convergent validity is mainly correlation with official-item scores; the study does not establish factor structure, measurement invariance, criterion validity, test-retest stability, or replication in a new sample. Five hundred simulated respondents do not create five hundred independent human observations. Mediators are useful prompt variables rather than evidence of human cognitive processes or causal mediation, and the paper explicitly acknowledges that LLMs do not perfectly reproduce human responses or psychology.

The MIT release is extensive: code, prompts, responses, rankings, and microdata make the pipeline inspectable, but dependencies are not pinned, there are no scientific tests or reproduction CI, no one-command end-to-end run, and regeneration depends on mutable model services. The audit also finds a serious privacy problem. Four CSV files named anonymized retain participant identifier, gender, age, country, occupation, income, education, social class, and religion; the joint eight-field profile is unique for 100% of rows in every survey. Although the paper reports IRB approval, the release does not provide consent language, a linkage-risk assessment, or a rationale for publishing such granular microdata. Aggregate results would preserve most reproducibility with substantially lower risk.

Pregunta de investigación

¿Puede una población de respondedores virtuales, diversificada mediante factores que median entre rasgo y respuesta, priorizar ítems generados con alta validez convergente, baja asociación con rasgos no objetivo y buena consistencia en respuestas humanas?

Método

Generación de bancos de ítems con cuatro LLM, construcción de mediadores con GPT-4.1, simulación de 500 respondedores por condición con GPT-4.1-mini y dos órdenes de respuesta, ranking por correlación con scores de escalas oficiales, selección top-N y evaluación CV/DV/NDCG/alfa frente a respuestas humanas, baselines y ablaciones.

Muestra: 339 personas reclutadas y 307 retenidas tras controles; 75 Big Five, 76 PVQ, 80 VIA parte 1 y 76 VIA parte 2. La simulación principal usa 500 respondedores virtuales por estrategia y encuesta, pero esas observaciones comparten el mismo pequeño criterio humano.

Hallazgos

  • Las 23 páginas de arXiv v4 y todos los apéndices se renderizaron e inspeccionaron visualmente.
  • El paper está aceptado para TACL 2026 y su PDF tiene SHA-256 6b2991c8b83f1386b24380a0894bd328d57f4522cac32c54541b80c48455e64a.
  • En Big Five, Trait Free alcanza CV .632, percentil 99,3, NDCG .568, DV .294 e ICR .904.
  • En Schwartz, Trait CAPS alcanza CV .347 y percentil 87,1; las comparaciones son menos consistentes.
  • En VIA, Trait Free alcanza CV .586, percentil 88,5, NDCG .657, DV .296 e ICR .803.
  • La configuración completa con rasgo, mediador y persona suele superar ablaciones parciales.
  • Aumentar la simulación hacia 500 respondedores mejora sobre todo CV e ICR.
  • El repositorio MIT contiene código, datos humanos, resultados de simulación y rankings en el commit auditado.
  • Todos los perfiles conjuntos de ocho cuasi-identificadores son únicos en los cuatro CSV humanos publicados.

Limitaciones

  • Cada encuesta tiene solo 75-80 participantes humanos retenidos.
  • La selección y la evaluación reutilizan la misma matriz humana y no hay cohorte holdout.
  • La métrica CV reduce validez de constructo a correlación con una escala oficial ya existente.
  • No se valida estructura factorial, invariancia, test-retest, validez de criterio o sensibilidad al cambio.
  • La simulación requiere una escala oficial y por ello no resuelve por sí sola el desarrollo de constructos nuevos.
  • Los respondedores virtuales no aumentan la cantidad de información humana independiente.
  • No se propaga la incertidumbre de la muestra humana pequeña a los rankings finales.
  • Las numerosas comparaciones, métricas y ablaciones no tienen un ajuste global de multiplicidad.
  • DV es difícil de interpretar cuando los rasgos psicológicos están correlacionados.
  • La revisión humana de mediadores usa solo tres estudiantes y una muestra pequeña.
  • Solo se estudian tres teorías, instrumentos en inglés y un conjunto limitado de modelos.
  • Regenerar resultados depende de versiones no inmutables y acceso de pago a APIs.
  • El repositorio carece de lockfile, tests científicos, CI y un pipeline end-to-end reproducible.
  • Los microdatos conservan cuasi-identificadores suficientes para un riesgo alto de reidentificación por enlace.
  • No se publica consentimiento, evaluación de riesgo de privacidad o licencia específica de los microdatos.

Qué no demuestra

  • No demuestra que los LLM simulen fielmente psicología o respuestas humanas.
  • No demuestra mediación causal ni mecanismos cognitivos internos.
  • No sustituye una muestra humana independiente por 500 personas sintéticas.
  • No valida escalas para uso diagnóstico, selección de personal o decisiones de alto impacto.
  • No establece validez completa de constructo a partir de CV, DV e ICR.
  • No demuestra generalización a idiomas, culturas, modelos o poblaciones no estudiadas.
  • No justifica que los microdatos publicados sean anónimos o seguros frente a linkage.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2507.05890v4, submitted 8 July 2025, revised 25 May 2026, 23 pages; accepted for publication at TACL 2026

Fuente consultada: https://arxiv.org/abs/2507.05890

Revisión: Codex complete 23-page full-text, all-page visual, TeX source, construct-validity, human-sample, statistics, code, outputs, privacy and reproducibility audit; summaries written from the complete paper rather than abstract extraction, 2026-07-18

Aprobación: Codex fidelity pass, 2026-07-18

Modelos evaluados

  • GPT-4o
  • GPT-4o-mini
  • Llama-3.1-8B-Instruct
  • Llama-3.3-70B-Instruct
  • GPT-4.1 for mediator generation
  • GPT-4.1-mini for virtual respondents and the LLM-as-a-judge baseline
  • GPT-4.1-nano, Llama-4-Scout and additional Llama models in simulation-model ablations

Instrumentos y métricas

  • 50-item IPIP Big Five representation
  • Portrait Values Questionnaire PVQ-40
  • VIA-IS-M with 96 items
  • World Values Survey statements
  • CAPS mediator categories
  • Convergent validity from intended-trait Spearman correlation
  • Discriminant validity from mean absolute non-target correlation
  • NDCG, NDCG@N and empirical percentile
  • Cronbach alpha on retained human responses
  • Paired bootstrap significance comparisons

Datos utilizados

  • Four LLM-generated candidate-item pools for Big Five, PVQ and VIA
  • 500 PersonaChat profiles used in a mediator baseline
  • World Values Survey questionnaire statements used for mediator generation
  • Four released Prolific response CSV files with 307 retained survey completions in total
  • Public generated mediators, prompts, simulation outputs, rankings and evaluation JSON files

Evidencia y localización

  • Texto, figuras, tablas, limitaciones, prompts y apéndices: arXiv:2507.05890v4, all 23/23 pages rendered and visually inspected
  • Diseño, muestras humanas, modelos, métricas y resultados: Main paper sections 3-9 and appendices A-L
  • Código, outputs, licencia y reproducibilidad: Official GitHub repository holi-lab/Psychometric-Item-Validation at commit 798253a4b123865e5a5add337c8fbcf55d29ff03
  • Riesgo de reidentificación de respuestas humanas: All four released anonymized CSV files; uniqueness audit over gender, age, country, occupation, income, education, social class and religion
  • Auditoría metodológica, estadística, de artefactos y privacidad: reports/verification/article-020-virtual-respondents-construct-validity-human-data-code-and-reproducibility-audit.json