In Silico Development of Psychometric Scales: Feasibility of Representative Population Data Simulation with LLMs

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Enrico Cipriani, Pavel Okopnyi, Danilo Menicucci, Simone Grassini

Palabras clave: synthetic respondents, psychometric scale development, factor analysis, measurement invariance, individual-level validity, preregistered studies

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
4
Hallazgos
4
Limitaciones
3
Evidencias

Resumen editorial

Español

Cuatro estudios prerregistrados examinan si GPT-4o-mini-2024-07-18 puede generar respuestas de participantes sintéticos útiles para desarrollar escalas antes de recoger datos humanos. El modelo recibe perfiles demográficos de cuotas representativas del Reino Unido y responde tres reformulaciones de cada prompt a temperatura 1; las respuestas se promedian por ítem. Los estudios comparan aproximadamente 300 personas reales y 300 simuladas cada uno: 316/322 en clima, 331/331 en ICT-SC25, 301/300 en SAGAT y 301/300 en AI Anxiety. En el primer estudio no se replica la estructura factorial ni la invariancia. En el segundo se replica la estructura, con invariancia configural y métrica parcial, pero las correlaciones por dimensión son solo 0,21–0,35 y el ICC individual 0,19. En los estudios tercero y cuarto, una EFA sintética propone estructuras que obtienen buen ajuste CFA en muestras humanas nuevas y alcanzan aproximadamente invariancia configural, métrica y escalar, pero no residual. En los cuatro estudios persisten diferencias de distribución y varianza, y las correlaciones entre datos humanos y sintéticos son débiles o cercanas a cero. Por ello, la evidencia respalda como máximo un uso exploratorio, grupal y temprano para proponer estructuras factoriales; no permite sustituir validación humana ni simular respuestas individuales. La invariancia de género dentro de los datos sintéticos tampoco prueba equidad humana: puede reflejar regularidad del generador. El estudio usa un solo modelo, un país, inglés y escalas Likert; además, imputa respuestas inválidas promediando otros prompts y reconoce una hipótesis mal especificada en el estudio 1. Los enlaces OSF se comprobaron, pero no ofrecieron mediante su API pública un paquete inmutable y auditable de código y datos.

English

Four preregistered studies test whether GPT-4o-mini-2024-07-18 can generate synthetic participant responses useful for scale development before human data collection. The model receives demographic profiles based on representative UK quotas and answers three reworded prompts per item at temperature 1; item responses are averaged. Each study compares about 300 real and 300 simulated participants: 316/322 for a climate scale, 331/331 for ICT-SC25, 301/300 for SAGAT, and 301/300 for AI Anxiety. Study 1 fails to reproduce the factor structure or invariance. Study 2 reproduces the structure with configural and partial metric invariance, but matching-dimension correlations are only 0.21–0.35 and individual-level ICC is 0.19. In Studies 3 and 4, EFA on synthetic data proposes structures that obtain good CFA fit in newly collected human samples and reach approximate configural, metric, and scalar invariance, but not residual invariance. Across all studies, distributional and variance discrepancies remain, while human–synthetic correlations are weak or near zero. The evidence therefore supports, at most, exploratory group-level early prototyping of factor structures; it does not support replacing human validation or simulating individual responses. Internal gender invariance within synthetic data does not establish human fairness and may simply reflect generator regularity. The work uses one model, one country, English, and Likert scales; invalid outputs are imputed by averaging other prompts, and Study 1 includes an acknowledged poorly specified hypothesis. The OSF links were checked, but their public API did not expose an immutable, auditable code-and-data package.

Pregunta de investigación

¿Puede una población sintética generada por un LLM reproducir estructuras factoriales y propiedades de medida humanas con utilidad para el desarrollo inicial de escalas?

Método

Cuatro estudios prerregistrados comparan muestras británicas reales y perfiles sintéticos. Dos replican escalas existentes y dos desarrollan escalas mediante EFA sintética seguida de CFA humana; se evalúan ajuste, invariancia, correlaciones, ICC, distribuciones y varianzas.

Muestra: Estudio 1: 316 humanos/322 sintéticos; estudio 2: 331/331; estudio 3: 301/300; estudio 4: 301/300.

Hallazgos

  • Tres de cuatro estructuras factoriales se replican o generalizan.
  • Los estudios 3 y 4 alcanzan invariancia aproximada hasta el nivel escalar, pero ninguno demuestra invariancia residual.
  • Las propiedades individuales, distribuciones y varianzas no se reproducen de forma fiable.
  • La utilidad observada se limita al prototipado factorial grupal temprano.

Limitaciones

  • Un solo modelo, inglés, Reino Unido y respuestas Likert.
  • Imputación de respuestas inválidas mediante otros prompts.
  • Hipótesis H3 del estudio 1 mal especificada y sin correspondencia individual válida.
  • Los enlaces OSF no permitieron auditar un paquete público inmutable mediante la API consultada.

Qué no demuestra

  • No valida sustitución de participantes humanos.
  • No reproduce personas individuales ni su covariación real.
  • No demuestra equidad de género en poblaciones humanas.
  • No garantiza validez externa, predictiva, clínica o intercultural.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2512.02910v2; complete 56-page PDF; four preregistered studies; OSF share links checked but no immutable public artifact manifest retrieved

Fuente consultada: https://arxiv.org/abs/2512.02910v2

Revisión: Codex full-text, 56-page visual, psychometric and artifact audit, 2026-07-18

Aprobación: Codex fidelity pass, 2026-07-18

Modelos evaluados

  • GPT-4o-mini-2024-07-18

Instrumentos y métricas

  • Climate-related scale
  • ICT-SC25
  • SAGAT
  • AI Anxiety Scale

Datos utilizados

  • Four UK Prolific quota samples
  • Four LLM-simulated demographic quota samples

Evidencia y localización

  • Muestras y protocolo de cuatro estudios: arXiv v2, methods for Studies 1–4
  • Invariancia y validez por estudio: arXiv v2, results and Tables 2–7
  • Síntesis de hipótesis: arXiv v2, Table 7 and general discussion