Cuatro estudios prerregistrados examinan si GPT-4o-mini-2024-07-18 puede generar respuestas de participantes sintéticos útiles para desarrollar escalas antes de recoger datos humanos. El modelo recibe perfiles demográficos de cuotas representativas del Reino Unido y responde tres reformulaciones de cada prompt a temperatura 1; las respuestas se promedian por ítem. Los estudios comparan aproximadamente 300 personas reales y 300 simuladas cada uno: 316/322 en clima, 331/331 en ICT-SC25, 301/300 en SAGAT y 301/300 en AI Anxiety. En el primer estudio no se replica la estructura factorial ni la invariancia. En el segundo se replica la estructura, con invariancia configural y métrica parcial, pero las correlaciones por dimensión son solo 0,21–0,35 y el ICC individual 0,19. En los estudios tercero y cuarto, una EFA sintética propone estructuras que obtienen buen ajuste CFA en muestras humanas nuevas y alcanzan aproximadamente invariancia configural, métrica y escalar, pero no residual. En los cuatro estudios persisten diferencias de distribución y varianza, y las correlaciones entre datos humanos y sintéticos son débiles o cercanas a cero. Por ello, la evidencia respalda como máximo un uso exploratorio, grupal y temprano para proponer estructuras factoriales; no permite sustituir validación humana ni simular respuestas individuales. La invariancia de género dentro de los datos sintéticos tampoco prueba equidad humana: puede reflejar regularidad del generador. El estudio usa un solo modelo, un país, inglés y escalas Likert; además, imputa respuestas inválidas promediando otros prompts y reconoce una hipótesis mal especificada en el estudio 1. Los enlaces OSF se comprobaron, pero no ofrecieron mediante su API pública un paquete inmutable y auditable de código y datos.
Pregunta de investigación
¿Puede una población sintética generada por un LLM reproducir estructuras factoriales y propiedades de medida humanas con utilidad para el desarrollo inicial de escalas?