El artículo evalúa si GPT-3.5 Turbo puede predecir respuestas individuales de la World Values Survey y si su concordancia varía por país, demografía, tema y número de opciones. Utiliza Wave 6 (2010–2014) para Estados Unidos, Japón, Singapur, Brasil, Sudáfrica y Suecia. Para cada encuestado convierte sexo observado, edad, educación, clase, etnia y covariables en un perfil verbal; añade una pregunta objetivo y pide al modelo que razone antes de elegir una opción, que evite respuestas políticamente correctas y que responda en la lengua del cuestionario para Suecia, Brasil y Japón. El paper identifica el modelo solo como GPT-3.5 Turbo, fija temperatura 0,2 y declara 100 simulaciones por muestra o encuestado, pero no publica snapshot, fecha de API, tamaño analítico por país o subgrupo, número total de peticiones, prompts completos, salidas ni código. La tarea principal compara la respuesta sintética con la respuesta real de la misma fila mediante Cohen kappa, Cramer V y acuerdo bruto. En el texto, las kappas medias por país son 0,239 para Estados Unidos, 0,165 para Suecia, 0,063 para Singapur, 0,034 para Brasil, 0,024 para Japón y 0,006 para Sudáfrica: incluso el mejor resultado representa concordancia baja o modesta, no una reproducción precisa de la opinión pública. El suplemento publica valores distintos, 0,257, 0,134, 0,059, 0,039, 0,026 y 0,001, respectivamente, sin reconciliarlos. A partir de solo seis observaciones nacionales, los autores correlacionan kappa con tres indicadores binarios y comunican 0,971 para cultura occidental, 0,557 para economía desarrollada y 0,101 para idioma inglés. No presentan intervalos, valores p ni un modelo multivariable, y cultura y desarrollo se solapan; además, esos coeficientes no se reconstruyen exactamente con los valores redondeados de la figura ni con la tabla suplementaria. Por tanto, muestran asociación exploratoria con seis casos, no que cultura, desarrollo o idioma causen las diferencias. En Estados Unidos, el suplemento informa mayor kappa para hombres que mujeres (0,275 frente a 0,257), White que Black (0,274 frente a 0,079), edades 65+ que 18–29 (0,310 frente a 0,134), clase upper que working (0,371 frente a 0,172) y educación universitaria que no universitaria (0,293 frente a 0,172). No hay tamaños de subgrupo, incertidumbre, ponderación declarada ni pruebas; kappa también cambia con prevalencia y composición de categorías, de modo que estas brechas son señales descriptivas, no estimaciones ajustadas de sesgo. En los análisis temáticos de EE. UU., la pregunta ambiental obtiene kappa 0,270 con cinco covariables y 0 sin ellas; la política obtiene 0,306 con ideología y 0,145 sin ella. La comparación no aísla la dificultad del tema porque cambia simultáneamente la pregunta, el resultado y el conjunto de covariables. El modelo genera 6,10 puntos porcentuales menos de la opción definida como liberal en ambiente y 16,33 puntos más en voto político, lo que evidencia dependencia temática y no una inclinación ideológica única. Reducir voto de cuatro opciones a dos eleva kappa de 0,109 a 0,306 y acuerdo de 29,21% a 65,92%, pero también excluye respuestas y cambia prevalencias, por lo que no demuestra que el número de opciones sea la única causa. Un control cambia solo el país del prompt de Estados Unidos a Japón y reduce kappa a 0,057; esto demuestra sensibilidad a la etiqueta nacional, no fidelidad a Japón. Wave 7 de Estados Unidos produce 0,379 frente a 0,306 en Wave 6, diferencia que el artículo denomina consistencia sin prueba de equivalencia. La contribución defendible es documentar que una simulación de encuesta condicionada por perfiles tiene concordancia desigual y generalmente limitada, y que sus errores dependen del contexto y del subgrupo. No sustenta sustituir encuestas, atribuir causalmente los fallos al entrenamiento ni usar estas generaciones como opinión pública real.
Pregunta de investigación
¿Con qué fidelidad GPT-3.5 Turbo reproduce respuestas de la World Values Survey, cómo varía esa concordancia entre seis países y subgrupos estadounidenses, y cómo cambia según el tema y el número de opciones?