Performance and biases of Large Language Models in public opinion simulation

Sociedad, cultura y comportamiento colectivo2024NatureRevisión editorial aprobada

Título original: Performance and Biases of Large Language Models in Simulating Public Opinion

Autores: Yao Qu, Jue Wang

Palabras clave: Large Language Models, Public opinion simulation, World Values Survey, Bias, Cultural differences

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
22
Hallazgos
42
Limitaciones
9
Evidencias

Resumen editorial

Español

El artículo evalúa si GPT-3.5 Turbo puede predecir respuestas individuales de la World Values Survey y si su concordancia varía por país, demografía, tema y número de opciones. Utiliza Wave 6 (2010–2014) para Estados Unidos, Japón, Singapur, Brasil, Sudáfrica y Suecia. Para cada encuestado convierte sexo observado, edad, educación, clase, etnia y covariables en un perfil verbal; añade una pregunta objetivo y pide al modelo que razone antes de elegir una opción, que evite respuestas políticamente correctas y que responda en la lengua del cuestionario para Suecia, Brasil y Japón. El paper identifica el modelo solo como GPT-3.5 Turbo, fija temperatura 0,2 y declara 100 simulaciones por muestra o encuestado, pero no publica snapshot, fecha de API, tamaño analítico por país o subgrupo, número total de peticiones, prompts completos, salidas ni código. La tarea principal compara la respuesta sintética con la respuesta real de la misma fila mediante Cohen kappa, Cramer V y acuerdo bruto. En el texto, las kappas medias por país son 0,239 para Estados Unidos, 0,165 para Suecia, 0,063 para Singapur, 0,034 para Brasil, 0,024 para Japón y 0,006 para Sudáfrica: incluso el mejor resultado representa concordancia baja o modesta, no una reproducción precisa de la opinión pública. El suplemento publica valores distintos, 0,257, 0,134, 0,059, 0,039, 0,026 y 0,001, respectivamente, sin reconciliarlos. A partir de solo seis observaciones nacionales, los autores correlacionan kappa con tres indicadores binarios y comunican 0,971 para cultura occidental, 0,557 para economía desarrollada y 0,101 para idioma inglés. No presentan intervalos, valores p ni un modelo multivariable, y cultura y desarrollo se solapan; además, esos coeficientes no se reconstruyen exactamente con los valores redondeados de la figura ni con la tabla suplementaria. Por tanto, muestran asociación exploratoria con seis casos, no que cultura, desarrollo o idioma causen las diferencias. En Estados Unidos, el suplemento informa mayor kappa para hombres que mujeres (0,275 frente a 0,257), White que Black (0,274 frente a 0,079), edades 65+ que 18–29 (0,310 frente a 0,134), clase upper que working (0,371 frente a 0,172) y educación universitaria que no universitaria (0,293 frente a 0,172). No hay tamaños de subgrupo, incertidumbre, ponderación declarada ni pruebas; kappa también cambia con prevalencia y composición de categorías, de modo que estas brechas son señales descriptivas, no estimaciones ajustadas de sesgo. En los análisis temáticos de EE. UU., la pregunta ambiental obtiene kappa 0,270 con cinco covariables y 0 sin ellas; la política obtiene 0,306 con ideología y 0,145 sin ella. La comparación no aísla la dificultad del tema porque cambia simultáneamente la pregunta, el resultado y el conjunto de covariables. El modelo genera 6,10 puntos porcentuales menos de la opción definida como liberal en ambiente y 16,33 puntos más en voto político, lo que evidencia dependencia temática y no una inclinación ideológica única. Reducir voto de cuatro opciones a dos eleva kappa de 0,109 a 0,306 y acuerdo de 29,21% a 65,92%, pero también excluye respuestas y cambia prevalencias, por lo que no demuestra que el número de opciones sea la única causa. Un control cambia solo el país del prompt de Estados Unidos a Japón y reduce kappa a 0,057; esto demuestra sensibilidad a la etiqueta nacional, no fidelidad a Japón. Wave 7 de Estados Unidos produce 0,379 frente a 0,306 en Wave 6, diferencia que el artículo denomina consistencia sin prueba de equivalencia. La contribución defendible es documentar que una simulación de encuesta condicionada por perfiles tiene concordancia desigual y generalmente limitada, y que sus errores dependen del contexto y del subgrupo. No sustenta sustituir encuestas, atribuir causalmente los fallos al entrenamiento ni usar estas generaciones como opinión pública real.

English

The article evaluates whether GPT-3.5 Turbo can predict individual World Values Survey responses and whether agreement varies by country, demographics, topic, and number of response options. It uses Wave 6 (2010–2014) for the United States, Japan, Singapore, Brazil, South Africa, and Sweden. For each respondent, observed sex, age, education, class, ethnicity, and covariates are converted into a verbal profile; a target question is added, and the model is asked to reason before selecting an option, to avoid politically correct answers, and to respond in the questionnaire language for Sweden, Brazil, and Japan. The paper identifies the model only as GPT-3.5 Turbo, sets temperature to 0.2, and reports 100 simulations per sample or respondent, but it releases no snapshot, API date, analytic sample size by country or subgroup, total request count, complete prompts, generations, or code. The primary task compares a synthetic answer with the real answer in the same row using Cohen's kappa, Cramer's V, and raw agreement. In the main text, mean country kappas are 0.239 for the United States, 0.165 for Sweden, 0.063 for Singapore, 0.034 for Brazil, 0.024 for Japan, and 0.006 for South Africa: even the best result is low-to-modest agreement, not accurate recovery of public opinion. The supplement reports different values, 0.257, 0.134, 0.059, 0.039, 0.026, and 0.001, respectively, without reconciling them. From only six country observations, the authors correlate kappa with three binary indicators and report 0.971 for Western culture, 0.557 for developed economy, and 0.101 for English language. No intervals, p values, or multivariable model are provided, and culture overlaps with development; the coefficients also cannot be reconstructed exactly from either the rounded figure values or the supplementary table. These are exploratory six-case associations, not evidence that culture, development, or language causes the differences. For the United States, the supplement reports higher kappa for men than women (0.275 versus 0.257), White than Black respondents (0.274 versus 0.079), ages 65+ than 18–29 (0.310 versus 0.134), upper than working class (0.371 versus 0.172), and university than non-university education (0.293 versus 0.172). Subgroup sizes, uncertainty, declared weighting, and tests are absent; kappa also varies with prevalence and category composition, so these gaps are descriptive signals rather than adjusted bias estimates. In U.S. topic analyses, the environmental item reaches kappa 0.270 with five covariates and zero without them; the political item reaches 0.306 with ideology and 0.145 without it. This does not isolate topic difficulty because the question, outcome, and covariate set all change. The model generates 6.10 percentage points fewer responses defined as liberal for the environmental item and 16.33 points more for political voting, demonstrating topic dependence rather than one stable ideological leaning. Reducing voting from four options to two raises kappa from 0.109 to 0.306 and agreement from 29.21% to 65.92%, but it also excludes responses and changes prevalence, so option count is not isolated as the cause. A control changes only the country label for U.S. Wave 6 data to Japan and reduces kappa to 0.057; this establishes sensitivity to the label, not fidelity to Japan. U.S. Wave 7 yields 0.379 versus 0.306 for Wave 6, a difference the paper calls consistency without an equivalence analysis. The defensible contribution is evidence that profile-conditioned survey simulation has unequal and generally limited agreement whose errors depend on context and subgroup. It does not support replacing surveys, causally locating failures in training data, or treating generations as real public opinion.

Pregunta de investigación

¿Con qué fidelidad GPT-3.5 Turbo reproduce respuestas de la World Values Survey, cómo varía esa concordancia entre seis países y subgrupos estadounidenses, y cómo cambia según el tema y el número de opciones?

Método

Se transforman filas individuales de WVS Wave 6 en prompts de persona con variables demográficas y covariables, se generan 100 respuestas por caso a temperatura 0,2 y se comparan con la respuesta humana mediante Cohen kappa, Cramer V y acuerdo. Se contrastan seis países, subgrupos de EE. UU., preguntas ambientales y políticas y versiones de voto con dos o cuatro opciones. La auditoría editorial leyó y renderizó las 13 páginas y las seis páginas del suplemento DOCX, verificó tablas, recalculó la lógica de los seis casos nacionales y buscó datos y código públicos.

Muestra: Seis países de WVS Wave 6 y un análisis suplementario de EE. UU. Wave 7. El artículo afirma realizar 100 simulaciones por muestra o encuestado, pero no informa cuántas filas sobreviven a la selección y datos completos en cada país, tema o subgrupo, ni el total de generaciones. Sin esos N no pueden evaluarse cobertura, ponderación, precisión o estabilidad de las kappas.

Hallazgos

  • La versión de registro se publicó el 28 de agosto de 2024 en Humanities and Social Sciences Communications 11, artículo 1095.
  • El análisis usa WVS Wave 6 de seis países recogidos entre 2010 y 2014.
  • GPT-3.5 Turbo se ejecuta a temperatura 0,2, pero el snapshot y la fecha de la API no se identifican.
  • Se condiciona cada respuesta con demografía, covariables y país y se solicitan 100 simulaciones por caso.
  • El texto principal informa kappa 0,239 para Estados Unidos, el mejor país de los seis.
  • Suecia, Singapur, Brasil, Japón y Sudáfrica muestran kappas aproximadas de 0,165, 0,063, 0,034, 0,024 y 0,006 en la figura principal.
  • Las kappas suplementarias no coinciden: 0,257, 0,134, 0,059, 0,039, 0,026 y 0,001 para esos mismos países.
  • Las correlaciones publicadas de kappa son 0,971 con cultura occidental, 0,557 con economía desarrollada y 0,101 con idioma inglés.
  • Esas correlaciones se calculan con solo seis países y tres predictores binarios parcialmente confundidos.
  • En EE. UU., el suplemento informa kappa 0,275 para hombres y 0,257 para mujeres.
  • Por etnia, las kappas son 0,274 White, 0,079 Black, 0,321 Other, 0,242 Hispanic y 0,218 para dos o más razas.
  • Por edad, kappa crece de 0,134 en 18–29 a 0,310 en 65+.
  • Por clase, kappa es 0,371 upper, 0,331 upper middle, 0,281 lower middle, 0,172 working y 0,196 lower.
  • Educación universitaria obtiene kappa 0,293 frente a 0,172 sin universidad, aunque el acuerdo bruto es 65,16% frente a 65,44%.
  • La pregunta ambiental alcanza kappa 0,270 con cinco covariables y 0 sin ellas.
  • La pregunta política alcanza kappa 0,306 con ideología y 0,145 sin covariable.
  • La proporción liberal sintética difiere -6,10 puntos en ambiente y +16,33 en política respecto de WVS.
  • Reducir voto político de cuatro a dos opciones eleva kappa de 0,109 a 0,306 y acuerdo de 29,21% a 65,92%.
  • Cambiar a Japón la etiqueta nacional de filas estadounidenses reduce kappa de 0,306 a 0,057.
  • La comparación estadounidense Wave 7 obtiene kappa 0,379, Cramer V 0,415 y acuerdo 67,65%.
  • Los datos generados y analizados solo se ofrecen bajo solicitud al autor correspondiente.
  • No se localizó repositorio público de código o salidas asociado al artículo.

Limitaciones

  • Solo se evalúa una familia de modelo y una versión no identificada de GPT-3.5 Turbo.
  • No se informa la fecha de consulta de la API ni el snapshot retornado.
  • No se publican parámetros completos, semilla, top_p, límites de tokens, system prompt o lógica de reintentos.
  • La instrucción de producir una cadena de razonamiento no valida que el proceso imite razonamiento humano.
  • Pedir respuestas no políticamente correctas introduce una señal de demanda que puede modificar opciones.
  • No se publica el prompt completo para cada idioma, país y experimento.
  • No se documenta cómo se extrae la opción cuando el razonamiento es ambiguo o inválido.
  • No se informan fallos, exclusiones, respuestas fuera de formato o tasas de reintento.
  • No se reportan tamaños analíticos por país, subgrupo, pregunta o condición.
  • No se especifica si se usan pesos muestrales de WVS ni cómo se tratan valores perdidos.
  • Las respuestas WVS proceden de años distintos entre 2010 y 2014 y pueden reflejar cambios temporales.
  • Los prompts usan lenguas distintas, por lo que país, idioma, traducción y contexto cultural están confundidos.
  • Las preguntas políticas tienen opciones específicas de cada país y no son resultados equivalentes.
  • Las distribuciones marginales de respuestas difieren por país y afectan kappa.
  • Solo hay seis observaciones para las correlaciones país-factor.
  • Dos países se clasifican como occidentales, cuatro como desarrollados y tres como anglófonos.
  • Cultura occidental y economía desarrollada están correlacionadas y no se ajustan conjuntamente.
  • Las correlaciones no incluyen intervalos, pruebas, sensibilidad ni corrección por comparaciones.
  • Los coeficientes del heatmap no se reconstruyen exactamente con las kappas redondeadas publicadas.
  • La afirmación de mejor rendimiento en países anglófonos es débil frente a una correlación de 0,101 y el bajo resultado sudafricano.
  • El texto y el suplemento publican valores de país diferentes sin explicación.
  • Cohen kappa no es directamente comparable entre grupos con prevalencias y números de categoría distintos.
  • Las brechas demográficas carecen de tamaños de subgrupo, intervalos y pruebas.
  • Las categorías étnicas Other y dos o más razas son heterogéneas.
  • V240 registra sexo por observación del encuestador, aunque el texto lo interpreta como género.
  • No hay análisis interseccional ni ajuste por correlación entre edad, educación, clase y etnia.
  • Comparar ambiente y política cambia a la vez la pregunta, la escala y las covariables.
  • La mayor kappa política no demuestra que el comportamiento político sea intrínsecamente más fácil de simular.
  • Definir Democrat y protección ambiental como las únicas opciones liberales simplifica constructos ideológicos.
  • No se explica suficientemente la normalización de la diferencia liberal ni se aporta incertidumbre.
  • La comparación de cuatro frente a dos opciones filtra categorías y encuestados, además de cambiar complejidad.
  • La etiqueta Japón aplicada a datos estadounidenses prueba sensibilidad al prompt, no exactitud cultural.
  • Llamar consistentes a Wave 6 y Wave 7 no se apoya en una prueba de equivalencia o estabilidad individual.
  • Wave 6 y Wave 7 pueden cambiar en composición, covariables y clima político.
  • No hay preregistro ni separación formal entre análisis confirmatorios y exploratorios.
  • No hay comparación con modelos estadísticos simples o baselines de clase mayoritaria.
  • No se compara GPT-3.5 con otros LLM ni con un modelo entrenado sobre WVS.
  • No hay evaluación de calibración, distribución agregada, error por clase o utilidad predictiva fuera de kappa y asociación.
  • No se liberan código, datos procesados, prompts, salidas o entorno reproducible.
  • La disponibilidad bajo solicitud no permite una verificación independiente actual.
  • Las explicaciones basadas en composición del entrenamiento son especulativas porque no se observa ni interviene ese corpus.
  • Las implicaciones para política pública exceden una evaluación de dos preguntas de encuesta.

Qué no demuestra

  • No demuestra que GPT-3.5 reproduzca con alta fidelidad la opinión pública de ningún país.
  • No demuestra que cultura, desarrollo o idioma causen las diferencias nacionales.
  • No prueba que el corpus de entrenamiento sea el mecanismo responsable.
  • No establece que las brechas de kappa sean efectos demográficos ajustados.
  • No demuestra una inclinación liberal o conservadora estable entre temas.
  • No aísla el número de opciones como causa de la caída de concordancia.
  • No valida las cadenas de razonamiento como procesos psicológicos humanos.
  • No demuestra estabilidad temporal entre Wave 6 y Wave 7.
  • No generaliza a otros modelos, encuestas, preguntas, países o fechas.
  • No justifica reemplazar personas encuestadas por muestras sintéticas.
  • No demuestra que las simulaciones sean adecuadas para formular políticas.
  • No permite reproducir los resultados con los artefactos públicos disponibles.

Trazabilidad

Alcance: Texto completo

Versión: Humanities and Social Sciences Communications 11, article 1095; published 28 August 2024; DOI 10.1057/s41599-024-03609-x; CC BY-NC-ND 4.0

Fuente consultada: https://www.nature.com/articles/s41599-024-03609-x.pdf

Revisión: Codex full-text, visual, supplementary-table and statistical-reporting audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI GPT-3.5 Turbo, exact model snapshot and API date not reported

Instrumentos y métricas

  • World Values Survey Wave 6 item V81 on environment versus economic growth
  • World Values Survey Wave 6 item V228 on national election vote
  • Demographic profile from V254 ethnicity, V240 observed sex, V242 age, V248 education and V238 social class
  • Environmental covariates V30, V78, V82, V83 and V122
  • Political ideology covariate V95
  • Interview-style persona prompts in English, Swedish, Portuguese and Japanese
  • Prompted chain of reasoning and instruction to avoid politically correct answers
  • Cohen's kappa
  • Cramer's V
  • Proportion agreement
  • Pearson correlations over six country-level observations

Datos utilizados

  • World Values Survey Wave 6 country files for Japan 2010, United States 2011, Sweden 2011, Singapore 2012, South Africa 2013 and Brazil 2014
  • World Values Survey Wave 7 United States 2017 robustness comparison
  • Unreleased GPT-3.5 Turbo simulated responses
  • Publisher supplementary DOCX with Tables S1–S4

Evidencia y localización

  • Alcance, fuente WVS y variables: Version of record pp. 1–3, Abstract and Materials and methods
  • Modelo, temperatura, prompts y 100 simulaciones: Version of record pp. 3–5, Simulation process and Data analysis
  • Resultados por país y correlaciones de seis casos: Version of record pp. 5–7, Figures 2–4 and Tables 1–2
  • Brechas demográficas estadounidenses: Version of record pp. 7–8, Figure 5; Supplement Table S2
  • Tema, ideología y número de opciones: Version of record pp. 8–9, Tables 3–5
  • Controles de país y Wave 7: Version of record p. 10; Supplement Table S4
  • Limitaciones reconocidas y conclusiones: Version of record pp. 11–12, Limitations and Conclusion
  • Discrepancias de métricas y ausencia de N: Main Figures 2–3 cross-checked against frozen Supplement Tables S1–S4, 15 Jul 2026
  • Disponibilidad de artefactos: Publisher Data availability statement and title/author searches of GitHub, OSF and Zenodo, checked 15 Jul 2026