Cultural bias and cultural alignment of large language models

Sociedad, cultura y comportamiento colectivo2024PNAS NexusRevisión editorial aprobada

Título original: Cultural Bias and Cultural Alignment of Large Language Models

Autores: Yan Tao, Olga Viberg, Ryan S. Baker, René F. Kizilcec

Palabras clave: cultural bias, cultural alignment, large language models, cross-cultural values, World Values Survey, cultural prompting, AI ethics

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
24
Hallazgos
38
Limitaciones
20
Evidencias

Resumen editorial

Español

El artículo evalúa si cinco snapshots de la familia GPT de OpenAI producen, por defecto, respuestas a encuestas de valores más próximas a unas culturas nacionales que a otras y si indicar un país en el prompt reduce esa distancia. La referencia humana combina las tres olas más recientes, entre 2005 y 2022, del World Values Survey y el European Values Study: 393.536 registros individuales de 112 países o territorios. Se seleccionan las diez preguntas usadas para el mapa cultural de Inglehart–Welzel, se estandarizan con los datos humanos y se aplica PCA ponderado con rotación varimax y eliminación por pares. Los dos componentes, supervivencia frente a autoexpresión y valores tradicionales frente a seculares, explican el 39 % de la variación. Cinco países sin puntuaciones válidas en alguno de los ítems se excluyen, por lo que el análisis final cubre 107. Las coordenadas nacionales se obtienen promediando primero por país-año y después entre años; no representan la distribución interna de opiniones de cada sociedad.

Los modelos son text-davinci-002, gpt-3.5-turbo-0613, gpt-4-0613, gpt-4-turbo-2024-04-09 y gpt-4o-2024-05-13. A temperatura 0, cada modelo contesta los mismos diez ítems en inglés. Para los cuatro modelos recientes se usan diez variantes del descriptor, por ejemplo, “average human being”, “typical person” o “world citizen”, y se promedian sus coordenadas; GPT-3 solo usa una variante porque fue retirado. El prompting cultural añade “born in [país] and living in [país]”. Esto genera 400 respuestas generales y 42.800 respuestas condicionadas para los cuatro modelos recientes, más diez respuestas generales y 1.070 condicionadas de GPT-3. No se repite un prompt idéntico: la variación estudiada es de redacción, no variación estocástica. Los autores revisan manualmente respuestas fuera de formato; en GPT-3.5 aparecen 2 negativas de 1.070 para homosexualidad y 30 de 1.070 para aborto. Libia se elimina de esa comparación porque faltan las diez respuestas de homosexualidad.

Sin país en el prompt, los cinco puntos GPT quedan en la zona de autoexpresión y son más próximos a países anglófonos y de la Europa protestante que a muchos países africano-islámicos. Por ejemplo, GPT-4o queda a distancia 0,20 de Finlandia, 0,21 de Andorra y 0,45 de Países Bajos, frente a 4,10 de Jordania, 4,00 de Libia y 3,95 de Ghana. Esta es una comparación geométrica entre una respuesta agregada del modelo y medias nacionales proyectadas a dos dimensiones; llamar a esa posición “valores culturales del modelo” es la operacionalización del estudio, no una medición de creencias internas. Tampoco se demuestra la causa: el paper propone como posibilidades el idioma inglés, el corpus de entrenamiento y las decisiones de desarrollo, pero reconoce que la opacidad de los modelos impide atribuir los desplazamientos a RLHF u otros mecanismos.

El prompting cultural reduce la distancia media de 2,42 a 1,57 en GPT-4o, de 2,71 a 1,77 en GPT-4-turbo, de 2,69 a 1,65 en GPT-4, de 3,35 a 2,83 en GPT-3.5-turbo y de 2,39 a 2,11 en GPT-3; las pruebas de rangos con signo de Wilcoxon se reportan con P < 0,001. Recalculando el CSV suplementario, la distancia baja en 76/107 países para GPT-4o (71,0 %), 87/107 para GPT-4-turbo (81,3 %), 83/107 para GPT-4 (77,6 %), 77/106 para GPT-3.5-turbo (72,6 %) y 86/107 para GPT-3 (80,4 %). No es universal: empeora en 31, 20, 24, 29 y 21 casos, respectivamente. En GPT-4o, Jordania mejora de 4,10 a 0,36, pero Finlandia empeora de 0,20 a 2,43, Luxemburgo de 0,59 a 2,72, Andorra de 0,21 a 2,26, Suiza de 0,45 a 2,48 y Taiwán de 2,40 a 3,94. Incluso tras el ajuste, la distancia media 1,57 de GPT-4o sigue siendo sustancial.

El resultado sólido es que una etiqueta nacional cambia de forma sistemática las respuestas cerradas de estos snapshots y suele acercar su punto agregado a la media nacional del IVS en esta métrica. No prueba que el modelo comprenda una cultura, que produzca contenido culturalmente adecuado ni que mejore tareas reales. El país funciona además como una señal que puede activar estereotipos; no hay evaluación por residentes, grupos culturales internos o expertos locales. Todo se pregunta en inglés, se mezclan encuestas de años distintos y se comprime la heterogeneidad de 393.536 personas a una media por país en un plano que conserva solo el 39 % de la variación. No hay intervalos de incertidumbre para las posiciones nacionales, corrección por multiplicidad, comparación con modelos no OpenAI, idiomas locales, textos largos o comportamiento interactivo.

La reproducibilidad pública es mejor de lo que sugiere el suplemento de la revista. El proyecto OSF 7sj3w incluye el script R de análisis, dos pipelines Python, prompts, puntuaciones, coordenadas y 428 JSON país-modelo con objetos de respuesta para GPT-3.5/4/4-turbo/4o, además de las respuestas generales; los objetos conservan IDs, timestamps, modelo y, cuando existe, system fingerprint. El suplemento aporta seis CSV y un PDF de 13 páginas. Aun así, la reproducción no es de un solo paso: el script usa file.choose(), rutas locales y comprobaciones manuales, no fija versiones de R/Python ni dependencias, y los archivos WVS/EVS brutos deben obtenerse aparte. El OSF es público pero no está registrado o congelado. La contribución debe leerse como una auditoría descriptiva, reproducible en buena medida, de respuestas de encuesta de cinco snapshots GPT en 2024 y de una intervención de prompting; no como evidencia de que una identidad nacional capture toda una cultura ni como validación general de alineación cultural.

English

The paper tests whether five OpenAI GPT-family snapshots produce default value-survey answers that are closer to some national cultures than others, and whether naming a country in the prompt reduces that distance. The human benchmark combines the three most recent waves, spanning 2005–2022, of the World Values Survey and European Values Study: 393,536 individual records from 112 countries or territories. The authors select the ten questions used for the Inglehart–Welzel cultural map, standardize them against the human data, and run weighted PCA with varimax rotation and pairwise deletion. The two components, survival versus self-expression and traditional versus secular values, explain 39% of the variation. Five countries lacking valid scores on at least one item are removed, leaving 107. National coordinates are formed by averaging within country-year and then across years; they do not represent each society’s internal distribution of opinions.

The models are text-davinci-002, gpt-3.5-turbo-0613, gpt-4-0613, gpt-4-turbo-2024-04-09, and gpt-4o-2024-05-13. At temperature zero, each model answers the same ten English survey items. Ten respondent-descriptor variants, such as “average human being,” “typical person,” and “world citizen”, are used and their coordinates averaged for the four recent models; GPT-3 uses one variant because it had been deprecated. Cultural prompting adds “born in [country] and living in [country].” This yields 400 default and 42,800 country-conditioned responses for the four recent models, plus ten default and 1,070 conditioned GPT-3 responses. Identical prompts are not repeated: the studied variation is wording sensitivity, not stochastic variation. The authors manually inspect malformed answers. GPT-3.5 refuses 2 of 1,070 homosexuality items and 30 of 1,070 abortion items; Libya is removed from that model’s country comparison because all ten homosexuality answers are missing.

Without a country cue, all five GPT points lie toward self-expression values and are closer to English-speaking and Protestant European countries than to many African-Islamic countries. GPT-4o, for example, is 0.20 from Finland, 0.21 from Andorra, and 0.45 from the Netherlands, versus 4.10 from Jordan, 4.00 from Libya, and 3.95 from Ghana. This is a geometric comparison between one aggregated model response and national means projected into two dimensions. Calling the position the model’s “cultural values” is the study’s operational definition, not a measurement of internal beliefs. Causation is also not identified: the paper suggests English prompts, training-corpus composition, and development choices as possible causes, while acknowledging that model opacity prevents attribution to RLHF or other mechanisms.

Cultural prompting lowers mean distance from 2.42 to 1.57 for GPT-4o, 2.71 to 1.77 for GPT-4-turbo, 2.69 to 1.65 for GPT-4, 3.35 to 2.83 for GPT-3.5-turbo, and 2.39 to 2.11 for GPT-3; paired Wilcoxon signed-rank tests are reported at P < .001. Independent recalculation from the supplementary CSV confirms improvement in 76/107 countries for GPT-4o (71.0%), 87/107 for GPT-4-turbo (81.3%), 83/107 for GPT-4 (77.6%), 77/106 for GPT-3.5-turbo (72.6%), and 86/107 for GPT-3 (80.4%). The effect is not universal: distance worsens in 31, 20, 24, 29, and 21 cases, respectively. For GPT-4o, Jordan improves from 4.10 to 0.36, while Finland worsens from 0.20 to 2.43, Luxembourg from 0.59 to 2.72, Andorra from 0.21 to 2.26, Switzerland from 0.45 to 2.48, and Taiwan from 2.40 to 3.94. Even after prompting, GPT-4o’s mean distance of 1.57 remains substantial.

The defensible result is that a national label systematically changes closed-ended answers from these snapshots and often moves the aggregated point closer to the IVS national mean under this metric. It does not show cultural understanding, culturally appropriate generation, or improvement on real tasks. A country label may itself activate stereotypes, and outputs are not evaluated by residents, within-country cultural groups, or local experts. All questions are in English, survey years are pooled across time, and the heterogeneity of 393,536 people is compressed into one country mean on a plane retaining only 39% of the variation. The study supplies no uncertainty intervals for national positions, multiple-testing correction, non-OpenAI models, local-language conditions, long-form generation, or interactive behavior.

Public reproducibility is stronger than the journal supplement alone suggests. OSF project 7sj3w contains the R analysis script, two Python pipelines, prompts, scores, coordinates, and 428 country-model JSON files with raw completion objects for GPT-3.5/4/4-turbo/4o, plus default responses; objects preserve request IDs, timestamps, model IDs, and system fingerprints where available. The journal supplement includes six CSV files and a 13-page PDF. Reproduction is still not one-command: the R script uses file.choose(), local paths, and manual checks; R/Python and dependency versions are not pinned; and raw WVS/EVS files must be obtained separately. The public OSF project is not a frozen registration. The contribution is therefore a substantially auditable descriptive study of 2024 GPT snapshot survey responses and a prompting intervention, not evidence that nationality exhausts culture or a general validation of cultural alignment.

Pregunta de investigación

¿Qué culturas nacionales quedan más próximas a las respuestas por defecto de cinco snapshots GPT en el mapa de valores Inglehart–Welzel, y hasta qué punto indicar país de nacimiento y residencia en el prompt reduce la distancia respecto de la media nacional del IVS?

Método

Se combinan WVS y EVS de 2005–2022, se proyectan diez ítems ponderados mediante PCA varimax a dos dimensiones y se calculan coordenadas para 107 países. Cinco snapshots GPT responden esos ítems en inglés, sin país y con 107 identidades nacionales; se promedian diez variantes de descriptor salvo en GPT-3. La alineación se operacionaliza como distancia euclídea entre cada punto GPT y la media nacional, y se comparan distancias antes/después con Wilcoxon.

Muestra: 393.536 respuestas individuales de WVS/EVS en 112 países o territorios; 107 conservados en el mapa final. Para cuatro snapshots recientes: 400 respuestas generales y 42.800 condicionadas por país; para GPT-3: 10 generales y 1.070 condicionadas. Cada combinación usa temperatura 0 y una ejecución por redacción; diez variantes de descriptor salvo GPT-3.

Hallazgos

  • Los dos componentes del mapa explican el 39 % de la variación de los diez ítems.
  • Los cinco snapshots GPT se sitúan por defecto hacia valores de autoexpresión.
  • Sus puntos por defecto son más próximos a países anglófonos y de la Europa protestante.
  • GPT-4o queda a distancia 0,20 de Finlandia, 0,21 de Andorra y 0,45 de Países Bajos.
  • GPT-4o queda a distancia 4,10 de Jordania, 4,00 de Libia y 3,95 de Ghana.
  • No aparece una tendencia temporal simple en el eje tradicional-secular entre los cinco modelos.
  • La diferencia de distancias por defecto entre GPT-4o, GPT-4 y GPT-4-turbo es apenas significativa, P = 0,036.
  • El prompting cultural reduce la distancia media de GPT-4o de 2,42 a 1,57.
  • Reduce la de GPT-4-turbo de 2,71 a 1,77.
  • Reduce la de GPT-4 de 2,69 a 1,65.
  • Reduce la de GPT-3.5-turbo de 3,35 a 2,83.
  • Reduce la de GPT-3 de 2,39 a 2,11.
  • Las cinco comparaciones pareadas se reportan con P < 0,001.
  • El CSV confirma mejora en 76/107 países para GPT-4o, equivalente al 71,0 %.
  • Confirma mejora en 87/107 para GPT-4-turbo, equivalente al 81,3 %.
  • Confirma mejora en 83/107 para GPT-4, equivalente al 77,6 %.
  • Confirma mejora en 77/106 para GPT-3.5-turbo, equivalente al 72,6 %.
  • Confirma mejora en 86/107 para GPT-3, equivalente al 80,4 %.
  • Para GPT-4o, Jordania pasa de distancia 4,10 a 0,36.
  • Para GPT-4o, 31 países empeoran; los mayores aumentos son Finlandia, Luxemburgo, Andorra, Suiza y Taiwán.
  • Las variantes de redacción producen dispersión apreciable, especialmente en GPT-4o sin prompting cultural.
  • El prompting cultural no colapsa todas las respuestas de GPT-4 a un punto central: las coordenadas país-específicas conservan dispersión.
  • GPT-3.5 rechaza algunos ítems sensibles y obliga a excluir Libia de su comparación cultural.
  • OSF conserva datos y código suficientes para auditar las cifras publicadas y las respuestas de los cuatro snapshots recientes.

Limitaciones

  • Solo se estudian cinco modelos de una empresa y una familia tecnológica.
  • Las conclusiones no cubren Claude, Llama, Mistral, Gemini, modelos abiertos ni modelos desarrollados fuera de Estados Unidos.
  • Todos los prompts están en inglés.
  • No se comparan idiomas locales ni traducciones culturalmente validadas.
  • País de nacimiento y residencia se usa como sustituto de cultura.
  • La etiqueta nacional puede activar estereotipos en lugar de conocimiento cultural situado.
  • No hay evaluación por residentes, comunidades locales o expertos culturales.
  • No se representa heterogeneidad regional, étnica, lingüística, religiosa, generacional o socioeconómica dentro de cada país.
  • Las medias nacionales comprimen 393.536 respuestas individuales a un solo punto por país.
  • Se promedian por igual años de encuesta distintos dentro de cada país.
  • Los datos humanos abarcan 2005–2022, mientras las respuestas de modelo se generan en 2024.
  • WVS y EVS pueden incluir ambos datos para un mismo país y año sin modelar explícitamente la dependencia entre encuestas.
  • Los dos componentes retienen solo el 39 % de la variación de los diez ítems.
  • La distancia euclídea en dos dimensiones depende de esa reducción y de su escala.
  • No se incorporan errores estándar o intervalos de confianza de las coordenadas nacionales.
  • Las pruebas tratan las coordenadas de referencia como puntos sin incertidumbre de muestreo.
  • No se reporta corrección por comparaciones múltiples.
  • P = 0,036 en la comparación entre modelos recientes es débil y no incluye tamaño de efecto.
  • La temperatura 0 no garantiza determinismo perfecto en una API alojada.
  • No se repite ningún prompt idéntico para medir estabilidad temporal o de infraestructura.
  • Las diez variantes son sinónimos elegidos por los autores, no una muestra sistemática del espacio de prompts.
  • GPT-3 solo usa una variante, por lo que su robustez no es comparable.
  • GPT-3 usa un prompt de usuario combinado; los demás separan sistema y usuario.
  • Las instrucciones de formato se refinaron iterativamente hasta lograr respuestas utilizables, sin protocolo predeclarado.
  • La extracción manual de respuestas introduce decisiones humanas no doblemente codificadas.
  • GPT-3.5 produce negativas selectivas en preguntas sobre homosexualidad y aborto.
  • Excluir Libia en una condición cambia el denominador y la comparabilidad.
  • Se estudian respuestas cerradas de encuesta, no generación larga, conversación o tareas reales.
  • No se mide si el acercamiento geométrico mejora utilidad, seguridad o adecuación cultural.
  • No se examinan daños por estereotipos causados por el prompting nacional.
  • Las explicaciones sobre corpus, RLHF y reglas de recompensa son especulativas.
  • La opacidad de OpenAI impide atribuir cambios entre snapshots a mecanismos concretos.
  • El script público depende de file.choose(), rutas locales y comprobaciones manuales.
  • No se fijan versiones de R, Python, psych, pandas, openai ni otras dependencias.
  • Los archivos WVS/EVS brutos no están incluidos en OSF y deben obtenerse por separado.
  • El proyecto OSF es público, pero no una registration congelada e inmutable.
  • No se aporta un entorno, lockfile, contenedor ni prueba automatizada de reproducción.
  • Los snapshots evaluados son históricos y no caracterizan modelos actuales.

Qué no demuestra

  • No demuestra que un LLM posea valores culturales internos.
  • No demuestra comprensión de ninguna cultura.
  • No demuestra que nacionalidad y cultura sean equivalentes.
  • No demuestra alineación con todas las personas de un país.
  • No demuestra ausencia de estereotipos en las respuestas condicionadas.
  • No demuestra que menor distancia en el mapa produzca texto culturalmente apropiado.
  • No demuestra mejora en tareas reales o interacciones humano-IA.
  • No demuestra que el prompting cultural sea seguro para todos los países.
  • No demuestra que el prompting cultural funcione universalmente; empeora entre el 19 % y el 29 % de los casos.
  • No identifica causalmente el origen del sesgo observado.
  • No demuestra que RLHF explique las diferencias entre versiones.
  • No generaliza a otros proveedores, familias de modelos o idiomas.
  • No caracteriza modelos GPT posteriores a mayo de 2024.
  • No valida la posición bidimensional como medida exhaustiva de cultura.
  • No prueba que las respuestas de encuesta de un LLM predigan su comportamiento generativo.
  • No muestra que una media nacional sea la respuesta correcta para un individuo concreto.
  • No establece superioridad de un snapshot: el rendimiento depende del país y del prompt.
  • No elimina la distancia cultural restante incluso donde la intervención mejora la métrica.

Trazabilidad

Alcance: Texto completo

Versión: PNAS Nexus 3(9):pgae346, version of record published 17 Sep 2024, DOI 10.1093/pnasnexus/pgae346; OSF project 7sj3w last modified 7 Aug 2024

Fuente consultada: https://academic.oup.com/pnasnexus/article-pdf/3/9/pgae346/59161126/pgae346.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, IVS/WVS/EVS, PCA, prompt-variant, cultural-prompting, CSV-recalculation, OSF-code, raw-completion, construct-validity, statistics, reproducibility and data-availability audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI text-davinci-002 (GPT-3)
  • OpenAI gpt-3.5-turbo-0613
  • OpenAI gpt-4-0613
  • OpenAI gpt-4-turbo-2024-04-09
  • OpenAI gpt-4o-2024-05-13

Instrumentos y métricas

  • Integrated Values Surveys (World Values Survey plus European Values Study)
  • Ten Inglehart–Welzel World Cultural Map items
  • Weighted principal component analysis with varimax rotation and pairwise deletion
  • Survival versus self-expression component
  • Traditional versus secular-rational component
  • Ten respondent-descriptor prompt variants
  • Country-of-birth-and-residence cultural prompting
  • Euclidean cultural distance
  • Paired Wilcoxon signed-rank tests
  • Kruskal–Wallis comparison of default-distance distributions

Datos utilizados

  • WVS trend file 1981–2022 v3.0.0, filtered to waves 5–7
  • EVS trend file 1981–2017 v3.0.0, filtered to waves 5–7
  • 393,536 weighted individual survey records from 112 countries or territories
  • 107-country analysis after five exclusions
  • OSF 7sj3w analysis script, generation pipelines, prompts, raw completion objects, scores and coordinates
  • PNAS Nexus supplementary PDF and Datasets S1–S6

Evidencia y localización

  • Publicación oficial: PNAS Nexus 3(9):pgae346, advance publication 17 Sep 2024, DOI 10.1093/pnasnexus/pgae346
  • Fuente completa: .cache/editorial-sources/article-109/source.pdf; 9 pages; sha256 978f4497d3c23cb23ea1c9144a25a400c3680accfacb30ee54a231848c1040e2
  • Suplemento editorial: pgae346 supplementary data ZIP; PDF 13 pages plus six CSV files; sha256 3a2e9c82244701491cfda56d6b8007e21f236e3a5e39060810ab50cd698e6c8a
  • Resumen original y metadatos: Full text p. 1 and PMC11407280
  • Preguntas y variantes: Full text pp. 2–3, Tables 1–2
  • Modelos exactos: Full text p. 3; OSF filenames and raw completion model fields
  • Mapa y distancias por defecto: Full text pp. 3–4, Figure 1 and Dataset S5
  • Medias y pruebas antes/después: Full text pp. 4–5, Figure 2; OSF Analysis_Script_OSF.R lines 492–523
  • Tasas de mejora recalculadas: Dataset S6 RQ2_CP_Responses_L2_Results.csv: 76/107, 87/107, 83/107, 77/106 and 86/107
  • Países que empeoran con GPT-4o: Full text pp. 4–5 and Dataset S6
  • Sensibilidad a redacción: Supplementary text pp. 2–3 and Figures S1–S5
  • No es simple recentrado: Supplementary text pp. 2–3 and Figures S6–S8
  • Límites reconocidos: Full text p. 6, Discussion
  • PCA y muestra humana: Full text pp. 6–7, Materials and methods
  • Generación, temperatura y ausencia de repeticiones: Full text pp. 6–7, Measuring cultural values of GPT
  • Rechazos y extracción manual: Full text p. 7, Evaluating cultural prompting
  • Datos y código OSF: https://osf.io/7sj3w/; public project created 14 Jun 2024, modified 7 Aug 2024, not registered; checked 15 Jul 2026
  • Objetos de respuesta: OSF Answer Generation folders: 428 country-conditioned JSON files for four recent snapshots plus default completion objects
  • Limitaciones del flujo reproducible: OSF Analysis_Script_OSF.R and Part1/Part2 generation pipelines: interactive file.choose, local paths, manual checks and no pinned environment
  • Inspección visual: All 9 main-PDF pages and all 13 supplementary-PDF pages rendered and visually inspected, including Tables 1–2, Figures 1–2 and Figures S1–S8; checked 15 Jul 2026