Investigating Cultural Alignment of Large Language Models

Sociedad, cultura y comportamiento colectivo2024ACL AnthologyRevisión editorial aprobada

Autores: Badr AlKhamissi, Muhammad ElNokrashy, Mai AlKhamissi, Mona Diab

Palabras clave: Computation and Language, Computers and Society

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
8
Hallazgos
15
Limitaciones
5
Evidencias

Resumen editorial

Español

El artículo operacionaliza la alineación cultural como la coincidencia entre la opción elegida por un LLM y la respuesta de una persona concreta del World Values Survey (WVS), emparejada entre Egipto y Estados Unidos por sexo, edad, estado civil, educación y clase social. De las muestras originales de 1.200 y 2.596 participantes se seleccionan 303 personas por país; se usan 30 preguntas de siete temas, cuatro paráfrasis en inglés y traducciones árabes revisadas. GPT-3.5-turbo-1106, AceGPT-Chat-13B, LLaMA-2-Chat-13B y mT0-XXL generan cinco respuestas a temperatura 0,7 por combinación y se aplica voto mayoritario. La métrica hard exige la misma opción; la soft concede crédito por proximidad en escalas ordinales. En las tablas publicadas, la coincidencia media es mayor con respuestas estadounidenses que egipcias: 59,07 frente a 47,16 en soft y 33,78 frente a 27,03 en hard. Para Egipto, preguntar en árabe mejora ambas métricas en GPT-3.5 y AceGPT, pero no de forma uniforme en LLaMA-2 y mT0; para Estados Unidos suele favorecer el inglés, salvo mT0. Los promedios también son menores para personas de clase y educación bajas, mujeres y jóvenes, aunque el paper no aísla estadísticamente esos factores. Un experimento limitado a GPT-3.5, personas egipcias y prompts ingleses añade un marco de razonamiento antropológico: soft pasa de 0,4834 a 0,5102 y hard de 0,2443 a 0,2838. Esto no demuestra comprensión cultural: la referencia es la respuesta individual de una sola persona con demografía semejante, no una verdad cultural ni una estimación poblacional. Tampoco se informan tests, intervalos o modelos multinivel. La auditoría del repositorio oficial confirma 2.937.183 respuestas crudas, pero detecta deriva entre paper y artefacto: hay 31 preguntas generadas y 30 analizadas; los completions árabes de EE. UU. suelen usar 275 personas por filtrar a quienes nacieron fuera del país; varios archivos GPT están incompletos; los desempates se resuelven aleatoriamente sin semilla; se descartan salidas inválidas; faltan módulos e inputs citados; y el código actual conserva solo una de cuatro paráfrasis. El patrón publicado es informativo para este montaje, pero las tablas no se reproducen de extremo a extremo desde el commit auditado.

English

The paper operationalizes cultural alignment as agreement between an LLM's selected option and the answer of one World Values Survey (WVS) respondent, paired across Egypt and the United States by sex, age, marital status, education and social class. From original samples of 1,200 and 2,596 participants, the study selects 303 personas per country; it uses 30 questions in seven themes, four English paraphrases and manually reviewed Arabic translations. GPT-3.5-turbo-1106, AceGPT-Chat-13B, LLaMA-2-Chat-13B and mT0-XXL generate five responses at temperature 0.7 per combination, followed by majority voting. The hard metric requires the same option, while the soft metric gives partial credit for ordinal proximity. In the published tables, mean agreement is higher with US than Egyptian answers: 59.07 versus 47.16 soft and 33.78 versus 27.03 hard. For Egypt, prompting in Arabic improves both metrics for GPT-3.5 and AceGPT, but not uniformly for LLaMA-2 and mT0; for the US, English is usually better except for mT0. Averages are also lower for lower-class and lower-education personas, women and younger people, although the paper does not statistically isolate those factors. A narrow experiment using only GPT-3.5, Egyptian personas and English prompts adds an anthropological reasoning framework: soft rises from 0.4834 to 0.5102 and hard from 0.2443 to 0.2838. This does not demonstrate cultural understanding: the reference is one demographically similar individual's answer, not cultural truth or a population estimate. The paper also reports no tests, intervals or multilevel models. Auditing the official repository confirms 2,937,183 raw responses, but reveals drift between paper and artifact: 31 questions were generated and 30 analyzed; US-Arabic completions usually use 275 personas after filtering respondents born outside the country; several GPT files are partial; ties are broken randomly without a seed; invalid outputs are discarded; referenced modules and inputs are missing; and current generation code retains only one of four paraphrases. The published pattern is informative for this setup, but the audited commit cannot reproduce the tables end to end.

Pregunta de investigación

¿Hasta qué punto cuatro LLM reproducen respuestas individuales del WVS de personas emparejadas en Egipto y Estados Unidos, y cómo cambian esa coincidencia el idioma del prompt, la mezcla lingüística de preentrenamiento, la demografía, el tema y un prompt de razonamiento antropológico?

Método

Simulación persona-a-persona del WVS-7 con 303 pares demográficos declarados por país, 30 ítems, cuatro paráfrasis, prompts en inglés y árabe, cuatro modelos y cinco generaciones por combinación. Se toma el voto mayoritario y se calculan coincidencia exacta hard y similitud ordinal soft. La comparación principal excluye pares persona-pregunta en que ambos participantes humanos respondieron igual. Anthropological Prompting se prueba aparte con GPT-3.5, Egipto e inglés.

Muestra: El paper declara 303 personas únicas por país, emparejadas en sexo, edad, estado civil, educación y clase social, con región específica de cada país. Para 30 preguntas, cuatro paráfrasis y cinco generaciones, el diseño principal pretende comparar cuatro modelos, dos países-persona y dos idiomas. El artefacto contiene además Q234, 31 preguntas, y los archivos árabes de EE. UU. de tres modelos tienen 275 personas porque el código filtra 28 participantes no nacidos en Estados Unidos; tres archivos GPT-3.5 árabes de EE. UU. y el Q2 antropológico son parciales.

Hallazgos

  • Promediando idiomas, las tablas publicadas sitúan la alineación soft/hard con Egipto en 47,16/27,03 y con Estados Unidos en 59,07/33,78.
  • Para Egipto, GPT-3.5 mejora de 47,08/23,42 en inglés a 50,15/28,56 en árabe; AceGPT, de 46,15/28,83 a 49,49/30,60.
  • LLaMA-2 empeora con árabe para Egipto y mT0 mejora soft pero empeora hard; el efecto del idioma dominante no es universal.
  • Para Estados Unidos, el inglés suele superar al árabe, salvo mT0, que obtiene mayor soft y hard en árabe.
  • La comparación AceGPT-LLaMA sugiere que el ajuste árabe puede aumentar la coincidencia con respuestas egipcias, pero confunde todos los demás cambios entre checkpoints.
  • Los promedios descriptivos aumentan con clase social, educación y edad y son mayores para personas masculinas; no se estiman efectos ajustados ni incertidumbre.
  • Anthropological Prompting eleva soft de 0,4834 a 0,5102 y hard de 0,2443 a 0,2838 en una única configuración GPT-3.5/Egipto/inglés.
  • El repositorio prueba que se generó un corpus grande, pero no permite reconstruir exactamente las tablas publicadas desde el commit actual.

Limitaciones

  • La coincidencia con una persona no valida conocimiento, competencia o sensibilidad cultural.
  • Personas con los mismos cinco rasgos demográficos pueden responder legítimamente de modo distinto; la etiqueta individual es ruidosa.
  • Los 303 pares no se demuestran representativos de las poblaciones ni de las muestras WVS completas.
  • La tabla principal selecciona solo pares humano-pregunta que discrepan entre países, enriqueciendo artificialmente diferencias culturales.
  • Idioma, país y cultura se usan como proxies y no se separan causalmente.
  • La comparación de modelos confunde preentrenamiento, arquitectura, tokenización, instruction tuning y safety tuning.
  • No se reportan intervalos, tests, efectos con incertidumbre, modelos multinivel ni corrección por medidas repetidas.
  • Las barras de error de la Figura 3 no están definidas y los análisis demográficos no controlan correlaciones entre variables.
  • Las preguntas fueron parafraseadas por ChatGPT y traducidas; no se valida equivalencia de medida entre redacciones e idiomas.
  • El voto mayoritario oculta inestabilidad y descarta respuestas inválidas; los empates se resuelven al azar sin semilla.
  • Anthropological Prompting cambia contenido, longitud, formato y número de muestras a la vez, por lo que no aísla razonamiento antropológico.
  • El parser toma el primer número disponible y 1.896 de 9.118 salidas antropológicas son inválidas bajo el código publicado.
  • El artefacto deriva del paper en preguntas, personas por idioma y completitud de varios archivos.
  • Faltan selected_questions.csv, wvs_response_map_new.json y wvs_measure_distance.py, además de entorno, lockfile, tests y comando end-to-end.
  • Solo se estudian Egipto/Estados Unidos, árabe estándar/inglés, 30 ítems y modelos de 2023.

Qué no demuestra

  • No demuestra que los modelos comprendan una cultura.
  • No convierte una respuesta individual del WVS en verdad cultural o ground truth poblacional.
  • No prueba que el preentrenamiento inglés cause la mayor coincidencia con Estados Unidos.
  • No prueba que el idioma del prompt active de forma fiable una cultura interna separada.
  • No aísla causalmente el efecto del ajuste árabe de AceGPT.
  • No demuestra que una menor puntuación demográfica se deba a menor presencia en los datos de entrenamiento.
  • No identifica el razonamiento antropológico como causa de la mejora de Table 4.
  • No demuestra significación estadística ni representatividad poblacional.
  • No generaliza a otras culturas, países, lenguas, dialectos, preguntas o modelos actuales.
  • No permite reproducir exactamente las cifras con el repositorio auditado sin reconstrucción y decisiones adicionales.

Trazabilidad

Alcance: Texto completo

Versión: ACL 2024 Volume 1, pages 12404-12422; arXiv:2402.13231v2 and official GitHub artifact audited separately

Fuente consultada: https://aclanthology.org/2024.acl-long.671/

Revisión: Codex 19-page visual, official-ACL, arXiv-v2, full-completion-corpus, WVS-grain, sample-drift, parser, nondeterminism, code-reproducibility, construct, statistics and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • GPT-3.5, gpt-3.5-turbo-1106
  • AceGPT-Chat-13B
  • LLaMA-2-Chat-13B
  • mT0-XXL, 13B

Instrumentos y métricas

  • World Values Survey wave 7
  • Six-dimension demographic persona prompt
  • Thirty selected WVS items across seven themes
  • Four ChatGPT-generated paraphrases per item
  • English and manually reviewed Arabic prompts
  • Five-sample majority vote
  • Hard exact-agreement metric
  • Soft ordinal-proximity metric
  • Anthropological Prompting framework

Datos utilizados

  • WVS-7 Egypt original extract, 1,200 respondents
  • WVS-7 United States original extract, 2,596 respondents
  • Matched Egypt WVS extract, 303 personas
  • Matched US WVS extract, 303 personas before language-dependent birthplace filtering
  • Official cultural-trends GitHub completions: 527 JSON files, 594,731 records and 2,937,183 raw responses

Evidencia y localización

  • Metadatos, DOI, licencia y abstract exacto: ACL Anthology 2024.acl-long.671
  • Método, fórmulas, tablas, discusión, limitaciones, ética y apéndices: ACL 2024 PDF, 19 páginas, sha256 b6f0b72915c4a8a7e49f4a85aaf6d3579d50e873e84ff7dd2cbd003b291c8655
  • Versión, historial y materias oficiales: arXiv:2402.13231v2
  • Código, datasets, completions, muestras, parser, desempates y reproducibilidad: github.com/bkhmsi/cultural-trends commit 33fe19ea945c3495d2aee7659f028cea039736bc
  • Auditoría de constructo, resultados, datos, código y límites de afirmación: reports/verification/article-243-acl-cultural-alignment-wvs-completions-code-and-construct-audit.json