How Well Do LLMs Represent Values Across Cultures? Empirical Analysis of LLM Responses Based on Hofstede Cultural Dimensions

Sociedad, cultura y comportamiento colectivo2025arXivRevisión editorial aprobada

Autores: Julia Kharchenko, Tanya Roosta, Aman Chadha, Chirag Shah

Palabras clave: Computation and Language, Artificial Intelligence, Computers and Society

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
6
Hallazgos
16
Limitaciones
11
Evidencias

Resumen editorial

Español

El artículo estudia si cinco LLM modifican consejos según valores nacionales representados por cinco dimensiones de Hofstede. Construye 250 dilemas binarios, 50 por dimensión, y los combina con personas de 36 países o con traducciones NLLB-200 vinculadas a 34 países en los datos publicados. Evalúa GPT-4, GPT-4o, Command R+, Gemma-7B-IT y Llama-3-8B-Instruct. Los modelos muestran preferencias globales, por ejemplo, orientación a largo plazo y baja motivación hacia el éxito competitivo, y algunas diferencias por país o idioma, pero la alineación con la puntuación Hofstede del país es débil e inconsistente. También aparecen respuestas estereotípicas o inventadas sobre países. La conclusión prudente es que el prompting nacional o lingüístico puede cambiar respuestas y activar estereotipos, no que el modelo comprenda ni interiorice valores culturales.

La auditoría del artículo, sus 22 páginas y el repositorio oficial revela problemas que impiden aceptar la significación publicada. Los notebooks calculan primero un porcentaje por país y después lo vuelven a expandir a cada una de las 1.700–9.000 filas antes de aplicar Pearson: el coeficiente no cambia, pero el tamaño muestral artificial convierte correlaciones diminutas en significativas. Así, 40 de 50 pruebas aparecen con p < 0,05; con el país como unidad quedan 13 sin corrección y ninguna supera Bonferroni para 50 comparaciones. Esto explica estrellas como r=0,0218 y contradice el texto, que dice que solo una combinación fue significativa. La “highest accuracy” se obtiene barriendo 100 umbrales sobre el mismo conjunto y eligiendo el máximo, sin test separado.

El código de generación y etiquetado tampoco reproduce limpiamente el estudio. En los diez scripts, la selección entre dos respuestas e “Inconclusive” usa expresiones Python con el operador and dentro de comparaciones numéricas; and devuelve uno de sus operandos y no compara las tres similitudes, por lo que el etiquetado es asimétrico e incorrecto. Los diez scripts truncaron “Low Power Distance” como “Low Power Distanc” al decidir adherencia, haciendo imposible marcar correctamente parte de PDI. Los scripts actuales ejecutan dos rondas mientras muchos CSV congelados contienen cinco; varios modelos solo tienen una. El pipeline carece de semillas, entorno bloqueado, tests, CI, licencia y release experimental, y el cálculo BLEU compara directamente traducciones con el texto inglés, lo que no valida la calidad de traducción entre idiomas. Por tanto, el trabajo aporta un conjunto exploratorio útil sobre prompting cultural y riesgo de estereotipos, pero sus p-valores, accuracies y afirmaciones de comprensión cultural requieren un nuevo análisis y una réplica corregida. No mide personalidad como rasgos psicométricos ni demuestra una identidad cultural persistente.

English

The paper studies whether five LLMs change advice according to national values represented by five Hofstede dimensions. It creates 250 binary dilemmas, 50 per dimension, and combines them with personas for 36 countries or NLLB-200 translations linked to 34 countries in the released data. It evaluates GPT-4, GPT-4o, Command R+, Gemma-7B-IT, and Llama-3-8B-Instruct. The models show broad response preferences, for example, long-term orientation and low competitive achievement motivation, and some country- or language-dependent differences, but alignment with countries' Hofstede scores is weak and inconsistent. Responses also contain national stereotypes and fabricated cultural sayings. The defensible conclusion is that national or language prompting can change outputs and elicit stereotypes, not that models understand or internalize cultural values.

The audit of the paper, all 22 pages, and the official repository finds problems that prevent acceptance of the reported significance. The notebooks first calculate a percentage per country and then expand it back to each of 1,700–9,000 rows before running Pearson correlation. This leaves the coefficient unchanged but creates an artificial sample size that makes tiny correlations significant. As a result, 40 of 50 tests appear to have p < .05; using country as the observational unit leaves 13 uncorrected results, and none survives a Bonferroni correction for 50 comparisons. This explains stars on values such as r=.0218 and conflicts with the prose, which says only one combination was significant. “Highest accuracy” is obtained by sweeping 100 thresholds on the same data and selecting the maximum, with no held-out test set.

The generation and labeling code also does not cleanly reproduce the study. In all ten scripts, selection between two answers and “Inconclusive” uses Python and expressions inside numeric comparisons; and returns one operand rather than comparing all three similarities, making classification asymmetric and incorrect. All ten scripts truncate “Low Power Distance” to “Low Power Distanc” when determining adherence, so part of the PDI condition cannot be marked correctly. Current scripts run two rounds while many frozen CSVs contain five and several models contain only one. The pipeline has no seeds, locked environment, tests, CI, license, or experimental release, and its BLEU script directly compares translations with English source text, which does not validate cross-language translation quality. The work is therefore a useful exploratory artifact about cultural prompting and stereotyping risk, but its p-values, accuracies, and cultural-understanding claims need corrected reanalysis and replication. It neither measures psychometric personality traits nor demonstrates persistent cultural identity.

Pregunta de investigación

¿Hasta qué punto los LLM distinguen los extremos de cinco dimensiones culturales de Hofstede y adaptan sus consejos a la puntuación atribuida a un país cuando reciben una persona nacional o un prompt en un idioma asociado?

Método

Se crean 50 dilemas binarios por cada una de cinco dimensiones de Hofstede. Individualismo usa 50 prompts manuales; las otras dimensiones combinan 10 manuales y 40 ampliados con GPT-3.5. Cada dilema exige escoger un solo extremo. Se aplican personas nacionales en inglés o traducciones NLLB-200, y se consultan cinco LLM. Otro paso LLM selecciona cuál de dos respuestas canónicas se aproxima más a la salida y SentenceTransformer asigna la etiqueta final. Se agregan porcentajes por país, correlaciones de Pearson y una separabilidad basada en el mejor umbral, junto con inspección cualitativa.

Muestra: El diseño declara 36 países y 36 idiomas, agrupados por presencia web en recursos altos, medios y bajos. Los CSV base contienen 36 países en persona (1.800 filas por dimensión) pero 34 en multilingüe (1.700), sin conciliación explícita. Hay 50 dilemas por dimensión. Los resultados varían entre una, cinco o, en el código actual, dos rondas por modelo; por archivo se publican entre 1.700 y 9.000 respuestas.

Hallazgos

  • Los LLM pueden inclinarse hacia extremos distintos de una dimensión y variar por país o idioma, pero la relación con las puntuaciones nacionales de Hofstede es generalmente débil, irregular y en ocasiones inversa.
  • El paper destaca GPT-4o multilingüe en individualismo para idiomas de alto recurso con r=0,71 y p<0,05; es una comparación seleccionada entre muchas y no se acompaña de corrección por multiplicidad.
  • Al recalcular las 50 correlaciones publicadas usando el país como unidad, 13 tienen p<0,05 sin corregir y ninguna alcanza el umbral Bonferroni de 0,001. Los notebooks, al pseudorreplicar porcentajes nacionales por cada respuesta, marcan 40 de 50 como significativas.
  • Los modelos prefieren respuestas de orientación a largo plazo en más del 80 % de muchos experimentos y tienden hacia el extremo bajo de MAS, lo que apunta a sesgos globales de respuesta más que a adaptación cultural específica.
  • Las salidas cualitativas incluyen asociaciones estereotípicas y fabricaciones: referencias soviéticas para Bielorrusia, dichos armenios o rusos inventados, vodka y caricaturas de acento francés.
  • La Tabla 3 informa máximos de accuracy entre 0,58 y 0,86, pero el notebook selecciona el mejor de 100 umbrales sobre los mismos países y no evalúa generalización fuera de muestra.

Limitaciones

  • Las puntuaciones Hofstede son agregados nacionales, originalmente derivados de encuestas laborales, y no describen necesariamente a una persona. Inferir consejo individual desde ellas incurre en riesgo de falacia ecológica y estereotipo nacional.
  • Los dilemas obligan a escoger entre dos opciones y eliminan matices. Algunos mezclan cultura con prudencia médica, moral, familiar o económica, por lo que una elección no identifica limpiamente una dimensión cultural.
  • Los notebooks expanden cada porcentaje nacional a todas las filas antes de Pearson. Esto preserva r pero infla n de 34–36 países a 1.700–9.000 respuestas no independientes y produce p-valores artificialmente pequeños.
  • Se prueban al menos 50 correlaciones globales, además de estratos de recursos, sin corrección por comparaciones múltiples. Ninguna de las 50 globales recalculadas sobre países supera Bonferroni.
  • La Tabla 2 asigna significación a correlaciones diminutas y la mayoría de las estrellas contradicen el texto de resultados. Los p-valores publicados no deben interpretarse como evidencia válida.
  • La accuracy es el máximo de un barrido de 100 umbrales sobre el mismo conjunto y en ambas direcciones. No hay train/test, validación cruzada, intervalos ni baseline de selección.
  • La clasificación automática no publica un conjunto humano de referencia, acuerdo interanotador, sensibilidad a prompts ni precisión del etiquetador. Usa otro LLM y embeddings para juzgar respuestas de LLM.
  • El clasificador de los diez scripts compara floats mediante expresiones con el operador and, que devuelven un operando en Python. Esto hace asimétrica e incorrecta la decisión entre choice A, choice B e Inconclusive.
  • Los diez scripts comparan la etiqueta correcta con “Low Power Distanc”, truncada, de modo que las respuestas de baja distancia al poder no pueden marcarse adherentes en esa rama.
  • Los scripts actuales generan dos rondas, los CSV de GPT-4/GPT-4o y parte de Command R+ contienen cinco, y Gemma/Llama/otros resultados de Command R+ contienen una. No hay trazabilidad de configuración por artefacto.
  • No se fijan semillas y la generación local usa muestreo con temperatura 0,6. Las APIs, modelos y prompt improver no están congelados con fecha o snapshot suficiente.
  • No existe requirements, pyproject, lockfile, suite de tests, CI, licencia o release etiquetada. El README es una sola línea y no documenta un procedimiento de reproducción.
  • El script BLEU compara traducciones directamente con referencias en inglés, en vez de traducciones humanas en el idioma destino o back-translation; ese valor no demuestra calidad de traducción.
  • El dataset multilingüe publicado cubre 34 países frente a los 36 declarados, y el campo Personas_or_Multilingual está escrito como Personas también en el script multilingüe de OpenAI y otros scripts.
  • Idioma y país no tienen correspondencia uno a uno. Idiomas transnacionales y personas formuladas como “proudly and thoroughly from” pueden inducir clichés y confundir conocimiento cultural con estereotipo.
  • La inspección ética reconoce sobregeneralización, pero la recomendación de adaptar respuestas a un país conocido puede causar trato estereotípico si no se recogen los valores reales del individuo.

Qué no demuestra

  • No demuestra que los LLM comprendan, interioricen o representen causalmente valores culturales; solo observa elecciones bajo prompts específicos y un etiquetado automático defectuoso.
  • No establece que la nacionalidad o el idioma permitan inferir los valores de una persona ni que sea deseable personalizar consejos a partir de ese proxy.
  • No proporciona evidencia estadística fiable para las estrellas de la Tabla 2 ni una accuracy predictiva fuera de muestra para la Tabla 3.
  • No demuestra mejor alineación en culturas no occidentales o idiomas de bajos recursos; los patrones varían por modelo, dimensión y enfoque y a menudo son inversos.
  • No mide rasgos de personalidad con instrumentos psicométricos, estabilidad temporal, identidad persistente, coherencia entre contextos o una personalidad sintética completa.
  • No permite reproducir de extremo a extremo el experimento publicado desde una release congelada sin corregir el código, reconstruir entornos y aclarar la deriva entre scripts y CSV.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2406.14805v2, submitted 21 June 2024, revised 5 August 2025; KDD 2025, 22 pages

Fuente consultada: https://arxiv.org/pdf/2406.14805v2

Revisión: Codex full-text, bilingual-fidelity, 22-page visual, arXiv-v2, KDD-2025, official-repository, statistical-reanalysis, pseudoreplication, multiple-comparison, threshold-selection, classification-code, translation-validity, cultural-construct, stereotype-risk, reproducibility and scope-fit audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4
  • GPT-4o
  • Command R+
  • Gemma-7B-IT
  • Llama-3-8B-Instruct
  • GPT-3.5 for prompt augmentation
  • Anthropic prompt improver for paraphrasing
  • NLLB-200-3.3B for translation
  • SentenceTransformer for response-label similarity

Instrumentos y métricas

  • Five Hofstede cultural dimensions
  • Forced-choice advice dilemmas
  • Country-persona prompting
  • Multilingual prompting with NLLB-200 translations
  • LLM-based canonical-answer selection
  • SentenceTransformer similarity classification
  • Pearson correlation
  • Post-selected threshold accuracy
  • Qualitative stereotype inspection

Datos utilizados

  • 250 base advice dilemmas, 50 per Hofstede dimension
  • Persona datasets: 1,800 rows per dimension across 36 countries
  • Multilingual datasets: 1,700 rows per dimension across 34 countries in the repository
  • Released result CSVs for five models and two prompting approaches

Evidencia y localización

  • Pregunta, contribución y conclusión declarada: Paper, pp. 1–2, Abstract and Introduction
  • Construcción de prompts, personas, traducciones y modelos: Paper, pp. 3–4, Section 3 and Figure 1
  • Correlaciones, significación y accuracy: Paper, pp. 4–6, Tables 2–3 and Section 4
  • Preferencias, estereotipos y ejemplos cualitativos: Paper, pp. 6–7, Sections 4.2–4.3
  • Limitaciones y ética reconocidas: Paper, p. 7, Sections 6–7
  • Prompts, metadatos y resultado seleccionado por recursos: Paper, pp. 10–11, Appendices E–F and Table 7
  • Distribuciones y correlaciones completas: Paper, pp. 12–22, Tables 8–15
  • Pseudorreplicación Pearson y accuracy post-seleccionada: Official repository commit bfc069e0b9a881e10f40c2fe7ad7225a85c04d32, ten visualization notebooks
  • Errores de clasificación, adherencia PDI y deriva de rondas: Official repository commit bfc069e0b9a881e10f40c2fe7ad7225a85c04d32, ten experimentation scripts
  • Desajuste de países, artefactos y reproducibilidad: Official repository commit bfc069e0b9a881e10f40c2fe7ad7225a85c04d32, data, results, README and repository root
  • Inspección visual integral: Paper, all 22 rendered pages, including every table, plot, appendix and qualitative example