CultureLLM: Incorporating Cultural Differences into Large Language Models

Sociedad, cultura y comportamiento colectivo2024arXivRevisión editorial aprobada

Autores: Cheng Li, Mengzhou Chen, Jindong Wang, Sunayana Sitaram, Xing Xie

Palabras clave: Computation and Language, Artificial Intelligence, Machine Learning

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
7
Hallazgos
20
Limitaciones
11
Evidencias

Resumen editorial

Español

CultureLLM no crea una base de conocimiento cultural ni evalúa personalidad. Parte de 50 preguntas seleccionadas de la World Values Survey (WVS), asigna a cada cultura la respuesta media de uno o varios países y genera 500 paráfrasis mediante GPT-4, sustitución de sinónimos y un filtro de similitud BERT. Con esas preguntas y respuestas afina nueve GPT-3.5-0613 específicos, árabe, bengalí, chino, inglés de Estados Unidos, alemán, coreano, portugués, español y turco, y un CultureLLM-One unificado. El apéndice replica la idea con LoRA sobre Llama-2-70B. La evaluación principal usa 59 conjuntos de clasificación zero-shot sobre odio, ofensa, abuso, toxicidad, amenaza, sesgo, postura y spam; un conjunto generativo de 65 preguntas eleva el total declarado a 60.

El artículo informa que los modelos específicos mejoran en promedio un 8,1 % frente a GPT-3.5 y un 9,5 % frente a Gemini Pro, con resultados próximos a GPT-4. CultureLLM-One también mejora el promedio, pero queda por debajo de los modelos específicos; en coreano no se observa una mejora clara. En la tarea generativa, Gemini Pro prefiere CultureLLM a GPT-3.5 en ocho de nueve culturas, mientras turco obtiene WinRate -0,062. La evidencia sostiene que un pequeño ajuste supervisado cambia la conducta de clasificación y reduce respuestas neutrales, pero no permite atribuir causalmente la mejora a “comprensión cultural”: las tareas miden moderación de contenido y el ajuste también puede mejorar formato, obediencia o calibración.

La validez y reproducibilidad son limitadas. El paper mezcla macro-F1 con la métrica de CValues, normaliza y promedia 59 tareas heterogéneas, llama a las diferencias “significativas” sin definir test, unidad, intervalos o repeticiones, y no publica los resultados numéricos en el repositorio. El código oficial auditado en dcdb64d7289a8ee88c7e718fb5e8641bf97c441e contiene datos y scripts, pero no resultados, release, licencia, entorno bloqueado, CI ni tests. Los modelos, endpoints y claves de los experimentos están sustituidos por xxx. El script multiclase de odio asigna HS2–HS6 a HS1; test.sh usa china aunque el código solo reconoce chinese; la generación usa temperatura y aleatoriedad sin semilla. La evaluación abierta usa Gemini Pro como único juez y no publica prueba humana. El estudio de similitud sí reúne 50 estudiantes de inglés de 22–26 años, pero la nota humana es 4,60/5; el 4,84 agregado y su conversión a aproximadamente 96,5 % mezclan humanos con GPT-4 y Gemini Pro. El propio corpus publicado contiene paráfrasis antinaturales que matizan la afirmación de equivalencia casi perfecta.

CultureLLM es relevante para estudiar cómo el ajuste cultural puede alterar el comportamiento aparente de un modelo, y también alerta sobre un riesgo central: convertir promedios nacionales en una voz cultural puede fijar estereotipos y reproducir opiniones dañinas. No mide rasgos psicométricos, estabilidad de una personalidad, identidad persistente ni diferencias individuales dentro de cada cultura.

English

CultureLLM neither builds a cultural knowledge base nor evaluates personality. It starts with 50 selected World Values Survey (WVS) questions, assigns each culture the average answer from one or more countries, and creates 500 paraphrases using GPT-4, synonym replacement, and a BERT similarity filter. These questions and answers fine-tune nine culture-specific GPT-3.5-0613 models, Arabic, Bengali, Chinese, US English, German, Korean, Portuguese, Spanish, and Turkish, and one unified CultureLLM-One. The appendix applies the same idea with LoRA on Llama-2-70B. The main evaluation uses 59 zero-shot classification datasets covering hate, offense, abuse, toxicity, threat, bias, stance, and spam; a 65-question generative set brings the stated total to 60.

The paper reports that culture-specific models improve on average by 8.1% over GPT-3.5 and 9.5% over Gemini Pro, with results close to GPT-4. CultureLLM-One also improves the average but trails the specific models; Korean shows no clear gain. On the generative task, Gemini Pro prefers CultureLLM over GPT-3.5 in eight of nine cultures, while Turkish has a WinRate of -.062. The evidence supports that small supervised fine-tunes change classification behavior and reduce neutral responses, but it cannot causally attribute improvement to “cultural understanding”: the tasks measure content moderation, and fine-tuning can also improve formatting, instruction following, or calibration.

Validity and reproducibility are limited. The paper mixes macro-F1 with the CValues metric, normalizes and averages 59 heterogeneous tasks, calls differences “significant” without defining a test, unit, interval, or repeated-run protocol, and releases no numeric result artifacts. The official code audited at dcdb64d7289a8ee88c7e718fb5e8641bf97c441e contains data and scripts but no results, release, license, locked environment, CI, or tests. Experimental model IDs, endpoints, and keys are replaced with xxx. The fine-grained hate parser maps HS2–HS6 to HS1; test.sh passes china although the code only recognizes chinese; generation uses temperature and unseeded randomness. Open-ended evaluation uses Gemini Pro as the sole judge and has no human validation. The similarity study does include 50 English-major students aged 22–26, but the human score is 4.60/5; the 4.84 aggregate and its conversion to about 96.5% mix humans with GPT-4 and Gemini Pro. The released corpus itself contains unnatural paraphrases, qualifying the near-perfect equivalence claim.

CultureLLM is relevant to how cultural fine-tuning can alter apparent model behavior, and it also exposes a central risk: turning national averages into a cultural voice can fix stereotypes and reproduce harmful opinions. It does not measure psychometric traits, stable personality, persistent identity, or within-culture individual differences.

Pregunta de investigación

¿Puede un ajuste fino económico basado en 50 preguntas de la WVS y paráfrasis sintéticas producir modelos específicos o unificados que rindan mejor en tareas multilingües asociadas a distintas culturas?

Método

Se seleccionan manualmente 50 preguntas WVS de siete temas y se usa la respuesta media de países representativos como etiqueta cultural. GPT-4 genera cinco plantillas por pregunta; un filtro de similitud BERT conserva paráfrasis por encima de 0,8 y una segunda etapa sustituye sinónimos hasta formar 500 ejemplos. Se afinan GPT-3.5-0613 específicos y unificados, y Llama-2-70B mediante LoRA. Se comparan con GPT-3.5, GPT-4-1104, Gemini Pro, RAG y modelos culturales sobre 59 datasets de clasificación, una evaluación generativa juzgada por Gemini, ablaciones, BBH/GSM8K y un estudio humano de similitud.

Muestra: La evaluación principal reúne 59 datasets y 68.607 ejemplos; al añadir 65 preguntas generativas el texto declara 60 conjuntos y 68.672 ejemplos. Las culturas se aproximan mediante nueve idiomas y países representativos. El ajuste usa 50 preguntas WVS más 500 aumentadas, aunque los archivos de fine-tuning publicados contienen normalmente 1.100 mensajes por cultura porque combinan dos bloques de 550. El estudio humano incluye 25 hombres y 25 mujeres, todos estudiantes con alta exposición al inglés, de 22 a 26 años; 26 tienen grado y 24 máster.

Hallazgos

  • El paper informa una mejora media de 8,1 % sobre GPT-3.5, 9,5 % sobre Gemini Pro y 7,94 % sobre RAG, con rendimiento agregado cercano a GPT-4; no publica un test estadístico que sustente el término “significativo”.
  • Los modelos culturales específicos suelen superar al modelo unificado. No hay mejora clara en coreano y el propio texto atribuye esa excepción, sin prueba, a menor exposición del modelo base.
  • En la evaluación abierta juzgada por Gemini Pro, CultureLLM vence a GPT-3.5 en ocho culturas; los WinRate van de 0,215 a 0,615 salvo turco, con -0,062.
  • La Tabla 8 informa para CultureLLM-One un promedio 0,597 frente a 0,556 de GPT-3.5. WVS solo alcanza 0,569 y las etapas parciales 0,564 y 0,563, por lo que los componentes aislados no mejoran monotónicamente.
  • En Llama-2-70B, el promedio pasa de 0,3909 a 0,3997 para el modelo unificado y 0,4093 para los específicos. No hay repeticiones o intervalos que permitan separar señal de variación del entrenamiento.
  • El control de olvido mantiene GSM8K prácticamente constante, pero CultureLLM-En baja BBH de 51,2 a 48,8; por tanto, la afirmación de que no hay efecto negativo tiene al menos una excepción publicada.
  • Los humanos puntúan la equivalencia semántica en 4,60 ± 0,28 sobre 5; GPT-4 da 4,99 y Gemini 4,93. La media 4,84 mezcla evaluadores humanos y automáticos y no es una tasa de aprobación humana.

Limitaciones

  • Idioma, país y cultura se usan casi como equivalentes, aunque el apéndice reconoce que el idioma es solo una parte de la cultura y que las fronteras culturales son fluidas.
  • Promediar respuestas WVS de uno o varios países borra variación individual, regional, generacional y social. Convertir ese promedio en la voz de un chatbot incurre en riesgo de falacia ecológica y estereotipo.
  • Las 59 tareas principales evalúan moderación o clasificación de contenido, no conocimiento cultural ni alineación directa con valores WVS. La mejora puede deberse a obediencia de formato o calibración.
  • Se normalizan y promedian macro-F1, accuracy y tareas con distinto número de clases, dificultad y tamaño. No se define claramente la ponderación ni se publica una tabla numérica completa legible para cada ejecución.
  • El término “significativamente” no va acompañado de hipótesis, test, unidad de análisis, p-valores, intervalos, corrección múltiple o repeticiones. Las barras de la Figura 3 no se definen.
  • Las APIs cerradas y snapshots GPT-3.5-0613, GPT-4-1104 y Gemini Pro han cambiado. El paper admite que los resultados pueden variar con las versiones de ChatGPT.
  • La generación usa temperatura 0,7, sustitución aleatoria y conjuntos sin semillas. No se reportan réplicas de aumento, ajuste o evaluación.
  • La selección manual de 50 preguntas y de países representativos no tiene protocolo de selección reproducible, análisis de sensibilidad ni conjunto WVS independiente para validar que se aprendieron valores.
  • El estudio humano solo mide similitud de paráfrasis en inglés con estudiantes de inglés de 22–26 años. No informa acuerdo interevaluador, distribución por ítem, análisis cultural, compensación o identificador de revisión ética.
  • El 96,5 % no es el resultado humano: la puntuación humana es 4,60/5 y la media 4,84 incorpora dos jueces LLM. Tratar una escala ordinal de 1–5 como porcentaje de aprobación tampoco está justificado.
  • Los datos publicados contienen paráfrasis gramatical o semánticamente defectuosas, como “a essential”, “a insight”, “right single”, “extremist tasks” y “only my religion meets the standard of consent”.
  • La evaluación generativa crea las preguntas con GPT-4 y usa Gemini Pro como único juez de GPT-3.5 frente a CultureLLM. No hay jueces humanos, control de orden, calibración del juez ni incertidumbre.
  • El control de olvido usa solo 100 ejemplos por tarea BBH por coste; CultureLLM-En cae en BBH. GSM8K cambia décimas, sin estimación de varianza.
  • El repositorio no contiene los resultados del paper, modelos afinados, IDs de jobs, logs o una release experimental. Todos los endpoints de CultureLLM y las claves están sustituidos por xxx.
  • No hay requirements bloqueado, pyproject, entorno, tests unitarios, CI, licencia o documentación de hardware/coste reproducible. El archivo test.py agrega resultados; no es una suite de pruebas.
  • El postprocesado de hate speech fino asigna las categorías HS2, HS3, HS4, HS5 y HS6 a HS1, corrompiendo esa métrica multiclase.
  • test.sh invoca la lengua china, mientras getModel y getDataPath solo implementan chinese; la ruta queda sin asignar. El script tampoco prueba Gemini, RAG o CultureLLM-One y duplica el bloque chino.
  • El código desactiva la verificación TLS para un endpoint Llama y desactiva filtros de seguridad de Gemini en categorías sensibles, decisiones que requieren justificación y aislamiento.
  • El repositorio redistribuye unos 87 MB de datasets de redes sociales con lenguaje dañino y posibles datos personales, pero no incorpora licencias, fichas de datos, procedencia por archivo ni protocolo de privacidad.
  • La afirmación de coste de seis dólares no desglosa precios, tokens, reintentos, generación GPT-4, evaluación, fecha tarifaria ni coste de las diez variantes.

Qué no demuestra

  • No demuestra que CultureLLM comprenda una cultura; demuestra cambios de salida tras ajuste supervisado y prompting lingüístico en tareas concretas.
  • No establece que un idioma o promedio nacional represente a todas las personas de una cultura ni que un chatbot deba expresar esas opiniones agregadas.
  • No demuestra reducción general de sesgo o daño. Afinar con promedios sobre género, religión, inmigración, vigilancia o autoridad también puede consolidar opiniones discriminatorias.
  • No valida estadísticamente una superioridad universal frente a GPT-4, GPT-3.5, Gemini, RAG o modelos culturales en todos los datasets, culturas y ejecuciones.
  • No permite reproducir las tablas principales a partir del repositorio público actual sin modelos, endpoints, resultados y configuración histórica.
  • No mide Big Five, otros rasgos psicométricos, estabilidad temporal, coherencia transituacional, identidad persistente ni una personalidad sintética individual.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2402.10946v3, submitted 9 February 2024, revised 3 December 2024; NeurIPS 2024, 40 pages

Fuente consultada: https://arxiv.org/pdf/2402.10946v3

Revisión: Codex full-text, bilingual-fidelity, 40-page visual, arXiv-v3, NeurIPS-2024, official-repository, construct-validity, heterogeneous-metric, statistical-claim, augmentation-quality, human-study, LLM-judge, code-correctness, data-governance, cultural-stereotype, forgetting, cost and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-3.5-0613 fine-tuned CultureLLM models
  • CultureLLM-One unified GPT-3.5 model
  • GPT-3.5 baseline
  • GPT-4-1104 baseline and augmentation model
  • Gemini Pro baseline and generative judge
  • Llama-2-70B and LoRA CultureLLM variants
  • SeaLLM
  • TaiwanLLM
  • CultureBank
  • BERT-base-uncased semantic filter

Instrumentos y métricas

  • World Values Survey seed questions and national response averages
  • GPT-4 semantic-template generation
  • GPT-4 synonym generation and random replacement
  • BERT cosine-similarity filter at 0.8
  • Macro F1 over content-moderation classifications
  • CValues automatic metric
  • Gemini Pro pairwise judgment and WinRate
  • Perplexity and diversity gain
  • Five-point human semantic-similarity rating
  • BBH and GSM8K forgetting checks
  • LoRA fine-tuning ablation

Datos utilizados

  • 50 selected World Values Survey questions across seven topics
  • 500 GPT-4 and synonym-augmented training samples
  • 59 classification datasets with 68,607 reported test items across nine languages
  • 65 GPT-4-generated open-ended WVS questions
  • CValues Chinese values benchmark
  • BIG-Bench Hard, 100 items from each of 21 tasks
  • GSM8K
  • 100 seed-generation pairs rated by 50 participants

Evidencia y localización

  • Alcance, método y afirmaciones principales: Paper, pp. 1–3, Abstract, Introduction and Contributions
  • Selección WVS y aumento semántico: Paper, pp. 4–5, Sections 3.1–3.3 and Figure 2
  • Fine-tuning, datasets, baselines y métricas: Paper, pp. 5–7, Sections 3.4 and 4.1–4.2
  • Evaluación abierta, ablación y calidad sintética: Paper, pp. 7–9, Sections 4.3–4.6 and Tables 1–2
  • Olvido, Llama, impacto y limitaciones: Paper, pp. 9–10, Sections 5–6 and Figure 5
  • Definición de cultura, WVS y desglose de 59 datasets: Paper, pp. 17–24, Appendices A–B and Tables 3–4
  • Prompts, agregación y resultados detallados: Paper, pp. 25–31, Appendices C–E and Tables 5–10
  • Excepción de olvido y participantes humanos: Paper, pp. 32–33, Tables 11–12 and Appendix F
  • Declaraciones de reproducibilidad, estadística, ética y activos: Paper, pp. 34–40, NeurIPS checklist
  • Código, datos y defectos de evaluación: Official CultureLLM repository commit dcdb64d7289a8ee88c7e718fb5e8641bf97c441e, main, test_offensEval, test.sh, data and repository root
  • Inspección visual integral: Paper, all 40 rendered pages, including every figure, table, appendix and checklist page