El artículo operacionaliza la alineación cultural como la coincidencia entre la opción elegida por un LLM y la respuesta de una persona concreta del World Values Survey (WVS), emparejada entre Egipto y Estados Unidos por sexo, edad, estado civil, educación y clase social. De las muestras originales de 1.200 y 2.596 participantes se seleccionan 303 personas por país; se usan 30 preguntas de siete temas, cuatro paráfrasis en inglés y traducciones árabes revisadas. GPT-3.5-turbo-1106, AceGPT-Chat-13B, LLaMA-2-Chat-13B y mT0-XXL generan cinco respuestas a temperatura 0,7 por combinación y se aplica voto mayoritario. La métrica hard exige la misma opción; la soft concede crédito por proximidad en escalas ordinales. En las tablas publicadas, la coincidencia media es mayor con respuestas estadounidenses que egipcias: 59,07 frente a 47,16 en soft y 33,78 frente a 27,03 en hard. Para Egipto, preguntar en árabe mejora ambas métricas en GPT-3.5 y AceGPT, pero no de forma uniforme en LLaMA-2 y mT0; para Estados Unidos suele favorecer el inglés, salvo mT0. Los promedios también son menores para personas de clase y educación bajas, mujeres y jóvenes, aunque el paper no aísla estadísticamente esos factores. Un experimento limitado a GPT-3.5, personas egipcias y prompts ingleses añade un marco de razonamiento antropológico: soft pasa de 0,4834 a 0,5102 y hard de 0,2443 a 0,2838. Esto no demuestra comprensión cultural: la referencia es la respuesta individual de una sola persona con demografía semejante, no una verdad cultural ni una estimación poblacional. Tampoco se informan tests, intervalos o modelos multinivel. La auditoría del repositorio oficial confirma 2.937.183 respuestas crudas, pero detecta deriva entre paper y artefacto: hay 31 preguntas generadas y 30 analizadas; los completions árabes de EE. UU. suelen usar 275 personas por filtrar a quienes nacieron fuera del país; varios archivos GPT están incompletos; los desempates se resuelven aleatoriamente sin semilla; se descartan salidas inválidas; faltan módulos e inputs citados; y el código actual conserva solo una de cuatro paráfrasis. El patrón publicado es informativo para este montaje, pero las tablas no se reproducen de extremo a extremo desde el commit auditado.
Pregunta de investigación
¿Hasta qué punto cuatro LLM reproducen respuestas individuales del WVS de personas emparejadas en Egipto y Estados Unidos, y cómo cambian esa coincidencia el idioma del prompt, la mezcla lingüística de preentrenamiento, la demografía, el tema y un prompt de razonamiento antropológico?