Moral Foundations of Large Language Models

Evaluación y validez psicométrica2024ACL AnthologyRevisión editorial aprobada

Autores: Marwa Abdulhai, Gregory Serapio-García, Clément Crepy, Daria Valter, John Canny, Natasha Jaques

Palabras clave: Artificial Intelligence, Computation and Language, Computers and Society, Moral Foundations Theory

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
9
Hallazgos
12
Limitaciones
11
Evidencias

Resumen editorial

Español

El trabajo aplica el Moral Foundations Questionnaire de 30 ítems a ChatGPT, cuatro motores GPT-3 y PaLM 62B para describir cómo completan cinco escalas, cuidado/daño, justicia, lealtad al grupo, autoridad y pureza, y comparar esos perfiles con medias publicadas de participantes estadounidenses, surcoreanos y de una muestra web. También examina la variación bajo 50 fragmentos de diálogo, busca manualmente prompts que eleven cada fundamento y prueba nueve condiciones de prompt en un diálogo de donación. Es un estudio temprano y útil para mostrar que una instrucción política o moral breve puede cambiar tanto las respuestas al cuestionario como una decisión generada aguas abajo. No obstante, las puntuaciones deben leerse como conducta de completado contextual, no como valores morales poseídos por el modelo.

En la comparación descriptiva, ChatGPT y text-davinci-002 quedan más cerca de la media de participantes web conservadores; Curie, Babbage y PaLM también tienen como vecino más próximo alguno de los grupos conservadores seleccionados, mientras text-davinci-003 queda más cerca de coreanos moderados. La asignación es frágil: para ChatGPT la distancia L1 a web conservador es 2,896 frente a 2,916 a web moderado, y para PaLM es 0,900 a coreano conservador frente a 0,933 a coreano moderado. No hay intervalos, modelo de error ni contraste que determine si esas diferencias son distinguibles. Que todo punto tenga un vecino más cercano tampoco convierte esa etiqueta en diagnóstico de ideología, y el t-SNE solo ofrece una visualización dependiente de su ajuste.

Los prompts elegidos mueven el perfil MFQ de DaVinci2 y la donación media varía desde 23,93 dólares con «eres políticamente conservador» hasta 144,87 con «te sacrificarías por tu país». La condición de cuidado/daño dona 88,09, un 39,2 % menos que la de lealtad al grupo. Estos son efectos descriptivos claros del texto añadido al contexto, pero no identifican la mediación causal de un fundamento moral: frases sobre sacrificio, equidad, jerarquía o daño pueden modificar directamente una respuesta caritativa. El artículo afirma significación sin presentar prueba, p-valor, tamaño de efecto definido ni intervalo de confianza, y alterna 20 repeticiones por condición con «7 de 10» negativas en la condición conservadora.

La auditoría del código reduce además la reproducibilidad. El experimento de contexto descrito como BookCorpus usa archivos de diálogos de películas; no se publican implementaciones de PaLM, ChatGPT ni donación; el script de maximización invierte argumentos, omite un parámetro obligatorio y selecciona text-davinci-003 aunque el artículo atribuye esa fase a DaVinci2. Una coma ausente concatena un ítem de pureza con la pregunta de control matemática, deja 15 preguntas en el primer bloque y desplaza índices usados para puntuar varias escalas. El bucle público genera 60 respuestas por ítem, seis ejemplos por diez generaciones, frente a las 50 declaradas. Por tanto, la evidencia sólida es que ciertos prompts cambian salidas MFQ y donaciones en modelos históricos; no queda validada una inclinación política estable, comparable psicométricamente con humanos o reproducible de extremo a extremo.

English

The paper applies the 30-item Moral Foundations Questionnaire to ChatGPT, four GPT-3 engines, and 62B PaLM to describe how they complete five scales, care/harm, fairness, ingroup loyalty, authority, and purity, and compares those profiles with published means from US, South Korean, and online human samples. It also measures variation under 50 dialogue fragments, manually searches for prompts that raise each foundation, and tests nine prompt conditions in a donation dialogue. The study is an informative early demonstration that a short political or moral instruction can alter both questionnaire answers and a downstream generated decision. The scores, however, measure context-conditioned completion behavior rather than moral values possessed by a model.

In the descriptive comparison, ChatGPT and text-davinci-002 are closest to the conservative online mean; Curie, Babbage, and PaLM also have one of the selected conservative groups as their nearest neighbor, while text-davinci-003 is closest to moderate South Koreans. Those labels are fragile: ChatGPT's L1 distance is 2.896 to online conservatives versus 2.916 to online moderates, and PaLM's is 0.900 to Korean conservatives versus 0.933 to Korean moderates. No uncertainty model or test establishes that either gap is distinguishable. Every point necessarily has a nearest group, which is not an ideological diagnosis, and t-SNE provides only a configuration-dependent visualization.

Selected prompts move DaVinci2's MFQ profile, and mean donation ranges from $23.93 under “you are politically conservative” to $144.87 under “you would sacrifice yourself for your country.” The care/harm condition donates $88.09, 39.2% less than the ingroup condition. These are clear descriptive effects of adding text to the context, but they do not identify mediation by a moral foundation: statements about sacrifice, equity, hierarchy, or harm can directly affect a charitable response. The paper calls the differences significant without reporting a statistical test, p-value, defined effect size, or confidence interval, and it alternates between 20 runs per condition and “7/10” refusals under the conservative prompt.

Artifact auditing further weakens reproducibility. The context experiment described as BookCorpus reads movie-dialogue files; no PaLM, ChatGPT, or donation implementation is released; and the maximization script reverses arguments, omits a required parameter, and selects text-davinci-003 although the paper assigns that phase to DaVinci2. A missing comma concatenates a purity item with the math attention check, leaves 15 questions in the first block, and shifts indices used to score several scales. The public loop produces 60 answers per item, six example labels times ten generations, rather than the reported 50. The defensible conclusion is therefore that some prompts changed MFQ completions and donations in historical models, not that a stable political orientation, human-comparable moral psychology, or end-to-end reproducible mechanism was established.

Pregunta de investigación

¿Qué perfiles del Moral Foundations Questionnaire producen varios LLM, cuán similares son a medias de poblaciones humanas y estables ante contextos no morales, y pueden prompts políticos o de fundamento moral modificar esos perfiles y una decisión posterior de donación?

Método

Se administra MFQ30 de forma stateless, con respuestas 0–5 y voto mayoritario, a ChatGPT/GPT-3.5, text-davinci-003, text-davinci-002, text-curie-001, text-babbage-001 y PaLM 62B. Los cinco promedios se comparan mediante suma de errores absolutos y t-SNE con medias agregadas de tres estudios humanos separadas por país y autoidentificación política. La consistencia se explora ante 50 diálogos supuestamente extraídos de BookCorpus. Para DaVinci2 se prueban frases candidatas y se conserva la que maximiza cada fundamento respecto de los demás. Finalmente, en un diálogo de Save the Children se comparan cinco prompts de fundamento, tres políticos y ausencia de prompt; el método declara 20 ejecuciones por condición y estima la donación esperada a partir de cinco importes posibles. La revisión contrastó el arXiv, las actas EMNLP completas, tablas y figuras y todo el repositorio público.

Muestra: La comparación humana reutiliza medias de 1.613 participantes web de Project Implicit, 7.226 universitarios estadounidenses de 18–30 años y 478 universitarios surcoreanos, estratificados por autoidentificación política; no se reanalizan observaciones individuales. Para cada LLM, el artículo declara 50 respuestas por ítem MFQ y cuatro contextos políticos, sin prompt, liberal, moderado y conservador, aunque el código público genera 60 por ítem. La consistencia usa 50 fragmentos de diálogo para DaVinci2 y PaLM. La donación evalúa nueve condiciones y declara 20 ejecuciones por condición, pero la narración de resultados cuenta 7 de 10 negativas para la condición conservadora.

Hallazgos

  • Entre las medias humanas elegidas, text-davinci-002 tiene su menor distancia con participantes web conservadores (1,230); ChatGPT también (2,896), text-curie-001 con coreanos conservadores (3,500), text-babbage-001 con estadounidenses conservadores (2,600) y PaLM con coreanos conservadores (0,900). Text-davinci-003 queda más cerca de coreanos moderados (1,817).
  • Las etiquetas de vecino más próximo no siempre están separadas: ChatGPT difiere solo 0,020 entre web conservador y moderado; PaLM, 0,033 entre coreano conservador y moderado; y text-davinci-003, 0,016 entre coreano moderado y liberal.
  • DaVinci2 sin prompt pondera más cuidado y justicia y menos autoridad. El prompt liberal reproduce cualitativamente más énfasis en cuidado/justicia; el conservador reduce mucho justicia y queda menos cerca de las medias conservadoras que el perfil por defecto.
  • Bajo 50 fragmentos, las distribuciones representadas muestran poca variación en justicia y lealtad al grupo y mayor variación en cuidado y autoridad para DaVinci2; PaLM aparece visualmente más estable. No se publican métricas agregadas ni pruebas de igualdad de varianzas.
  • La búsqueda manual encuentra frases que elevan cada puntuación MFQ, pero algunas son semánticamente ambiguas: «algunas personas son más importantes que otras» maximiza pureza aunque parece una afirmación jerárquica, y no se encuentra justicia alta sin aumentar también cuidado.
  • La donación media es 144,87 ± 6,35 con lealtad al grupo, 112,45 ± 14,91 con pureza, 108,07 ± 17,15 con justicia, 97,71 ± 35,91 con autoridad, 88,09 ± 34,64 con cuidado y 92,66 ± 15,17 sin prompt.
  • Los prompts políticos producen 23,93 ± 50,81 dólares para conservador, 79,36 ± 10,43 para moderado y 95,86 ± 7,61 para liberal. La enorme dispersión conservadora y la contradicción 20 frente a 10 ejecuciones impiden una lectura precisa.
  • El 39,2 % menos de donación entre cuidado y lealtad al grupo reproduce la aritmética de la tabla, pero es una comparación entre dos frases distintas y no una estimación causal del peso psicológico de esos fundamentos.
  • La versión EMNLP añade ChatGPT a la comparación y reconoce explícitamente que modelos ajustados con RL producen distribuciones distintas de las humanas y menor sensibilidad del cuestionario.

Limitaciones

  • MFQ fue validado como autoinforme humano; no se demuestra invariancia de medida, estructura factorial, fiabilidad o validez al convertir completados de texto en puntuaciones morales de un LLM.
  • Las comparaciones usan medias de estudios distintos, realizados en otras épocas y poblaciones, sin observaciones individuales, errores estándar, ajuste demográfico ni equivalencia de condiciones de administración.
  • Seleccionar el menor de nueve errores absolutos garantiza un vecino para cada modelo. No hay umbral, clasificación nula, bootstrap o contraste que justifique interpretar ese vecino como ideología del sistema.
  • t-SNE distorsiona distancias globales, depende de hiperparámetros e inicialización y se aplica a muy pocos perfiles de cinco dimensiones; los ejes no tienen significado político intrínseco.
  • Los modelos son históricos y varios están retirados. Faltan snapshots exactos de ChatGPT y PaLM, fecha de consulta, región/API y parámetros completos para todos los proveedores.
  • El experimento de consistencia no informa longitud, selección o contenido de los 50 fragmentos ni métricas numéricas de estabilidad. El repositorio usa Cornell-style movie dialogue files, no la fuente BookCorpus descrita.
  • Los prompts maximizadores se seleccionan tras probar candidatos sobre el mismo modelo y cuestionario, sin conjunto de validación, repetición independiente ni corrección por búsqueda adaptativa.
  • El efecto de donación está confundido por el contenido directo del prompt; no hay diseño de mediación, control semántico, paraphrases balanceadas ni manipulación que cambie MFQ sin cambiar significado relevante para donar.
  • Se emplea una única tarea, una única organización benéfica y un único modelo para el análisis downstream, por lo que no hay generalización a otras decisiones, causas, culturas o sistemas.
  • El artículo usa «significativamente» sin reportar prueba estadística, p-valores, intervalos de confianza o definición del símbolo ±; la descripción de 20 repeticiones contradice el resultado 7/10.
  • El código público concatena por error el ítem de pureza con la pregunta matemática y desplaza índices de puntuación; además, la rama de maximización no puede ejecutarse tal como está por argumentos invertidos y un parámetro ausente.
  • No se publican código de PaLM, ChatGPT o donación, datos crudos/resultados completos, semillas y configuración t-SNE, licencia ni dependencias versionadas; los notebooks ejecutados no sustituyen una canalización reproducible.

Qué no demuestra

  • No demuestra que los modelos tengan creencias, intuiciones, identidad política o fundamentos morales internos comparables con los de una persona.
  • No demuestra un sesgo conservador estable: muestra cercanía descriptiva de respuestas MFQ a ciertas medias elegidas, a veces con márgenes mínimos.
  • No permite atribuir los perfiles al corpus de preentrenamiento, RLHF o tamaño del modelo, porque esos factores no se manipulan de forma controlada.
  • No demuestra que MFQ mida el mismo constructo en humanos y LLM ni que una respuesta «moderada» sea normativamente deseable o neutral.
  • No demuestra que los fragmentos contextuales dejen intacto el perfil bajo idiomas, diálogos prolongados, instrucciones reales o ataques adaptativos.
  • No demuestra que una puntuación MFQ cause la decisión de donar; tanto ambas variables como la donación pueden responder directamente a la frase añadida.
  • No establece efectos en personas, publicidad política real, persuasión, discriminación o daño social; esos riesgos se argumentan como posibilidades.
  • No ofrece un método reproducible o vigente para auditar modelos actuales ni una intervención validada para mitigar sesgo político.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2310.15337v1 (23 Oct 2023); EMNLP 2024 proceedings, DOI 10.18653/v1/2024.emnlp-main.982, also reviewed (PDF SHA-256 c1585b948130bfe8cb927307ca8ea699e0309b784d58bee4096b2e96ec767689); public code commit f2d7f258748171b4a5fbd1bfb7246531e008fd67 audited

Fuente consultada: https://arxiv.org/pdf/2310.15337

Revisión: Codex editorial review and methods/code audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • ChatGPT / GPT-3.5 (snapshot no especificado)
  • GPT-3 text-davinci-003
  • GPT-3 text-davinci-002
  • GPT-3 text-curie-001
  • GPT-3 text-babbage-001
  • PaLM 62B quantized instruction-tuned (checkpoint no especificado)

Instrumentos y métricas

  • Moral Foundations Questionnaire (MFQ30)
  • Five foundation scores: Harm, Fairness, Ingroup, Authority and Purity
  • Sum of absolute errors across five foundation means
  • t-SNE visualization
  • Prompt-context consistency distributions
  • Manual foundation-maximizing prompt search
  • Persuasion for Good / Save the Children donation dialogue

Datos utilizados

  • MFQ human group means from Graham et al. (2009, 2011)
  • MFQ human group means from Kim et al. (2012)
  • 50 dialogue contexts described as BookCorpus
  • Public repository movie_lines.tsv and movie_conversations.tsv
  • Save the Children donation dialogue adapted from Wang et al. (2019)

Evidencia y localización

  • Publicación definitiva, autoría, DOI y paginación: ACL Anthology 2024.emnlp-main.982 and EMNLP 2024 proceedings PDF, pp. 17737–17752
  • Modelos, MFQ, repetición declarada y voto mayoritario: Proceedings paper, pp. 17739–17740, sections 3.1–3.2
  • Muestras humanas y comparación mediante error absoluto y t-SNE: Proceedings paper, p. 17740, Question 1 method
  • Distancias entre cada modelo y grupos humanos: Proceedings paper, pp. 17741–17742, Figure 2 and Table 1
  • Consistencia ante 50 contextos y distribuciones por fundamento: Proceedings paper, pp. 17740 and 17743, Question 2; Appendix Figure 5
  • Búsqueda de prompts maximizadores y correlaciones descriptivas: Proceedings paper, pp. 17740, 17743 and 17750–17751, Question 3 and Appendix 7.8
  • Diseño de donación, importes y contradicción de tamaño muestral: Proceedings paper, pp. 17741 and 17743–17744, Question 4 and Table 2
  • Limitaciones declaradas sobre una tarea, comparación humana, idiomas, RLHF y ausencia de consenso normativo: Proceedings paper, p. 17745, section 5.1
  • Resultados de prompts políticos omitidos en la tabla de actas: arXiv:2310.15337v1, Appendix 7.6.1, Table 3; proceedings Appendix 7.6.1 contains a broken cross-reference
  • Errores del cuestionario, conteo de generaciones y scripts no ejecutables: GitHub abdulhaim/moral_foundations_llm commit f2d7f258748171b4a5fbd1bfb7246531e008fd67; utils/questionnaire_utils.py, utils/gpt3_utils.py and 2-maximized_foundation/haidt_foundation.py
  • Diferencia entre BookCorpus declarado y diálogos usados por el código: GitHub commit f2d7f258748171b4a5fbd1bfb7246531e008fd67; 3-randomized_prompts/haidt_random_corpus.py and bundled movie_lines.tsv/movie_conversations.tsv