Investigating Political and Demographic Associations in Large Language Models Through Moral Foundations Theory

Sociedad, cultura y comportamiento colectivo2025AAAIRevisión editorial aprobada

Autores: Nicole Smith-Vaniz, Harper Lyon, Lorraine Steigner, Ben Armstrong, Nicholas Mattei

Palabras clave: Moral Foundations Theory, Political alignment, Demographic personas, Role-play prompting, Stereotype amplification, Prompt sensitivity, AIES 2025

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
14
Hallazgos
22
Limitaciones
9
Evidencias

Resumen editorial

Español

El artículo estudia cómo cambian las respuestas de cuatro LLM a ítems de juicio de Moral Foundations Theory (MFT) cuando reciben un prompt procedimental, una identidad política explícita o una biografía estereotipada. No mide personalidad: las “personas” son descripciones redactadas que agrupan edad, género, etnia, geografía, religión, educación, situación económica y valores sociales asociados por los autores con liberalismo o conservadurismo. El objeto observado es la respuesta condicionada por prompt en cinco fundamentos, Lealtad al grupo, Equidad, Pureza, Autoridad y Cuidado/Daño, no un rasgo interno o estable del modelo.

Se prueban gpt-4o-mini, claude-3-5-haiku-20241022, deepseek-chat y Wizard-Vicuna-30B-Uncensored, con dos temperaturas para cada modelo comercial y una para Vicuna. Hay tres experimentos: respuesta “inherente” sin etiqueta ideológica, role-play explícito como liberal o conservador y role-play con 28 personas, catorce por etiqueta política. Las personas combinan entre cuatro y nueve atributos tomados de resúmenes de tipologías de Pew. Como referencia humana se reutiliza Graham, Haidt y Nosek (2009): 2.212 voluntarios estadounidenses, 1.174 liberales, 500 conservadores y 538 moderados u otros, 62 % mujeres y mediana de 32 años. La ideología humana fue una autoidentificación en un único ítem.

Agregados, los LLM sin etiqueta no reproducen ni el patrón liberal ni el conservador histórico y tienden a puntuar más alto que los humanos en los cinco fundamentos. Todas las diferencias humano-modelo de la condición base se reportan significativas, pero la dirección no forma un sesgo liberal o conservador coherente. El propio artículo plantea una explicación alternativa: aquiescencia ante escalas Likert o un artefacto del prompt, no ideología. Pedir explícitamente una perspectiva liberal acerca las respuestas a la referencia liberal, aunque siguen divergiendo en Lealtad, Autoridad y Daño. Pedir una perspectiva conservadora no reproduce a los conservadores humanos; las mayores desviaciones son Lealtad (d=0,835) y Daño (d=0,824).

Las biografías producen la divergencia más fuerte. Frente a conservadores humanos, las personas conservadoras alcanzan d=2,300 en Pureza y d=2,644 en Autoridad, los dos tamaños de efecto más extremos del estudio. Los autores interpretan este patrón como posible amplificación de estereotipos culturales: el apoyo generado supera lo observado en la referencia humana de 2009. En la comparación entre métodos, la respuesta base y el role-play conservador solo difieren significativamente en Equidad, mientras que las personas alteran ampliamente las respuestas, sobre todo en Pureza y Autoridad. Esto apoya sensibilidad al encuadre y a biografías cargadas; no demuestra una ideología conservadora intrínseca.

La construcción de personas impide atribuir causalidad a datos demográficos concretos. Los atributos están correlacionados y se presentan juntos; además, las historias incluyen activismo, religiosidad, éxito profesional, precariedad, optimismo, roles de género y lenguaje normativo. Por ejemplo, muchas personas liberales combinan juventud urbana, educación, ateísmo, trabajo tecnológico y activismo, mientras las conservadoras agrupan ruralidad, religión, trabajos manuales, dificultades económicas y familia. El estudio puede detectar una respuesta al paquete narrativo, pero no decidir si la causa es edad, etnia, religión, clase, ideología explícita, longitud del prompt o cualquier interacción. Los autores reconocen que las personas son idealizadas y proponen diseños modulares futuros.

La auditoría detecta límites de reproducibilidad que el resumen debe mantener visibles. El método describe la escala humana como 1–6, pero el prompt final exige 0–5 y no explica la recodificación. No informa la lista completa ni el número de ítems, repeticiones, seeds, fechas de API, N por condición, tratamiento de respuestas inválidas o unidad estadística. Las respuestas están anidadas por modelo, temperatura, ítem y persona, pero se agregan y comparan mediante t-tests independientes sin que pueda comprobarse independencia o N efectivo; tampoco se declara corrección por comparaciones múltiples. El artículo reconoce variación entre modelos y falta de estadística robusta a ese nivel, de modo que el agregado no permite rankings individuales.

No se localizaron código, prompts como archivos, outputs crudos ni datos de análisis en la página oficial, arXiv o búsquedas de GitHub. Por ello no pueden recalcularse la figura ni la tabla. La referencia humana es estadounidense y de 2009, anterior en dieciséis años a los modelos; además, el texto la llama tres veces más liberal que conservadora, aunque 1.174/500 equivale aproximadamente a 2,35. La conclusión fiel es acotada: bajo estos prompts y modelos de 2025, las respuestas MFT son sensibles al role-play y las biografías estereotipadas pueden amplificar Pureza y Autoridad más allá de una referencia humana histórica. No demuestra personalidad sintética, ideología interna, representación fiel de grupos, causalidad demográfica ni daño en producción.

English

The paper studies how four LLMs answer Moral Foundations Theory (MFT) judgment items under a procedural prompt, an explicit political identity, or a stereotyped biography. It does not measure personality. Its “personas” are authored descriptions bundling age, gender, ethnicity, geography, religion, education, economic outlook and social values associated by the authors with liberalism or conservatism. The observed object is prompt-conditioned output across Ingroup/Loyalty, Fairness, Purity, Authority and Care/Harm, not an internal or stable model trait.

The study tests gpt-4o-mini, claude-3-5-haiku-20241022, deepseek-chat and Wizard-Vicuna-30B-Uncensored, using two temperatures for each commercial model and one for Vicuna. Three experiments elicit an “inherent” response without an ideological label, explicit liberal or conservative role-play, and role-play with 28 biographies, fourteen per political label. Personas bundle four to nine attributes derived from summaries of Pew political typologies. The human comparison reuses Graham, Haidt and Nosek (2009): 2,212 US volunteers, including 1,174 liberals, 500 conservatives and 538 moderates or others; 62% were women and median age was 32. Human ideology was self-reported on a single item.

In aggregate, unlabeled LLM responses reproduce neither the historical liberal nor conservative pattern and tend to use higher agreement scores than humans across all five foundations. All base human-model comparisons are reported as significant, but their direction does not form a coherent liberal or conservative bias. The paper itself raises an alternative explanation: Likert acquiescence or a prompt artifact rather than ideology. Explicit liberal prompting moves outputs closer to the liberal reference, although they still diverge on Ingroup, Authority and Harm. Explicit conservative prompting does not reproduce conservative respondents; its largest deviations are Ingroup (d=.835) and Harm (d=.824).

Biographies produce the strongest divergence. Against human conservatives, conservative-labelled personas reach d=2.300 on Purity and d=2.644 on Authority, the two most extreme effects in the study. The authors interpret this as possible amplification of cultural stereotypes because generated agreement exceeds the 2009 human reference. In method comparisons, baseline and explicit-conservative outputs differ significantly only on Fairness, while persona prompts broadly shift responses, especially Purity and Authority. This supports framing and biography sensitivity, not an intrinsically conservative ideology.

Persona construction prevents causal attribution to individual demographics. Attributes are correlated and presented together, while biographies also include activism, religiosity, professional success, precarity, optimism, family roles and normative gender language. Many liberal-labelled personas combine youth, urban residence, education, atheism, technology work and activism; conservative-labelled personas combine rural residence, religion, manual work, economic hardship and family. The study can observe a response to the narrative bundle, but cannot identify whether age, ethnicity, religion, class, the explicit ideology label, prompt length or an interaction caused it. The authors acknowledge that the personas are idealized and propose modular designs for future work.

The audit found reproducibility limits that must remain visible. The methods describe the human scale as 1–6, whereas the final LLM prompt requests 0–5, without documenting recoding. The paper does not report the full item list or item count, repetitions, seeds, API dates, per-condition N, invalid-response handling or statistical unit. Responses are nested by model, temperature, item and persona, yet are aggregated and compared with independent-samples t-tests without enough information to verify independence or effective N; no multiple-comparison correction is reported. The authors acknowledge inter-model variation and a lack of robust model-level statistics, so the aggregate cannot support individual rankings.

No code, prompt files, raw outputs or analysis data were found on the official page, arXiv or GitHub searches, so the figure and table cannot be recalculated. The human reference is US-based and from 2009, sixteen years before the tested systems; the paper also calls liberals three times as numerous as conservatives, although 1,174/500 is about 2.35. The faithful conclusion is narrow: for these prompts and 2025-era models, MFT outputs are prompt-sensitive, and stereotype-rich biographies can amplify Purity and Authority beyond a historical human reference. The study does not establish synthetic personality, internal ideology, accurate group representation, demographic causality or production harm.

Pregunta de investigación

¿Cómo difieren las respuestas de cuatro LLM a ítems de Moral Foundations Theory respecto de datos humanos liberales y conservadores de 2009, y cómo cambian al pedir role-play ideológico explícito o al añadir biografías demográficas estereotipadas?

Método

Tres experimentos comparativos con cuatro modelos y siete configuraciones de temperatura. Se elicitan puntuaciones 0–5 para cinco fundamentos morales bajo prompt base, identidades liberal/conservadora y 28 personas biográficas construidas con atributos asociados a tipologías de Pew. Las respuestas agregadas se contrastan con datos humanos históricos mediante t-tests independientes, diferencias de medias y tamaños de efecto estandarizados. La auditoría revisa el PDF oficial completo, el apéndice arXiv, el reporte estadístico y la disponibilidad de artefactos.

Muestra: La referencia humana contiene 2.212 voluntarios de EE. UU.: 1.174 liberales, 500 conservadores y 538 moderados u otros; 62 % mujeres, 38 % hombres y mediana de 32 años. La muestra de modelos comprende cuatro LLM con siete configuraciones de temperatura, tres familias de condición y 28 personas. El artículo no informa número total de ítems, réplicas, observaciones ni N por contraste, por lo que el tamaño efectivo de la muestra LLM no puede reconstruirse.

Hallazgos

  • Las respuestas base agregadas difieren de liberales y conservadores humanos en los cinco fundamentos.
  • Los LLM tienden a usar puntuaciones de acuerdo más altas que los humanos.
  • No aparece una dirección base coherente que reproduzca el patrón político humano liberal o conservador.
  • El propio artículo admite que la diferencia base puede ser aquiescencia Likert o un artefacto del prompt.
  • El role-play liberal se acerca a la referencia liberal, pero sigue divergiendo en Lealtad, Autoridad y Daño.
  • El role-play conservador no reproduce la referencia conservadora.
  • Las mayores desviaciones conservadoras explícitas son Lealtad d=0,835 y Daño d=0,824.
  • Las personas liberales y conservadoras divergen de sus referencias humanas, con efectos más intensos en las conservadoras.
  • Las personas conservadoras alcanzan d=2,300 en Pureza frente a conservadores humanos.
  • Las personas conservadoras alcanzan d=2,644 en Autoridad, el mayor efecto reportado.
  • La condición base y la explícitamente conservadora solo difieren significativamente en Equidad en la comparación agregada RQ4.
  • Los autores interpretan los extremos de Pureza y Autoridad como posible amplificación estereotípica.
  • Las personas cambian más las respuestas que las etiquetas ideológicas simples.
  • Los resultados apoyan sensibilidad al prompt y al paquete narrativo, no personalidad o ideología interna.

Limitaciones

  • No se mide personalidad con ningún inventario o constructo validado.
  • Las personas son biografías idealizadas redactadas por los autores.
  • Cada persona agrupa múltiples atributos correlacionados y no permite aislar efectos causales.
  • Las historias añaden valores y señales normativas más allá de datos demográficos.
  • La etiqueta política se entrega explícitamente también en la condición de persona.
  • La escala humana se describe 1–6 y el prompt LLM usa 0–5 sin recodificación documentada.
  • No se informa la lista completa ni el número de ítems administrados.
  • No se informan réplicas, seeds, fechas de API o versiones exactas más allá de algunos aliases.
  • No se informa N por condición, fundamento, modelo o contraste.
  • No se define con claridad la unidad estadística ni puede verificarse independencia.
  • Las observaciones están potencialmente anidadas por modelo, temperatura, ítem y persona.
  • Se agregan modelos heterogéneos aunque existe variación intermodelo reconocida.
  • No se reportan estadísticas robustas por modelo.
  • No se declara corrección por múltiples pruebas.
  • La referencia humana es estadounidense y data de 2009.
  • La muestra humana tiene grupos políticos desequilibrados y se basa en autoidentificación de un ítem.
  • La afirmación de proporción 3:1 no coincide con 1.174/500, aproximadamente 2,35:1.
  • No se encontraron código, outputs crudos ni datos de análisis públicos.
  • No pueden reproducirse numéricamente las tablas o figuras.
  • Solo se examinan ítems abstractos de MFT, no decisiones o conversaciones naturales.
  • Los resultados dependen de prompts iterativamente optimizados para cumplimiento.
  • La generalización a modelos actuales, idiomas y culturas no se evalúa.

Qué no demuestra

  • No demuestra una ideología intrínseca o estable en ningún LLM.
  • No demuestra personalidad sintética.
  • No valida las 28 personas como tipos humanos.
  • No demuestra razonamiento moral humano en los modelos.
  • No demuestra causalidad de edad, género, etnia, religión, geografía o educación.
  • No demuestra representación precisa de liberales o conservadores reales.
  • No ofrece rankings fiables entre modelos individuales.
  • No separa el efecto de longitud del prompt, etiqueta ideológica y contenido biográfico.
  • No generaliza a poblaciones fuera del referente estadounidense histórico.
  • No mide conducta, persuasión, discriminación o daño sobre usuarios.
  • No estima el comportamiento de sistemas desplegados.
  • No permite reproducción estadística completa.

Trazabilidad

Alcance: Texto completo

Versión: AIES 2025 proceedings version, pp. 2419-2430; extended arXiv:2510.13902v1 appendices inspected. Twelve-page publisher PDF fully rendered and visually inspected; public artifact search found no code or data.

Fuente consultada: https://ojs.aaai.org/index.php/AIES/article/view/36727

Revisión: Codex full-text, visual, methodological, statistical and reproducibility audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • OpenAI gpt-4o-mini at temperatures 1.0 and 2.0
  • Anthropic claude-3-5-haiku-20241022 at temperatures 0.5 and 1.0
  • DeepSeek deepseek-chat at temperatures 1.0 and 1.5
  • Wizard-Vicuna-30B-Uncensored at temperature 0.7

Instrumentos y métricas

  • Moral Foundations Theory moral judgment items
  • Ingroup/Loyalty foundation
  • Fairness/Reciprocity foundation
  • Purity/Sanctity foundation
  • Authority/Respect foundation
  • Care/Harm foundation
  • Six-point Likert response scale described inconsistently as 1-6 and 0-5
  • Explicit liberal/conservative identity prompts
  • Twenty-eight authored biographical personas
  • Independent-samples t-tests and standardized mean differences

Datos utilizados

  • Graham, Haidt and Nosek 2009 human MFT responses
  • Pew Research Center American Trends Panel political typology summaries from 2021 and 2024
  • No public raw LLM response or analysis dataset found
  • Extended persona list in arXiv:2510.13902v1

Evidencia y localización

  • Preguntas de investigación, contribuciones y alcance: AIES 2025 proceedings pp. 2419-2421, Introduction and Contribution
  • Muestra humana e instrumento MFT: AIES 2025 proceedings pp. 2421-2422, Background and Instrument Details
  • Modelos, temperaturas, escala y prompt final: AIES 2025 proceedings pp. 2422-2424, Table 1 and Methodology
  • Construcción y contenido de personas: AIES 2025 proceedings pp. 2424-2425 and arXiv:2510.13902v1 Appendices A-B
  • Resultados y tamaños de efecto: AIES 2025 proceedings pp. 2425-2427, Figure 1 and Table 2
  • Interpretación de estereotipos, limitaciones y conclusión: AIES 2025 proceedings pp. 2427-2428, Results, Limitations and Conclusion
  • Registro oficial y metadatos de publicación: Official AIES article page and DOI 10.1609/aies.v8i3.36727
  • Disponibilidad de código, datos y reproducibilidad: Official AIES, arXiv and GitHub artifact search audited 16 July 2026
  • Informe completo de validez: reports/verification/article-214-mft-political-personas-validity-audit.json