Actions Speak Louder than Words: Agent Decisions Reveal Implicit Biases in Language Models

Aplicaciones, sesgos y seguridad2025ACMRevisión editorial aprobada

Autores: Yuxuan Li, Hirokazu Shirado, Sauvik Das

Palabras clave: Agentes LLM, Personas sociodemográficas, Sesgo implícito, Paridad demográfica, Simulación social, Auditoría de decisiones

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
10
Hallazgos
21
Limitaciones
8
Evidencias

Resumen editorial

Español

El artículo propone auditar sesgos sociodemográficos mediante decisiones simuladas de agentes con personas generadas por el propio LLM. Es relevante para persona prompting y simulación social, pero no estudia personalidad sintética en sentido psicométrico: no mide rasgos, consistencia entre contextos, estabilidad temporal ni una identidad interna del modelo. Su objeto es la disparidad entre decisiones binarias producidas bajo etiquetas demográficas explícitas.

El experimento cruza tres grupos con 14 atributos: género (male, female, non-binary), raza/etnia (White, Hispanic/Latino, Black, Asian, Pacific Islander, Native American) e ideología política (cinco posiciones de very conservative a very liberal). Cada atributo se prueba en cuatro escenarios: evacuar ante una inundación incierta, obedecer una advertencia y no acudir a una protesta, compartir información negativa de un rival electoral y elegir entre astronauta o fontanero. Para cada combinación atributo×escenario y para cada modelo se generan 100 personas, de modo que la condición principal comprende 5.600 decisiones por modelo.

La técnica tiene dos pasos ejecutados con el mismo modelo. Primero se pide generar nombre, trasfondo, personalidad, preferencias y conducta esperable. En la condición principal, el prompt añade una pregunta específica de la tarea, por ejemplo cuán probable es que esa persona evacúe. Después, el modelo recibe esa persona y debe elegir una de dos acciones con una justificación. La métrica llamada sesgo implícito es demographic parity difference (DPD): la diferencia entre la tasa máxima y mínima del acto objetivo dentro de cada grupo sociodemográfico y escenario. La significación se decide comparando el DPD observado con el percentil 95 de simulaciones binomiales bajo paridad.

El comparador denominado sesgo explícito es una tarea distinta. El modelo ve que una persona ya tomó el acto objetivo y debe adivinar su género, raza/etnia o ideología entre una lista que incluye unknown; el prompt idéntico se repite 300, 600 o 500 veces según el número de atributos. El DPD se calcula sobre las frecuencias de etiquetas, tratando las respuestas unknown como no seleccionadas. Por tanto, la comparación acciones-versus-palabras contrapone generación de conducta condicionada por una persona explícita con inferencia demográfica desde una acción. Un modelo que responde unknown casi siempre obtiene DPD próximo a cero, aunque eso puede reflejar cautela o alineamiento de formato y no ausencia del mismo constructo medido en la simulación.

En GPT-4o, 11 de 12 cruces muestran DPD implícito significativo, con media 0,549 y desviación 0,317; el único no significativo es género en elección de carrera. Llama 3.1 y Mixtral-8x7B presentan 8/12 y 6/12 casos significativos. Las diferencias pueden ser extremas: 99/100 agentes etiquetados Asian obedecen la advertencia de la protesta, mientras 0/100 Black y 0/100 Native American lo hacen; 198/200 agentes conservative o very conservative eligen fontanero, frente a 124/200 liberal o very liberal que eligen astronauta. Estas cifras describen salidas de prompts, no comportamiento humano.

El análisis cualitativo identifica vocabulario estereotípico en dos casos seleccionados. Las justificaciones de agentes Asian mencionan seguridad, orden y autoridad con mucha más frecuencia; las de agentes Black o Native American, comunidad y resistencia. En carrera, las personas conservadoras se asocian con familia y comunidad, y las liberales con conocimiento y medioambiente. La versión publicada aclara que el equipo hizo codificación abierta y después recuentos de términos, pero no publica protocolo, codificadores, acuerdo, corpus ni código de análisis; tampoco demuestra que esas palabras causen la decisión.

En la familia GPT, el sesgo explícito reportado cae de 12/12 casos en GPT-3 a 9/12 en GPT-3.5-turbo, 0/12 en GPT-4-turbo y 1/12 en GPT-4o. El DPD implícito pasa de 2/12 casos y media 0,069 en GPT-3 a 10/12 y 0,549 en GPT-3.5-turbo, 9/12 y 0,513 en GPT-4-turbo, y 11/12 y 0,549 en GPT-4o. Esto respalda un salto grande respecto a GPT-3, pero no un aumento monotónico: la media baja entre GPT-3.5 y GPT-4-turbo y GPT-4o vuelve exactamente a 0,549. Los modelos no tienen snapshots inmutables ni una escala común de capacidad, por lo que «los modelos más avanzados son más sesgados» es una interpretación más fuerte que los resultados.

La ablación compara ausencia de persona, persona no contextualizada y persona contextualizada en GPT-4o, Llama 3.1 y Mixtral-8x7B. Las disparidades aparecen con mayor frecuencia cuando la persona se genera preguntando explícitamente por su conducta en la misma tarea. Esta observación es importante, pero también limita la inferencia: el paso de generación puede introducir una predicción demográfica estereotipada que el segundo paso simplemente conserva. Al usar el mismo LLM para construir y actuar la persona, el diseño no separa sesgo de generación, condicionamiento contextual y decisión.

La comparación con comportamiento real parte de 131 estudios localizados en Google Scholar. Se excluyen 84, quedan 47, se derivan 23 predicciones y solo se retienen seis apoyadas por varios artículos; las seis coinciden direccionalmente con GPT-4o. El paper reconoce que la publicación selectiva impide evaluar falsos positivos y que no puede comparar magnitudes por falta de control contextual. Por ello, el resultado válido es alineación de seis predicciones seleccionadas, no validación general de realismo. El abstract afirma además que los sesgos están «marcadamente amplificados», aunque el método dice que la magnitud humano-LLM no es comparable. No se publica protocolo reproducible, registro de cribado, evaluación de calidad ni extracción doble.

La versión FAccT conserva errores internos relevantes. En Results 5.1 llama «único caso insignificante» al de autoridad×ideología donde GPT-4o elige politically liberal en 500/500 repeticiones; con su propia definición ese DPD es 1 y es precisamente el único caso significativo. En el apéndice del prompt explícito de autoridad, después de «join the protest» se insertan por error las frases de evacuación y «the person decides to evacuate». Además, los textos de contexto para Negative Information Sharing y Career Path Selection aparecen intercambiados. Los resultados cualitativos parecen compatibles con los contextos correctos, pero sin el código ejecutado no puede determinarse si son erratas del apéndice o contaminación real del experimento.

La reproducibilidad es insuficiente. El paper enlaza `Yassellee/agent-decisions-bias` como futura liberación de datos y código, pero el commit público único contiene solo README, `.gitignore` y una licencia CC0: no hay código, datos, salidas, semillas, fechas de inferencia, revisiones exactas, dependencias, pruebas ni CI. Tampoco se corrige por múltiples comparaciones, el contraste implícito-explícito usa un t-test de dos muestras pese a que los 12 casos están emparejados, y el estudio se apoya en un único enunciado y orden de opciones por escenario.

La conclusión fiel es más acotada que el titular: bajo estas personas demográficas explícitas y estos cuatro dilemas binarios, varios LLM producen grandes diferencias entre tasas de decisión, especialmente cuando la generación de la persona está contextualizada con la misma conducta objetivo. El trabajo no demuestra sesgo implícito psicológico, personalidad estable, decisiones reales de agentes, representatividad humana, causalidad del atributo demográfico, una tendencia monotónica con la capacidad del modelo ni reproducibilidad de extremo a extremo.

English

The paper proposes auditing sociodemographic bias through simulated decisions made by agents whose personas are generated by the LLM itself. It is relevant to persona prompting and social simulation, but it does not study synthetic personality in a psychometric sense: there are no trait measures, cross-context consistency tests, temporal stability tests or claims about an internal model identity. Its object is disparity among binary prompt outputs under explicit demographic labels.

The experiment crosses three groups with 14 attributes: gender (male, female, non-binary), race/ethnicity (White, Hispanic/Latino, Black, Asian, Pacific Islander, Native American) and political ideology (five positions from very conservative to very liberal). Each attribute is tested in four scenarios: evacuating under uncertain flooding, complying with advice not to attend a protest, sharing negative information about an electoral opponent and choosing between astronaut and plumber. For every attribute-by-scenario combination and model, 100 personas are generated, yielding 5,600 decisions per model in the main condition.

The technique has two steps performed by the same model. First, it requests a name, background, personality, preferences and expected behavior. In the main condition, the prompt adds a task-specific question, such as how likely that person is to evacuate. The model then receives the persona and must choose one of two actions with a rationale. The metric called implicit bias is demographic parity difference (DPD): the difference between the maximum and minimum target-action rates within each sociodemographic group and scenario. Significance is determined by comparing observed DPD with the 95th percentile of binomial simulations under parity.

The comparator called explicit bias is a different task. The model sees that a person has already taken the target action and must infer gender, race/ethnicity or ideology from a list that includes unknown; the identical prompt is repeated 300, 600 or 500 times depending on group size. DPD is computed over label frequencies, with unknown responses treated as not selecting a demographic label. The actions-versus-words comparison therefore contrasts persona-conditioned behavior generation with demographic inference from an action. A model that nearly always answers unknown receives DPD near zero, which may reflect caution or alignment to the task rather than absence of the same construct measured by the simulation.

For GPT-4o, 11 of 12 cases have significant implicit DPD, with mean .549 and SD .317; gender in career choice is the sole non-significant case. Llama 3.1 and Mixtral-8x7B show 8/12 and 6/12 significant cases. Differences can be extreme: 99/100 Asian-coded agents comply with the protest warning, compared with 0/100 Black-coded and 0/100 Native-American-coded agents; 198/200 conservative or very-conservative agents choose plumber, while 124/200 liberal or very-liberal agents choose astronaut. These figures describe prompt outputs, not human behavior.

The qualitative analysis finds stereotyped vocabulary in two selected cases. Asian-coded rationales mention safety, order and authority much more often; Black- and Native-American-coded rationales mention community and resistance. In career choice, conservative personas are associated with family and community, and liberal personas with knowledge and the environment. The published version says the team used open coding followed by keyword counts, but it releases no protocol, coders, agreement, corpus or analysis code, and it does not establish that those terms caused the decisions.

Across the GPT family, reported explicit bias falls from 12/12 cases in GPT-3 to 9/12 in GPT-3.5-turbo, 0/12 in GPT-4-turbo and 1/12 in GPT-4o. Implicit DPD moves from 2/12 cases and a .069 mean in GPT-3 to 10/12 and .549 in GPT-3.5-turbo, 9/12 and .513 in GPT-4-turbo, and 11/12 and .549 in GPT-4o. This supports a large jump from GPT-3, but not a monotonic increase: the mean falls from GPT-3.5 to GPT-4-turbo and GPT-4o returns to exactly .549. Models are not pinned to immutable snapshots or placed on a common capability scale, so the statement that more advanced models are more biased is stronger than the evidence.

The ablation compares no persona, non-contextualized persona and contextualized persona for GPT-4o, Llama 3.1 and Mixtral-8x7B. Disparities occur more frequently when persona generation explicitly asks about behavior in the same target task. This is informative, but it also narrows the inference: persona generation may inject a demographic behavioral stereotype that the second step merely preserves. Because the same LLM creates and acts the persona, the design cannot separate generation bias, contextual conditioning and action selection.

The real-world comparison begins with 131 Google Scholar studies. The authors exclude 84, retain 47, derive 23 predictions and keep only six supported by multiple papers; all six directionally align with GPT-4o. The paper acknowledges that publication bias prevents false-positive evaluation and that magnitudes cannot be compared because contexts are uncontrolled. The supported result is therefore alignment for six selected predictions, not general validation of behavioral realism. The abstract nevertheless says disparities are markedly amplified even though the method says human-LLM magnitudes are not comparable. No reproducible review protocol, screening log, quality appraisal or duplicate extraction is released.

The FAccT version retains consequential internal errors. Results 5.1 calls authority-by-ideology the sole insignificant explicit case even though GPT-4o selects politically liberal in 500/500 repetitions; under the paper's own DPD definition this equals 1 and is the sole significant case. The explicit authority prompt appends two evacuation sentences after the person joins the protest. The context statements for Negative Information Sharing and Career Path Selection are also swapped in the appendix. Qualitative results look compatible with the intended contexts, but without executed code it is impossible to determine whether these are documentation errors or actual experimental contamination.

Reproducibility is inadequate. The paper links `Yassellee/agent-decisions-bias` as the future data-and-code release, but its only public commit contains only a README, `.gitignore` and a CC0 license: there is no code, data, output, seed, inference date, exact model revision, environment, test or CI. There is also no multiple-comparison correction; the implicit-explicit comparison uses an independent two-sample t-test despite the same 12 cases being naturally paired; and each scenario uses one wording and fixed option order.

The faithful conclusion is narrower than the title: under these explicit demographic personas and four binary dilemmas, several LLMs produce large differences in decision rates, especially when persona generation is contextualized with the same target behavior. The study does not establish psychological implicit bias, stable personality, real agent action, human representativeness, a causal demographic effect, a monotonic trend with model capability or end-to-end reproducibility.

Pregunta de investigación

¿Revelan las decisiones binarias de agentes con personas sociodemográficas generadas por LLM disparidades que no aparecen al pedir al modelo que infiera explícitamente la demografía desde una acción, cómo varían entre generaciones de modelos y cuánto dependen de contextualizar la persona con la tarea?

Método

Seis LLM generan y representan 100 personas para cada uno de 14 atributos sociodemográficos y cuatro escenarios binarios. El estudio calcula demographic parity difference entre tasas de acción, usa simulación binomial para un umbral del 95 %, compara con una tarea de inferencia demográfica repetida y ejecuta ablaciones de persona en tres modelos. Una revisión de Google Scholar filtra 131 estudios hasta seis predicciones direccionales. La auditoría contrasta la versión FAccT completa, el preprint y el repositorio enlazado.

Muestra: La condición contextualizada genera 14 atributos × 4 escenarios × 100 personas = 5.600 decisiones por modelo. La evaluación explícita repite cada escenario 300 veces para género, 600 para raza/etnia y 500 para ideología, también 5.600 salidas por modelo. Los análisis principales condensan cada modelo en 12 DPD. La revisión parte de 131 publicaciones y conserva seis predicciones con apoyo múltiple.

Hallazgos

  • GPT-4o presenta DPD implícito significativo en 11/12 casos, con media 0,549 y desviación 0,317.
  • Llama 3.1, Mixtral-8x7B, GPT-4-turbo, GPT-3.5-turbo y GPT-3 muestran 8/12, 6/12, 9/12, 10/12 y 2/12 casos significativos respectivamente.
  • En autoridad×raza, 99/100 personas Asian obedecen frente a 0/100 Black y 0/100 Native American.
  • En carrera×ideología, 198/200 personas conservadoras eligen fontanero; 124/200 liberales eligen astronauta.
  • Las justificaciones seleccionadas contienen asociaciones estereotípicas con autoridad, comunidad, familia, conocimiento y medioambiente.
  • Las personas contextualizadas suelen producir más disparidad que las condiciones sin persona o con persona no contextualizada.
  • El DPD explícito cae fuertemente tras GPT-3.5, pero la serie implícita no aumenta de forma monotónica entre GPT-3.5, GPT-4-turbo y GPT-4o.
  • Las seis predicciones retenidas de la literatura coinciden direccionalmente con GPT-4o.
  • El paper reconoce contradicciones entre decisiones cuando una persona se define por un único grupo aislado.
  • El repositorio enlazado no contiene el código ni los datos anunciados.

Limitaciones

  • Las personas codifican un único grupo sociodemográfico y no identidades interseccionales.
  • El mismo modelo genera la persona y toma la decisión, sin separar sesgo de generación y acción.
  • La persona contextualizada incluye explícitamente la conducta objetivo y puede preinyectar el patrón medido.
  • La tarea explícita no mide el mismo constructo que la generación de acciones condicionada por persona.
  • Responder unknown reduce el DPD explícito y puede confundir prudencia de alineamiento con ausencia de sesgo.
  • DPD mide disparidad de salida, no sesgo implícito psicológico ni daño.
  • Los actos son predicciones textuales, no acciones ejecutadas por agentes ni personas.
  • Solo hay cuatro escenarios binarios con una redacción y orden de opciones fijos.
  • No se informan fechas de inferencia, snapshots exactos, semillas ni revisiones de modelos abiertos.
  • No se publica código, datos, salidas, racionales, dependencias ni scripts estadísticos.
  • No hay corrección por múltiples comparaciones.
  • El contraste implícito-explícito usa un t-test de dos muestras aunque los doce casos están emparejados.
  • La afirmación de aumento con modelos avanzados no es monotónica en DPD medio.
  • El análisis cualitativo cubre dos casos seleccionados y no publica fiabilidad de codificación.
  • La revisión usa solo Google Scholar y no publica protocolo, log de cribado, calidad ni extracción doble.
  • La selección de seis predicciones apoyadas no permite estimar falsos positivos ni realismo general.
  • El abstract habla de amplificación marcada aunque el método declara incomparables las magnitudes humano-LLM.
  • Results 5.1 invierte significant/insignificant para el único caso explícito de GPT-4o.
  • El prompt explícito de autoridad está contaminado con frases del escenario de evacuación.
  • Los contextos de Negative Information Sharing y Career Path Selection aparecen intercambiados.
  • Sin artefactos ejecutados no puede distinguirse entre erratas de apéndice y errores experimentales reales.

Qué no demuestra

  • No demuestra una personalidad sintética estable o una estructura de rasgos.
  • No demuestra sesgo implícito en el sentido psicológico humano.
  • No demuestra que las disparidades provengan del paso de decisión y no de la persona generada.
  • No identifica efectos causales de género, raza o ideología.
  • No demuestra que los agentes predigan fielmente comportamiento humano.
  • No demuestra una amplificación de magnitud comparable con el mundo real.
  • No demuestra un aumento monotónico del sesgo con la capacidad o novedad del modelo.
  • No generaliza a otras redacciones, opciones, escenarios, idiomas o identidades interseccionales.
  • No permite reproducir de extremo a extremo los resultados publicados.

Trazabilidad

Alcance: Texto completo

Versión: FAccT 2025 proceedings version, pp. 3303-3325; 23-page publisher manuscript fully rendered and visually inspected. arXiv:2501.17420v1 and linked repository commit 8c399f843340eda2e74ec7a94856998e5ea6bf29 also audited.

Fuente consultada: https://doi.org/10.1145/3715275.3732212

Revisión: Codex full-text, visual, methodological and reproducibility audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • OpenAI GPT-3 (exact completion model and snapshot not reported)
  • OpenAI GPT-3.5-turbo (snapshot not reported)
  • OpenAI GPT-4-turbo (snapshot not reported)
  • OpenAI GPT-4o (snapshot not reported)
  • Meta Llama 3.1 (parameter count and revision not reported in the published paper)
  • Mistral AI Mixtral-8x7B (revision not reported)
  • GPT-4o as structure extractor for GPT-3 outputs

Instrumentos y métricas

  • Two-stage persona-generation and action-generation prompts
  • Four fixed binary decision scenarios
  • Fourteen explicit sociodemographic attributes in three groups
  • Demographic parity difference over target-action rates
  • Binomial parity simulations and 95th-percentile threshold
  • Explicit demographic-inference question-answer prompts with unknown option
  • No-persona, non-contextualized-persona and contextualized-persona ablations
  • Open coding and deterministic counts of selected rationale terms
  • Two-sample t-test over twelve case-level DPD values
  • Google Scholar literature search and directional alignment synthesis

Datos utilizados

  • 5,600 contextualized persona decisions per model across 14 attributes and four scenarios
  • Twelve group-by-scenario DPD cases per model
  • Six-model explicit and implicit evaluation outputs, not publicly released
  • Ablation outputs for GPT-4o, Llama 3.1 and Mixtral-8x7B, not publicly released
  • 131 literature-search candidates, 47 included studies, 23 initial predictions and six retained predictions
  • Yassellee/agent-decisions-bias commit 8c399f843340eda2e74ec7a94856998e5ea6bf29, containing no experimental data or code

Evidencia y localización

  • Publicación, alcance y contribuciones: FAccT 2025 pp. 3303-3305, Abstract, Introduction and Sections 2-3
  • Diseño, DPD, modelos, tareas explícitas y ablaciones: FAccT 2025 pp. 3305-3308, Sections 3.1-4.4 and Tables 1-2
  • Resultados por modelo y ejemplos de disparidad: FAccT 2025 pp. 3308-3312, Sections 5.1-5.5 and Figures 3-5
  • Interpretación, limitaciones y ausencia de causalidad: FAccT 2025 pp. 3312-3315, Sections 6-7
  • Prompts contaminados e intercambio de contextos: FAccT 2025 pp. 3318-3321, Appendices B.2 and D
  • Metadatos oficiales y DOI: ACM FAccT 2025 DOI 10.1145/3715275.3732212; NSF public manuscript 10637219; arXiv:2501.17420v1
  • Estado real del artefacto reproducible: Yassellee/agent-decisions-bias commit 8c399f843340eda2e74ec7a94856998e5ea6bf29 audited 16 July 2026
  • Informe completo: reports/verification/article-218-agent-decisions-bias-validity-and-reproducibility-audit.json