Unmasking Implicit Bias: Evaluating Persona-Prompted LLM Responses in Power-Disparate Social Scenarios

Aplicaciones, sesgos y seguridad2025ACL AnthologyRevisión editorial aprobada

Autores: Bryan Chen Zhengyu Tan, Roy Ka-Wei Lee

Palabras clave: Demographic persona prompting, Implicit bias, Power disparity, LLM-as-a-judge, Social scenarios, Demographic sensitivity

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
12
Hallazgos
23
Limitaciones
9
Evidencias

Resumen editorial

Español

Este trabajo estudia cómo cambian las respuestas de cinco LLM cuando el prompt asigna identidades demográficas a dos participantes de una situación social y si esa variación es mayor cuando existe desigualdad de poder. Es pertinente para persona prompting, pero no mide personalidad. Las personas combinan una etiqueta demográfica con un rasgo contextual generado para la escena; no hay cuestionarios, rasgos psicométricos, estabilidad temporal ni inferencia de una identidad interna del modelo.

GPT-4o genera 100 escenarios en diez dominios: trabajo, educación, sanidad, finanzas, política, justicia, vecindario, información, vivienda y asistencia social. En cada dominio hay cinco escenas donde Blake, el respondedor, tiene ventaja sobre Alex y cinco donde ambos están en pie de igualdad. Los escenarios se revisan manualmente. Alex es SUB y Blake RES; el modelo adopta a Blake y responde a Alex. Un límite esencial es que las 50 escenas con desigualdad y las 50 sin ella son situaciones distintas, no versiones emparejadas de una misma escena. Por tanto, cualquier diferencia entre condiciones de poder también puede deberse a roles, redacción, stakes y contenido.

El paper afirma evaluar nueve ejes demográficos, pero Table 2 y los datos finales contienen ocho: raza, identidad de género, edad, religión, posición política, discapacidad, nacionalidad y apariencia física. Sus tamaños producen 111 combinaciones SUB×RES dentro del mismo eje; al añadir una línea base sin demografía resultan 112 condiciones por escenario y 11.200 respuestas por modelo. No se prueban combinaciones entre ejes: una persona conjunta como «hombre caucásico ateo de mediana edad» nunca aparece como tratamiento experimental.

Se evalúan GPT-4o-mini, Llama 3.1 8B Instruct, Qwen 2 7B, Gemma 2 9B Instruct y Mistral 7B Instruct v0.3, a temperatura 0. La sensibilidad semántica es 1 menos la similitud coseno entre embeddings all-mpnet-base-v2 de la respuesta demográfica y su línea base. La calidad se aproxima con un juez GPT-4o-mini que compara ambas respuestas bajo Helpful-Honest-Harmless en los dos órdenes; el score final puede ser 0, 0,25, 0,5, 0,75 o 1. Después, el artículo llama «sesgo implícito» a la desviación estándar de esos promedios entre combinaciones demográficas. Estas son operacionalizaciones útiles para explorar, pero distancia, preferencia del juez y variabilidad no equivalen por sí solas a sesgo, daño o discriminación.

Los mínimos de distancia coseno suelen recaer, según modelo y lado del diálogo, en las etiquetas middle-aged, abled, native-born, average-looking, centrist, Caucasian y atheist. El paper interpreta esos mínimos como una «persona por defecto». La lectura fiel es más limitada: son prompts explícitos que cambian menos el contenido respecto a una respuesta base. No demuestran que el modelo sin prompt adopte internamente esas identidades. Además, el resultado de género no sostiene un default masculino único: Table 4 atribuye el mínimo de RES a male en 2/5 modelos y a female en 2/5. El abstract une mínimos marginales de ejes separados y los presenta como una persona masculina conjunta que no fue probada.

Las mayores distancias aparecen con frecuencia en pares asociados a edad, discapacidad mental, identidades non-binary/transgender, migración, apariencia, política y religión, aunque el patrón varía por modelo. El juez GPT-4o-mini también prefiere o penaliza distintos pares demográficos. Deben describirse como preferencias relativas de ese juez frente a una única respuesta base, no como calidad objetiva. Para GPT-4o-mini existe además autoevaluación: el mismo modelo que genera una de las familias de respuestas actúa como juez, sin comparación con otro juez.

En la comparación de poder, la desviación estándar de win rate aumenta en los cinco modelos. La variabilidad semántica aumenta en Gemma 2, GPT-4o-mini, Llama 3.1 y Mistral, pero disminuye en Qwen 2. La auditoría recompone los valores redondeados de Table 6 desde los CSV públicos. Esto confirma la estadística descriptiva, pero no un efecto causal de la desigualdad: las condiciones no usan escenas emparejadas y la métrica identifica dispersión entre celdas, no trato injusto validado.

La validación humana usa tres estudiantes voluntarios. El acuerdo entre humanos es bajo/fair (Fleiss κ=0,340); al incluir al juez AI es 0,393 y el Cohen κ humano-AI medio es 0,447. En una segunda fase se muestra a las personas el veredicto y la razón del AI antes de pedir acuerdo, por lo que el Likert alto valida plausibilidad después de exposición, no corrección independiente. Table 10 contiene un error: sus tres κ promedian 0,447 y sus tres Likert 4,117, pero la fila Mean imprime 0,452 y 4,207. El cuerpo sí usa las medias correctas. El formulario publicado dice 25 escenarios por sección, mientras el texto y la tabla hablan de 100 pares; no se explica el batching.

Los artefactos finales son internamente consistentes. Los cinco CSV contienen 56.000 filas: 11.200 por modelo, con 11.100 condiciones demográficas y 100 líneas base, sin claves experimentales duplicadas y con los mismos 11.100 cruces en todos los modelos. El CSV combinado original de Drive y los cinco CSV actuales coinciden celda por celda tras ordenar. El XLSX contiene 100 escenas, diez por dominio y 50/50 por condición de poder. La recomputación reproduce los valores de Table 6 a cuatro decimales.

La trazabilidad anterior al resultado es incompleta. generated_prompts.csv tiene 13.200 filas porque su eje Gender incluye también gay y lesbian: 36 pares en vez de los 16 del estudio final. Eliminar los 20 pares que incluyen esas etiquetas en 100 escenas explica exactamente las 2.000 filas descartadas, pero el release no documenta el filtro. El repositorio solo publica una visualización, datos y un notebook de agregación; no incluye código de generación, embedding, juicio, resultados por orden, anotaciones humanas, revisiones inmutables de modelos, entorno, tests, CI o licencia. Figure 8 también invierte las etiquetas de su prompt: el bloque marcado «power disparity present» pide igualdad y el marcado «absent» pide ventaja de RES, mientras Table 12 y los datos siguen la convención opuesta. Sin el código ejecutado no puede resolverse si es un error de figura o de procedencia.

La conclusión fiel es que, en 100 escenas generadas y bajo etiquetas demográficas explícitas, los modelos muestran cambios semánticos y preferencias de un juez LLM que varían por identidad; la dispersión del win rate es mayor en las escenas etiquetadas con desigualdad. El estudio no demuestra una personalidad sintética estable, una persona conjunta por defecto, causalidad independiente del contenido de la escena, calidad objetiva, daño real, interseccionalidad ni el origen del efecto en los datos de entrenamiento.

English

This paper studies how five LLMs change their responses when prompts assign demographic identities to two participants in a social situation, and whether variation is greater when power is unequal. It is relevant to persona prompting but does not measure personality. Personas combine a demographic label with a contextual character trait generated for the scene; there are no questionnaires, psychometric traits, temporal-stability tests or inferences about an internal model identity.

GPT-4o generates 100 scenarios in ten domains: work, education, healthcare, finance, politics, justice, neighborhood, information, housing and public assistance. Each domain contains five scenes in which Blake, the responder, has an advantage over Alex and five in which they have equal standing. Scenarios are manually reviewed. Alex is SUB and Blake RES; the response model adopts Blake and replies to Alex. A central limitation is that the 50 unequal-power and 50 equal-power scenes are different situations, not paired versions of the same scene. Any power-condition difference can therefore also reflect roles, wording, stakes and content.

The paper says it evaluates nine demographic axes, but Table 2 and the final data contain eight: race, gender identity, age, religion, political stance, disability, nationality and physical appearance. Their sizes yield 111 within-axis SUB×RES pairs; adding one no-demography baseline gives 112 conditions per scenario and 11,200 responses per model. No cross-axis combinations are tested, so a joint person such as a middle-aged Caucasian atheist man never appears as an experimental treatment.

The evaluated models are GPT-4o-mini, Llama 3.1 8B Instruct, Qwen 2 7B, Gemma 2 9B Instruct and Mistral 7B Instruct v0.3 at temperature 0. Semantic sensitivity is one minus cosine similarity between all-mpnet-base-v2 embeddings of a demographic response and its baseline. Quality is approximated by a GPT-4o-mini judge that compares both responses under Helpful-Honest-Harmless criteria in both orders; the final score can be 0, .25, .5, .75 or 1. The paper then calls the standard deviation of these group-cell means implicit bias. These are useful exploratory operationalizations, but distance, judge preference and variability are not by themselves equivalent to bias, harm or discrimination.

The lowest cosine distances often fall, depending on model and dialogue side, on middle-aged, abled, native-born, average-looking, centrist, Caucasian and atheist labels. The paper interprets these minima as a default persona. The faithful interpretation is narrower: these explicit prompts alter semantic content less than other labels relative to a baseline response. They do not show that an unprompted model internally adopts those identities. Gender also does not support a unique male default: Table 4 assigns the lowest RES value to male in 2/5 models and female in 2/5. The abstract stitches marginal minima from separate axes into a joint male persona that was never tested.

The largest distances frequently involve age, mental disability, non-binary/transgender identities, migration, appearance, politics and religion, with model-specific variation. GPT-4o-mini judge preferences also vary across demographic pairs. These should be described as that judge's relative preferences against one baseline response, not objective quality. GPT-4o-mini also judges GPT-4o-mini outputs, creating a self-evaluation condition without an alternative judge.

In the power comparison, win-rate standard deviation increases for all five models. Semantic-distance variability increases for Gemma 2, GPT-4o-mini, Llama 3.1 and Mistral, but decreases for Qwen 2. The audit recomputes Table 6's rounded values from the public CSVs. This confirms the descriptive statistic, but not a causal power-disparity effect: conditions do not use paired scenes and the metric measures dispersion across cells rather than validated unfair treatment.

Human validation uses three student volunteers. Inter-human agreement is only fair (Fleiss κ=.340); adding the AI judge gives .393, and mean human-AI Cohen κ is .447. In a second stage, people see the AI verdict and rationale before rating agreement, so the high Likert score validates post-exposure plausibility rather than independent correctness. Table 10 contains an arithmetic error: its three κ values average .447 and its three Likert values 4.117, but the Mean row prints .452 and 4.207. The main prose uses the correct means. The published form says 25 scenarios per section while the text and table refer to 100 pairs; batching is not explained.

The final artifacts are internally consistent. The five CSVs contain 56,000 rows: 11,200 per model, with 11,100 demographic conditions and 100 baselines, no duplicate experimental keys and the same 11,100 keys in all models. The original combined Drive CSV and the current five split CSVs match cell for cell after sorting. The XLSX contains 100 scenes, ten per domain and a 50/50 power split. Recalculation reproduces Table 6 to four decimals.

Upstream traceability is incomplete. generated_prompts.csv has 13,200 rows because its Gender axis also contains gay and lesbian, producing 36 pairs instead of the final study's 16. Removing the 20 pairs involving those labels across 100 scenes explains exactly 2,000 discarded rows, but the release does not document this filter. The repository publishes a visualization, data and one aggregation notebook, but no generation, embedding or judging code, order-specific verdicts, human annotations, immutable model revisions, environment, tests, CI or license. Figure 8 also reverses its conditional labels: the block marked power disparity present requests equal standing, while absent requests a RES advantage; Table 12 and the data follow the opposite intended convention. Without executed generation code, it is unresolved whether this is only a figure error or a provenance problem.

The faithful conclusion is that, in 100 generated scenarios under explicit demographic labels, models exhibit identity-dependent semantic shifts and LLM-judge preferences; win-rate dispersion is greater in scenes labeled as power-disparate. The study does not establish stable synthetic personality, a joint default persona, a causal effect independent of scene content, objective quality, real-world harm, intersectionality or a training-data source for the effect.

Pregunta de investigación

¿Cómo alteran ocho ejes de persona demográfica las respuestas de cinco LLM en 100 escenas sociales, qué pares producen menor distancia semántica o menor preferencia de un juez HHH y cambia la dispersión entre escenas etiquetadas con y sin desigualdad de poder?

Método

GPT-4o genera 100 escenas en diez dominios, 50 con ventaja de RES y 50 con igualdad. Para cada escena se construyen 111 pares demográficos dentro de ocho ejes más una línea base. Cinco modelos responden como RES a temperatura 0. La sensibilidad usa distancia coseno de embeddings all-mpnet-base-v2; GPT-4o-mini juzga HHH en ambos órdenes; la desviación estándar por eje se promedia como indicador de variabilidad. Tres estudiantes realizan una validación parcial. La auditoría revisa el PDF completo y recompone los datos finales y Table 6.

Muestra: Cada modelo genera 11.200 respuestas: 11.100 para pares demográficos y 100 líneas base, equilibradas en 5.600 filas por condición de poder. Los ocho ejes contienen 29 etiquetas únicas y 111 pares dentro de eje. La validación humana declara tres estudiantes; el texto habla de 100 pares, pero el formulario muestra 25 escenarios por sección y no documenta los lotes.

Hallazgos

  • Las etiquetas del respondedor suelen producir más variación marginal que las del sujeto.
  • Los mínimos de distancia aparecen a menudo en middle-aged, abled, native-born, average-looking, centrist, Caucasian y atheist.
  • El resultado de género no es un default masculino único: male y female empatan con 2/5 modelos en Table 4.
  • Las mayores distancias suelen involucrar edad, discapacidad mental, non-binary/transgender, migración, apariencia, política y religión.
  • Las preferencias HHH del juez cambian de forma notable entre pares demográficos.
  • La desviación estándar del win rate aumenta con la etiqueta de desigualdad en los cinco modelos.
  • La dispersión semántica aumenta en cuatro modelos y disminuye en Qwen 2.
  • Table 6 se reproduce a cuatro decimales desde los CSV públicos.
  • Los 11.100 cruces experimentales están presentes en los cinco modelos sin duplicados.
  • El CSV combinado original y los CSV actuales coinciden celda por celda tras ordenar.
  • El acuerdo entre humanos es fair, no alto: Fleiss κ=0,340.
  • El Cohen κ humano-AI medio correcto es 0,447 y el Likert medio correcto 4,117.

Limitaciones

  • No se mide personalidad, estabilidad de rasgos ni identidad interna.
  • Las condiciones de poder usan escenas distintas y no emparejadas.
  • El efecto de poder se confunde con contenido, roles, stakes y redacción.
  • Se prueban ocho ejes demográficos, no nueve.
  • No se prueban combinaciones entre ejes ni interseccionalidad.
  • La persona conjunta del abstract se construye con mínimos marginales nunca evaluados juntos.
  • Distancia coseno baja no prueba que el modelo adopte una identidad por defecto.
  • La desviación estándar es una operacionalización no validada de sesgo implícito.
  • La preferencia HHH de un LLM no es calidad objetiva ni daño observado.
  • GPT-4o-mini juzga también respuestas de GPT-4o-mini.
  • No hay juez alternativo ni gold standard humano amplio.
  • Solo participan tres estudiantes y el acuerdo interhumano es fair.
  • La fase Likert muestra antes el veredicto y la razón del AI.
  • No se explican el muestreo humano, los lotes ni la discrepancia 25/100.
  • Table 10 imprime dos medias aritméticamente incorrectas.
  • Figure 8 invierte las etiquetas present/absent del prompt de poder.
  • generated_prompts.csv incluye gay y lesbian bajo Gender y 2.000 filas luego excluidas sin explicación.
  • No se publican scripts de generación, embedding o juicio.
  • No se publican veredictos por orden, razones crudas ni anotaciones humanas.
  • No hay revisiones inmutables de modelos ni fechas exactas de inferencia.
  • No hay intervalos de incertidumbre ni corrección por múltiples comparaciones.
  • Los ejemplos cualitativos son tres máximos seleccionados, no prevalencia.
  • No hay entorno reproducible, tests, CI, tags o licencia.

Qué no demuestra

  • No demuestra una personalidad sintética estable.
  • No demuestra una persona conjunta por defecto.
  • No demuestra que un LLM sin prompt se identifique como hombre caucásico ateo y centrista.
  • No demuestra interseccionalidad.
  • No identifica un efecto causal de la desigualdad independiente de la escena.
  • No convierte sensibilidad semántica en sesgo o daño probado.
  • No mide calidad objetiva ni discriminación real.
  • No identifica el origen causal en datos de entrenamiento.
  • No generaliza más allá de estas escenas y snapshots.
  • No permite reproducir generación, juicio o validación humana de extremo a extremo.

Trazabilidad

Alcance: Texto completo

Versión: NAACL 2025 proceedings version, pp. 1075-1108; arXiv:2503.01532v2 checked. Thirty-four-page PDF fully rendered and visually inspected; Google Drive data and repository commit e3bdb7cf0c96de50a497daaf876591274426e1b8 audited.

Fuente consultada: https://aclanthology.org/2025.naacl-long.50/

Revisión: Codex full-text, visual, methodological, spreadsheet, data and reproducibility audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • OpenAI GPT-4o for scenario generation (exact snapshot not reported)
  • OpenAI GPT-4o-mini as response model and HHH judge (exact snapshot not reported)
  • Meta Llama 3.1 8B Instruct (revision not pinned)
  • Alibaba Qwen 2 7B Instruct (revision not pinned)
  • Google Gemma 2 9B Instruct (revision not pinned)
  • Mistral 7B Instruct v0.3 (revision not pinned)
  • sentence-transformers/all-mpnet-base-v2

Instrumentos y métricas

  • Dual-persona social-scenario prompt
  • Eight within-axis demographic persona manipulations
  • No-demography baseline response
  • all-mpnet-base-v2 768-dimensional response embeddings
  • Cosine distance from baseline response
  • GPT-4o-mini Helpful-Honest-Harmless preference judge
  • Two-order 1/0.5/0 preference scoring
  • Within-axis population standard deviation and AvgStd aggregation
  • Three-judge human preference and rationale-agreement form
  • Fleiss kappa, Cohen kappa and five-point Likert rating

Datos utilizados

  • 100 GPT-4o-generated social scenarios across ten contextual domains
  • 111 within-axis demographic SUB×RES pairs plus one baseline per scenario
  • 56,000 released final response rows across five models
  • generated_prompts.csv with 13,200 pre-filter prompt rows
  • scenarios.xlsx with 50 power-disparate and 50 equal-power scenes
  • Google Drive combined response, cosine-distance and preference-result files
  • Inc0mple/Implicit_Bias_Interactive_Data_Viz commit e3bdb7cf0c96de50a497daaf876591274426e1b8

Evidencia y localización

  • Alcance, tareas y preguntas de investigación: NAACL 2025 pp. 1075-1077, Abstract, Introduction and Task Definition
  • Escenarios, ejes, pares y generación de respuestas: NAACL 2025 pp. 1077-1078, Sections 4.1-4.3 and Tables 1-3
  • Métricas semánticas, juez HHH y AvgStd: NAACL 2025 pp. 1078-1079, Sections 5.1-5.4
  • Modelos y resultados de default, calidad y poder: NAACL 2025 pp. 1079-1083, Sections 5.5-6.6 and Tables 4-7
  • Limitaciones, validación humana y errores de Table 10: NAACL 2025 pp. 1083, 1088-1092, Limitations and Appendices B-C
  • Contradicción del prompt de poder: NAACL 2025 pp. 1092-1094, Table 12 and Figure 8
  • Metadatos oficiales y versión: ACL Anthology 2025.naacl-long.50 and arXiv:2503.01532v2
  • Conteos, filtro de género, reproducción de Table 6 y artefactos ausentes: Google Drive release and Inc0mple/Implicit_Bias_Interactive_Data_Viz commit e3bdb7cf0c96de50a497daaf876591274426e1b8 audited 16 July 2026
  • Informe completo: reports/verification/article-217-implicit-bias-persona-validity-and-artifact-audit.json