Uncovering Stereotypes in Large Language Models: A Task Complexity-based Approach

Aplicaciones, sesgos y seguridad2024ACL AnthologyRevisión editorial aprobada

Título original: Uncovering Stereotypes in Large Language Models: A Task Complexity-Based Approach

Autores: Hari Shrawgi, Prasanjit Rath, Tushar Singhal, Sandipan Dandapat

Palabras clave: Large Language Models, Bias evaluation, Stereotypes, AI ethics, Social bias, Task complexity, Nationality, Gender, Race, Religion

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
20
Hallazgos
29
Limitaciones
10
Evidencias

Resumen editorial

Español

El artículo propone LLM Stereotype Index (LSI), un marco para comprobar si un modelo rechaza o acepta asignar a una persona uno de dos rasgos opuestos basándose solo en nacionalidad, género, raza o religión. Sus doce pares proceden de subdimensiones del Social Progress Index e incluyen, por ejemplo, malnutrido/bien nutrido, sin hogar/establecido, autoritario/libertario y discriminatorio/inclusivo. LSI no produce un escalar único: usa Choice Refusal Percentage (CRP), proporción que rehúsa elegir, y Stereotype Polarity (SP), proporción del polo considerado positivo entre quienes eligen. El ideal declarado es CRP=100%, porque incluso una elección positiva atribuye un rasgo por pertenencia grupal. Se ordenan siete familias de prompts desde la elección directa hasta escribir una función, pasando por persona de encuestador, entradas de dataset, incentivo profesional, código simple e historia. El diseño cruza 193 supuestas nacionalidades, ocho atributos de género, seis categorías raciales y diez religiones con doce pares, siete tareas y dos modelos: 157.752 generaciones entre ChatGPT y el segundo modelo, identificado como GPT-4 en el paper y como DV3 en los datos. GPT-4 también etiqueta las salidas como rechazo, polo negativo o positivo. Los porcentajes publicados muestran una caída grande, pero no monótona, del rechazo: ChatGPT recorre 79,4%, 64,2%, 26,7%, 28,8%, 5,4%, 1,6% y 0%; el segundo modelo 92,4%, 38,0%, 30,6%, 11,4%, 11,7%, 2,6% y 1,5%. En la tarea simple GPT-4 rechaza más, pero al agregar las siete ChatGPT tiene CRP medio mayor, 32,8% frente a 29,4%. GPT-4 presenta un mínimo SP medio mayor, 61,6% frente a 58,1%, y también mayor desviación entre grupos, 9,3% frente a 7,5%; el paper lo interpreta como protección superficial y sesgo más desigual cuando responde. La inferencia causal es más estrecha: las tareas cambian a la vez formato, indirección, persona, incentivo, longitud, presión de elegir y detectabilidad de la etiqueta. El descenso demuestra sensibilidad a esas familias de prompts, no que la complejidad aislada descubra prejuicio latente ni que GPT-4 lo oculte estratégicamente; tampoco hay intervalos o tests. La auditoría confirma las 157.752 filas y reproduce los CRP, pero la lista de países contiene el marcador NA, usado en 504 prompts, y omite Islas Salomón; falta documentar DV3, las llamadas exactas a OpenAI, la validación humana y el análisis de tablas. El fallo principal está en la séptima tarea: la corrección marca positivo si el texto contiene el polo positivo en cualquier lugar y solo busca después el negativo. Como las funciones suelen mencionar ambos retornos, cambia 6.889 de 11.268 etiquetas (61,1%), 6.470 hacia positivo. Antes de esa regla, CRP sería 5,4% y 7,3%, no 0% y 1,5%, y SP 52,9% y 52,2%, no 71,5% y 84,5%. La contribución defendible es que las salvaguardas de rechazo son muy sensibles a la forma del prompt; la favorabilidad y parte de la severidad comparativa dependen fuertemente de una regla direccional.

English

The paper proposes the LLM Stereotype Index (LSI), a framework for testing whether a model refuses or accepts assigning one of two opposing traits to a person solely from nationality, gender, race, or religion. Its twelve pairs follow Social Progress Index subdimensions and include malnourished/well-nourished, homeless/settled, authoritarian/libertarian, and discriminatory/inclusive. LSI does not yield one scalar index: it uses Choice Refusal Percentage (CRP), the share that refuses to choose, and Stereotype Polarity (SP), the positive-pole share among answers that choose. The declared ideal is CRP=100%, because a positive choice still attributes a trait by group membership. Seven prompt families are ordered from direct choice to function writing, with a surveyor persona, dataset entries, a career incentive, simple code, and story writing between them. The design crosses 193 purported nationalities, eight gender attributes, six race categories, and ten religions with twelve pairs, seven tasks, and two models: 157,752 generations split between ChatGPT and a second model identified as GPT-4 in the paper but DV3 in the data. GPT-4 also labels outputs as refusal, negative pole, or positive pole. Published percentages show a large but non-monotonic fall in refusal: ChatGPT reaches 79.4%, 64.2%, 26.7%, 28.8%, 5.4%, 1.6%, and 0%; the second model reaches 92.4%, 38.0%, 30.6%, 11.4%, 11.7%, 2.6%, and 1.5%. GPT-4 refuses more on the simplest task, but across all seven ChatGPT has the larger mean CRP, 32.8% versus 29.4%. GPT-4 has a larger average minimum SP, 61.6% versus 58.1%, and also larger between-group deviation, 9.3% versus 7.5%; the paper reads this as surface protection and more unequal bias when GPT-4 answers. The causal inference is narrower: task format, indirectness, persona, incentive, length, forced-choice pressure, and label detectability all change with complexity. The fall establishes prompt-family sensitivity, not that isolated complexity uncovers latent prejudice or that GPT-4 strategically hides it; no intervals or tests are reported. The artifact audit confirms all 157,752 rows and reproduces CRP, but the country list contains literal NA in 504 prompts and omits Solomon Islands; DV3, exact OpenAI calls, human validation, and table-generation analysis are undocumented. The central defect is the seventh-task correction: it marks positive whenever the positive phrase appears anywhere and checks the negative phrase only afterward. Functions often mention both returns, so 6,889 of 11,268 labels (61.1%) change, 6,470 toward positive. Before this rule, CRP is 5.4% and 7.3%, not 0% and 1.5%, and SP is 52.9% and 52.2%, not 71.5% and 84.5%. The defensible contribution is that refusal safeguards are highly prompt-form-sensitive; favorable polarity and part of the comparative severity depend strongly on a directional labeling rule.

Pregunta de investigación

¿Permite un benchmark basado en el Social Progress Index y en siete familias de tareas detectar cómo varían el rechazo a estereotipar y la polaridad de las elecciones de ChatGPT y GPT-4 entre nacionalidad, género, raza y religión, especialmente al aumentar la complejidad atribuida al prompt?

Método

Diseño factorial de generación y etiquetado automático. Doce pares positivo/negativo derivados del Social Progress Index se cruzan con 217 atributos demográficos, siete plantillas ordenadas por complejidad y dos modelos. Se ejecutan tres repeticiones para 193 entradas de nacionalidad y quince para los 24 atributos restantes, con 157.752 salidas. GPT-4 clasifica cada salida como rechazo (-1), elección negativa (0) o positiva (1); CRP se calcula sobre todas las salidas y SP sobre las que eligen. La auditoría editorial leyó y renderizó las 17 páginas, verificó ACL, congeló el commit público, inspeccionó zips, notebook y scripts, analizó por streaming las hojas del workbook, reprodujo CRP y recalculó la corrección de la tarea de función.

Muestra: 157.752 generaciones: 97.272 para nacionalidad, 25.200 para religión, 20.160 para género y 15.120 para raza, repartidas por igual entre ChatGPT y DV3. Cada tipo de tarea contiene 22.536 filas. Hay 193 entradas de nacionalidad por tres repeticiones y 24 atributos restantes por quince; una entrada es NA, no un país, y produce 504 filas. ChoiceLabel contiene 44.437 rechazos, 76.167 elecciones positivas y 37.148 negativas; la hoja de elecciones conserva 113.315 filas. La exploración de LLaMA2 usa 100 ejemplos por tarea y reporta 53,3% de fallos medios.

Hallazgos

  • El workbook contiene exactamente 157.752 generaciones, 78.876 por modelo.
  • Los CRP por tarea publicados se reproducen exactamente desde ChoiceLabel.
  • ChatGPT baja de CRP 79,4% a 0% y el segundo modelo de 92,4% a 1,5% en el orden del paper.
  • La secuencia no es monótona en ninguno de los dos modelos.
  • En la tarea directa GPT-4 rechaza más que ChatGPT en las cuatro demografías.
  • Al agregar las siete tareas ChatGPT tiene mayor CRP medio: 32,8% frente a 29,4%.
  • ChatGPT/GPT-4 alcanzan CRP 27,2/24,7% en nacionalidad, 41,4/34,0% en raza, 24,0/27,0% en religión y 38,6/31,9% en género.
  • El mínimo SP medio sube de 58,1% a 61,6% y la desviación entre grupos de 7,5% a 9,3%.
  • Los grupos con SP mínimo son África, Hispanic, Islam y Male en ambas generaciones de modelo.
  • El paper informa Opportunity 19,2% para Siria frente a 77,1% para Alemania.
  • African American alcanza SP 4,0% en Shelter frente a 53,2% para White.
  • La regla de la tarea de función cambia 6.889 de 11.268 etiquetas, el 61,1%.
  • De esos cambios, 6.470 terminan en positivo y 419 en negativo.
  • Sin la corrección, CRP en esa tarea es 5,4% y 7,3%, no 0% y 1,5%.
  • Sin la corrección, SP es 52,9% y 52,2%; con ella pasa a 71,5% y 84,5%.
  • La lista incluye NA en lugar de Islas Salomón; 504 prompts preguntan por una persona de NA.
  • Los 504 grupos NA quedan vacíos en group_placeholder por su tratamiento como valor ausente en Excel.
  • El segundo modelo aparece como DV3 en 78.876 filas sin documentarse su vínculo con GPT-4.
  • Una salida está vacía y recibe una etiqueta de rechazo razonada.
  • LLaMA2-7B falla de media en 53,3% de 100 ejemplos por tarea y no se ejecuta sobre el corpus completo.

Limitaciones

  • Las tareas confunden complejidad con formato, indirección, persona, incentivo, longitud y presión de elegir.
  • La complejidad no se valida con participantes ni una medida independiente; la acción se valora preguntando a un LLM.
  • No se publican las calificaciones de complejidad ni el modelo que las produjo.
  • No hay intervalos, errores estándar, pruebas de tendencia ni tests de diferencias.
  • Tres repeticiones por nacionalidad dan estimaciones por país menos estables que las quince restantes.
  • CRP mide rechazo explícito, no asociaciones ocultas cuando el modelo rehúsa.
  • CRP no distingue negativa moral, incapacidad, desviación de formato o truncamiento.
  • SP considera favorable el polo positivo aunque siga siendo una generalización grupal.
  • LSI no define una puntuación compuesta única pese a denominarse índice.
  • Los pares trasladan indicadores estructurales del SPI a rasgos personales y pueden incurrir en falacia ecológica.
  • Los polos no son simétricos, exhaustivos ni universalmente positivos o negativos.
  • El SPI incorpora una perspectiva occidental no adaptada por contexto cultural.
  • Las categorías raciales son estadounidenses y los atributos de género mezclan dimensiones no equivalentes.
  • Las categorías no son mutuamente excluyentes y no se estudian intersecciones.
  • Todos los daños reciben peso uniforme sin modelar poder, aplicación o gravedad.
  • La lista contiene NA y omite Islas Salomón, contradiciendo 193 países reales.
  • Faltan snapshot, fecha por fila, deployment y configuración exacta de mensajes.
  • DV3 no se explica y no permite verificar independientemente GPT-4.
  • GPT-4 etiqueta sus propias respuestas, creando dependencia entre evaluado y juez.
  • La validación de 500 ejemplos no libera selección, gold labels, anotadores ni errores.
  • small_test_set.tsv contiene 26 ejemplos sin etiquetas humanas, no la validación declarada.
  • La corrección busca primero el polo positivo y sesga masivamente SP.
  • La regla no identifica la rama ejecutada ni la primera elección cuando aparecen ambos literales.
  • El notebook usa tres repeticiones globales y no reproduce sin edición manual el diseño 3/15.
  • No se libera el código de llamadas, análisis CRP/SP, gráficos ni ejecución end-to-end.
  • No hay licencia, entorno fijado, tests, CI, semillas o logs de coste.
  • La evaluación LLaMA2 usa una cuantización comunitaria no versionada y muchos fallos de instrucción.
  • Los modelos son de 2023 y los porcentajes no deben trasladarse a versiones actuales.
  • Los prompts artificiales no miden consecuencias en sistemas, usuarios o decisiones reales.

Qué no demuestra

  • No demuestra prejuicios, intenciones o ocultación consciente en los modelos.
  • No aísla la complejidad como causa del descenso del rechazo.
  • No establece que una elección positiva sea imparcial o segura.
  • No prueba que menor SP cause más daño en una aplicación concreta.
  • No valida el SPI como taxonomía universal de estereotipos individuales.
  • No permite atribuir con certeza DV3 a un snapshot exacto de GPT-4.
  • No permite regenerar respuestas, control humano y figuras desde el repositorio.
  • No sostiene SP de la tarea de función sin una regla que altera 61,1% de etiquetas.
  • No generaliza a otros idiomas, culturas, modelos actuales o tareas naturales.
  • No demuestra discriminación o daño social fuera del experimento.

Trazabilidad

Alcance: Texto completo

Versión: EACL 2024 long paper 111, pages 1841–1857; DOI 10.18653/v1/2024.eacl-long.111

Fuente consultada: https://aclanthology.org/2024.eacl-long.111.pdf

Revisión: Codex full-text, visual, code, workbook and label-robustness audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • ChatGPT / GPT-3.5-Turbo endpoint available in May–June 2023
  • GPT-4 endpoint available in May–June 2023, represented as DV3 in the released workbook without a documented mapping
  • TheBloke/Llama-2-7b-Chat-GPTQ exploratory sample, not part of the full comparison
  • GPT-4 used as automatic choice-labeling model

Instrumentos y métricas

  • LLM Stereotype Index framework
  • Choice Refusal Percentage (CRP)
  • Stereotype Polarity (SP)
  • Twelve bipolar stereotype pairs mapped to Social Progress Index subdimensions
  • Seven prompt families spanning direct choice, persona, dataset entry, incentive, story and code
  • Task-complexity dimensions: size, variety, relationships and action complexity
  • GPT-4 three-way choice-detection prompt
  • Identifier-6 positive-first string correction

Datos utilizados

  • GeneratedData_157k_withChoiceLabels.xlsx with 157,752 experimental rows and 113,315 choice rows
  • PaperData.xlsx with CRP, skew, radar and model-comparison tables
  • SPI_Stereotypes.xlsx with 28 demographic-task templates and 12 stereotype pairs
  • country_names.tsv with 193 entries including invalid NA and omitting Solomon Islands
  • VenkitExpCompletions_ChatGPTWithSentimentAndCountry.xlsx baseline replication
  • Seven 100-row LLaMA2-7B exploratory TSV files
  • GitHub Avenge-PRC777 repository commit 017d3457950df3abf1a4e19f1ea3339bd0c2f567

Evidencia y localización

  • Motivación, contribuciones y ocultación: EACL paper pp. 1–3, Abstract, Introduction and Sections 2–3
  • Complejidad y siete tareas: EACL paper pp. 3–5, Section 4, Figure 2 and Appendix A
  • Pares SPI, CRP y SP: EACL paper pp. 5–6, Sections 5–6 and Figures 3–4
  • Muestra, modelos y configuración: EACL paper pp. 6 and 14–15, Section 7, Appendix C and Table 7
  • CRP y comparación de modelos: EACL paper pp. 6–7, Section 8.1–8.2, Tables 2–3 and Figure 5
  • Resultados por demografía: EACL paper pp. 7–8, Section 8.3, Figure 6 and Tables 4–6
  • Limitaciones y LLaMA2: EACL paper pp. 8–10 and 15–17, Limitations, Ethics and Appendix E
  • Metadatos, DOI y abstract: ACL Anthology record 2024.eacl-long.111, checked 15 Jul 2026
  • Artefacto, DV3 y validación no liberada: GitHub commit 017d345, both supplementary zips, notebook and scripts, audited 15 Jul 2026
  • Conteos, NA, CRP y corrección positiva-primero: Editorial audit of GeneratedData_157k_withChoiceLabels.xlsx, PaperData.xlsx and identifier-6 correction, 15 Jul 2026