Bias and Fairness in Large Language Models: A Survey

Revisiones, teoría y gobernanza2024MIT PressRevisión editorial aprobada

Autores: Isabel O. Gallegos, Ryan A. Rossi, Joe Barrow, Md Mehrab Tanjim, Sungchul Kim, Franck Dernoncourt, Tong Yu, Ruiyi Zhang, Nesreen K. Ahmed

Palabras clave: Large Language Models, Bias evaluation, Fairness, Social bias, Natural language processing, AI ethics

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

9
Autores
14
Hallazgos
31
Limitaciones
14
Evidencias

Resumen editorial

Español

Este artículo es una revisión narrativa y taxonómica, no un experimento que mida el sesgo de un modelo concreto. Su principal aportación consiste en separar tres componentes que a menudo se confunden: qué daño social se quiere estudiar, con qué métrica se cuantifica y qué conjunto de datos proporciona los casos de evaluación. Define el sesgo social como trato o resultados dispares entre grupos surgidos de asimetrías históricas y estructurales de poder. Distingue daños representacionales, lenguaje derogatorio, rendimiento dispar, borrado, normas excluyentes, representación errónea, estereotipos y toxicidad, de daños de asignación, directos o indirectos, que distribuyen de forma desigual recursos u oportunidades.

La primera taxonomía organiza las métricas por aquello que obtienen del modelo: embeddings, probabilidades o texto generado. Las métricas de embeddings comparan distancias y asociaciones; las probabilísticas usan tokens enmascarados, pseudo-verosimilitud, perplejidad o elecciones entre frases; las de texto generado comparan distribuciones, clasificadores auxiliares o léxicos. El artículo insiste en que una asociación en el espacio de representación no equivale a daño en una aplicación y que embeddings y probabilidades se correlacionan de forma débil o inestable con resultados posteriores. También advierte que prompts, plantillas, temperatura, longitud, decodificación y modelos auxiliares pueden cambiar e incluso invertir las conclusiones. Por eso recomienda evaluar directamente la tarea de uso, publicar toda la configuración y vincular cada métrica con un daño y una teoría sociolingüística explícitos.

La segunda taxonomía enumera 23 datasets. Quince usan entradas contrafactuales: ocho con tokens enmascarados y siete con oraciones completas. Ocho usan prompts: cinco de continuación y tres de pregunta-respuesta. La tabla relaciona cada recurso con el daño y los grupos sociales que pretende cubrir, pero los autores recalcan problemas de validez de constructo, contenido y ecología: muchos ejemplos son artificiales, binarios, centrados en Estados Unidos o en género y estereotipos, y la sustitución de una identidad puede cambiar el significado de la oración. No existe un benchmark universal de equidad; la comparabilidad que aporta un conjunto común puede ocultar contexto y perspectivas de los grupos afectados.

La tercera taxonomía clasifica mitigaciones por el punto de intervención. El preprocesamiento incluye aumento, filtrado o reponderación, generación de datos, instruction tuning y proyecciones; el entrenamiento modifica arquitectura, función de pérdida, subconjuntos de parámetros o filtra parámetros; el intraprocesamiento cambia la decodificación, redistribuye pesos o añade redes modulares; el posprocesamiento reescribe la salida. El artículo no compara empíricamente su eficacia ni elige una técnica ganadora. Señala riesgos transversales: borrar identidades, tratar grupos como intercambiables, reducir diversidad lingüística, censurar dialectos minoritarios, trasladar sesgos desde clasificadores auxiliares y mejorar una métrica mientras el daño reaparece en otra etapa.

La sección final sitúa los límites técnicos dentro de relaciones de poder. Recomienda centrar a comunidades marginadas, adoptar investigación participativa, hacer explícitos valores y supuestos, ampliar idiomas y gobernanza de datos, desagregar grupos e intersecciones, crear estándares de reporte, estudiar validez y fiabilidad, combinar etapas de mitigación y analizar garantías y compromisos entre rendimiento y equidad. Los propios autores reconocen que organizar el campo por mecanismos técnicos adopta una perspectiva de solucionismo técnico, que el alcance omite partes del ciclo de vida y que se limita a trabajos en inglés.

La auditoría editorial confirma una cobertura amplia y una formalización útil, pero no permite llamarla revisión sistemática: no se publican bases consultadas, cadenas de búsqueda, fechas de corte, flujo de selección, número de estudios cribados ni evaluación de calidad. Su definición de LLM incluye modelos encoder como BERT y hasta WEAT para embeddings estáticos, de modo que el alcance es más amplio que el uso contemporáneo de «LLM generativo». El repositorio asociado, congelado en un commit de septiembre de 2023, contiene 21 carpetas frente a 23 datasets en la tabla final; no incluye GAP-Subjective ni Bias-STS-B, y RealToxicityPrompts y Equity Evaluation Corpus solo aportan documentación o enlaces. Cinco carpetas no contienen licencia local y el repositorio raíz tampoco. La contribución defendible es un mapa conceptual y técnico del campo hasta 2024, no evidencia de que un método elimine el sesgo ni una auditoría de personalidad sintética.

English

This article is a narrative, taxonomic review, not an experiment measuring bias in a particular model. Its main contribution is to separate three components that are often conflated: the social harm being studied, the metric used to quantify it, and the dataset supplying evaluation cases. It defines social bias as disparate treatment or outcomes between groups arising from historical and structural power asymmetries. It distinguishes representational harms, derogatory language, disparate performance, erasure, exclusionary norms, misrepresentation, stereotyping, and toxicity, from direct or indirect allocational harms that distribute resources or opportunities unequally.

The first taxonomy organizes metrics by what they obtain from a model: embeddings, probabilities, or generated text. Embedding metrics compare distances and associations; probability metrics use masked tokens, pseudo-likelihoods, perplexity, or sentence choices; generated-text metrics compare distributions, auxiliary classifiers, or lexicons. The paper stresses that an association in representation space is not equivalent to downstream harm, and that embedding- and probability-based measures relate weakly or inconsistently to application outcomes. Prompts, templates, temperature, length, decoding, and auxiliary models can change or even reverse conclusions. It therefore recommends evaluating the use-case task directly, publishing the full configuration, and tying every metric to an explicit harm and sociolinguistic theory.

The second taxonomy lists 23 datasets. Fifteen use counterfactual inputs: eight masked-token datasets and seven complete-sentence datasets. Eight use prompts: five sentence-completion and three question-answering resources. The table links each resource to target harms and social groups, but the authors emphasize construct, content, and ecological validity problems. Many instances are synthetic, binary, US-centric, or focused on gender and stereotypes, and substituting an identity term can alter a sentence's meaning. There is no universal fairness benchmark; shared benchmarks improve comparability but may erase context and affected communities' perspectives.

The third taxonomy classifies mitigations by intervention point. Pre-processing covers augmentation, filtering or reweighting, data generation, instruction tuning, and projection; in-training methods modify architecture, losses, parameter subsets, or filter parameters; intra-processing changes decoding, redistributes weights, or adds modular networks; post-processing rewrites outputs. The survey does not empirically compare effectiveness or select a winner. It identifies common risks: erasing identities, treating groups as interchangeable, reducing linguistic diversity, censoring minoritized dialects, inheriting bias from auxiliary classifiers, and improving one metric while harm reappears elsewhere.

The final section places technical limits within power relations. It recommends centering marginalized communities, participatory research, explicit values and assumptions, broader languages and data governance, disaggregated and intersectional groups, reporting standards, validity and reliability studies, hybrid mitigations, and analysis of guarantees and performance–fairness trade-offs. The authors acknowledge that organizing the field by technical mechanisms adopts a technical-solutionist perspective, omits parts of the lifecycle, and is limited to English-language papers.

The editorial audit confirms broad coverage and useful formalization, but it is not a systematic review: it reports no searched databases, search strings, cutoff dates, selection flow, screened-study count, or quality appraisal. Its LLM definition includes encoder models such as BERT and even WEAT for static embeddings, making the scope broader than contemporary generative-LLM usage. The associated repository, frozen at a September 2023 commit, has 21 folders versus 23 datasets in the final table; GAP-Subjective and Bias-STS-B are absent, and RealToxicityPrompts and Equity Evaluation Corpus contain documentation or links rather than data. Five folders lack a local license and so does the repository root. The defensible contribution is a conceptual and technical map of the field through 2024, not evidence that any method eliminates bias or an audit of synthetic personality.

Pregunta de investigación

¿Cómo pueden definirse con precisión los daños de sesgo social y la equidad en LLM, y cómo puede organizarse la literatura sobre métricas, datasets y técnicas de mitigación de acuerdo con el tipo de acceso al modelo y el punto de intervención?

Método

Revisión narrativa con formalización matemática y síntesis taxonómica. Incluye trabajos en inglés que proponen métricas cerradas, datasets o técnicas de mitigación aplicables a sesgo social en modelos preentrenados definidos ampliamente como LLM. Se construyen definiciones de daños y cinco desiderata de equidad; se clasifican métricas por embeddings, probabilidades o texto generado, datasets por entradas contrafactuales o prompts, y mitigaciones por preprocesamiento, entrenamiento, intraprocesamiento o posprocesamiento. No se describe un protocolo sistemático de búsqueda, cribado o evaluación de calidad. La auditoría editorial leyó y renderizó las 79 páginas, contrastó la tabla de datasets y revisó el repositorio asociado en su commit actual.

Muestra: No hay muestra experimental ni metaanálisis. La unidad de análisis son publicaciones seleccionadas de forma narrativa, sin número total de estudios incluido o cribado. La Tabla 4 resume 23 datasets: 15 de entradas contrafactuales y 8 de prompts. El repositorio asociado contiene 21 carpetas de recursos y 291 ficheros versionados; dos carpetas enlazan a datos externos sin incluirlos.

Hallazgos

  • El artículo separa nueve mecanismos de daño: siete representacionales y dos de asignación, que no son mutuamente excluyentes.
  • Propone cinco desiderata: desconocimiento del grupo, invariancia, asociaciones iguales de grupos, asociaciones neutrales iguales y réplica de una distribución de referencia.
  • Clasifica las métricas por embeddings, probabilidades y texto generado, aclarando que métrica y dataset son componentes distintos.
  • La literatura revisada muestra relaciones débiles o inconsistentes entre sesgo en embeddings y daño en aplicaciones posteriores.
  • Las métricas probabilísticas también pueden divergir del comportamiento final y dependen de plantillas, normalización y supuestos lingüísticos.
  • Las métricas sobre texto generado cambian con prompts y parámetros de decodificación; clasificadores y léxicos introducen sus propios sesgos y pérdidas de contexto.
  • La tabla de evaluación reúne 23 datasets: 15 contrafactuales y 8 basados en prompts.
  • Los autores señalan problemas recurrentes de validez, ambigüedad, cobertura social limitada y dependencia de contextos estadounidenses.
  • Las mitigaciones se ordenan en preprocesamiento, entrenamiento, intraprocesamiento y posprocesamiento, con catorce mecanismos concretos.
  • No se presenta una comparación empírica que permita ordenar mitigaciones por eficacia o seguridad.
  • Las recomendaciones priorizan evaluación directa del caso de uso, reporte de configuración, daño explícito y validez constructiva y ecológica.
  • El trabajo insiste en que neutralizar identidades o igualar toda asociación puede borrar diferencias relevantes y voces minoritarias.
  • Los problemas abiertos incluyen participación comunitaria, gobernanza de datos, interseccionalidad, estándares, benchmarks vivos, mitigación híbrida y garantías teóricas.
  • La auditoría del repositorio confirma una recopilación útil pero incompleta respecto a la tabla final y con permisos de reutilización heterogéneos.

Limitaciones

  • No es una revisión sistemática: faltan bases consultadas, consultas, fechas, deduplicación, criterios detallados y diagrama de selección.
  • No informa cuántos trabajos se localizaron, excluyeron o incluyeron ni evalúa su calidad o riesgo de sesgo.
  • La selección se restringe a propuestas de métricas cerradas, datasets o mitigaciones y deja fuera buena parte de auditoría cualitativa, gobernanza y estudios de despliegue.
  • El alcance se limita a trabajos en inglés, salvo idiomas adicionales dentro de algunos datasets y tareas.
  • La definición de LLM incluye modelos preentrenados encoder y encoder-decoder, más amplia que el uso actual centrado en modelos generativos.
  • Incluye WEAT para embeddings estáticos por continuidad histórica, aunque no sea una métrica de LLM propiamente dicha.
  • Es una fotografía hasta julio de 2024 y no cubre modelos, normas, benchmarks o mitigaciones posteriores.
  • Las categorías son una síntesis interpretativa de los autores; no se evalúa acuerdo entre codificadores de la taxonomía.
  • Organizar por detalles técnicos puede ocultar el contexto de uso, quién sufre el daño y qué relación de poder lo produce.
  • Los propios desiderata de igualdad e invariancia son normativos y pueden ser inadecuados cuando grupos distintos requieren tratamientos distintos.
  • Fairness through unawareness no evita proxies ni discriminación indirecta y puede impedir medir disparidades.
  • Una distribución de referencia no es intrínsecamente justa; el resultado depende de qué población y valores se elijan.
  • Las métricas de embeddings y probabilidades no deben interpretarse como equivalentes a daño downstream.
  • Prompts, semillas, temperatura, longitud y decodificación pueden producir conclusiones contradictorias sin que exista un estándar de reporte consolidado.
  • Los clasificadores auxiliares de toxicidad o sentimiento pueden penalizar dialectos e identidades marginadas.
  • Los léxicos ignoran relaciones entre palabras, contexto, ironía, uso-mención y daños expresados sin términos individualmente ofensivos.
  • Las entradas contrafactuales pueden dejar de ser semánticamente equivalentes al sustituir un grupo social.
  • Muchos datasets usan categorías binarias, grupos intercambiables, estereotipos artificiales y contexto estadounidense u occidental.
  • Los datasets estáticos envejecen y pueden crear complacencia al convertir una cuestión contextual en una puntuación universal.
  • Los benchmarks no cubren de forma exhaustiva daños, intersecciones, idiomas, culturas o contextos de despliegue.
  • Mitigar una representación no garantiza mitigar la aplicación; el sesgo puede reaparecer en etapas posteriores.
  • Aumento, filtrado y reescritura pueden borrar identidades, historia, dialectos y diversidad lingüística.
  • Las mitigaciones que usan listas, anotación o feedback humano no escalan fácilmente a todos los grupos y daños.
  • Las funciones objetivo incorporan valores y compromisos, pero muchos trabajos no explicitan qué noción de equidad optimizan.
  • Faltan comparaciones amplias entre etapas, técnicas híbridas, garantías teóricas y análisis sólidos de rendimiento-equidad.
  • El survey resume resultados ajenos y no reproduce métricas, datasets o mitigaciones, por lo que no valida su eficacia.
  • El repositorio asociado quedó en un commit de septiembre de 2023 y no está sincronizado con toda la tabla de la versión final.
  • El repositorio contiene 21 carpetas frente a 23 datasets; GAP-Subjective y Bias-STS-B no aparecen.
  • RealToxicityPrompts y Equity Evaluation Corpus no incluyen datos locales, solo licencia/README o enlace.
  • Cinco carpetas no contienen licencia local y no existe licencia raíz, por lo que no todos los permisos se comunican de forma uniforme.
  • El trabajo no trata específicamente personalidad sintética, psicometría o inferencia de rasgos; su relevancia es transversal por los riesgos de sesgo.

Qué no demuestra

  • No demuestra que un LLM concreto sea justo o injusto.
  • No estima la prevalencia o magnitud del sesgo en modelos actuales.
  • No demuestra que una métrica mida el daño social que afirma medir.
  • No establece una métrica o benchmark universal de equidad.
  • No prueba que embeddings o probabilidades predigan el daño de una aplicación.
  • No ordena datasets por calidad ni mitigaciones por eficacia.
  • No demuestra que alguna técnica elimine sesgo de manera completa, estable o generalizable.
  • No ofrece garantías teóricas de equidad.
  • No resuelve qué valores, grupos o distribución de referencia deben priorizarse.
  • No sustituye auditorías del contexto real, participación de comunidades ni gobernanza.
  • No valida usos de perfilado, selección, salud, educación, crédito o justicia.
  • No aporta evidencia sobre personalidad humana o sintética, rasgos Big Five o validez psicométrica.
  • No cubre de forma completa la investigación publicada después de julio de 2024.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2309.00770v3 (12 Jul 2024); accepted at Computational Linguistics, Volume 50, Number 3; publisher DOI 10.1162/coli_a_00524

Fuente consultada: https://arxiv.org/pdf/2309.00770v3

Revisión: Codex full-text, visual, taxonomy, dataset and repository audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • No experimental model sample; literature includes autoregressive, autoencoding and encoder-decoder pretrained language models
  • Examples discussed include GPT, GPT-2, GPT-3, GPT-4, BERT, RoBERTa, XLM-R, BART and T5
  • Auxiliary toxicity, sentiment, regard and style classifiers used by surveyed metrics

Instrumentos y métricas

  • Taxonomy of seven representational harms and two allocational harms
  • Five fairness desiderata for LLMs
  • Embedding-based bias metrics
  • Probability-based bias metrics
  • Generated-text distribution, classifier and lexicon metrics
  • Counterfactual-input and prompt dataset taxonomy
  • Four-stage mitigation taxonomy

Datos utilizados

  • Twenty-three bias-evaluation datasets listed in Table 4
  • Fifteen counterfactual-input datasets: eight masked-token and seven unmasked-sentence resources
  • Eight prompt datasets: five sentence-completion and three question-answering resources
  • Fair-LLM-Benchmark repository at commit b21f3912c4722f1b067e646d1cb100771b65095f

Evidencia y localización

  • Alcance, contribuciones y criterios generales de inclusión: arXiv v3, sections 1–2, pp. 1–13
  • Taxonomía de daños representacionales y de asignación: arXiv v3, Table 1 and section 2.2, pp. 6–10
  • Cinco desiderata de equidad: arXiv v3, Definitions 8–12, pp. 10–11
  • Taxonomía y limitaciones de métricas: arXiv v3, section 3 and Table 3, pp. 13–27
  • Recomendaciones para evaluación: arXiv v3, section 3.6, pp. 26–27
  • Veintitrés datasets, estructuras, daños y grupos: arXiv v3, section 4 and Table 4, pp. 27–34
  • Limitaciones y recomendaciones de datasets: arXiv v3, sections 4.1.3, 4.2.3 and 4.3, pp. 31–34
  • Taxonomía de mitigaciones: arXiv v3, section 5, Tables 5–6 and Figures 6–10, pp. 34–55
  • Recomendaciones de mitigación: arXiv v3, section 5.5, pp. 54–55
  • Poder, participación, grupos, estándares y garantías: arXiv v3, section 6, pp. 56–60
  • Limitaciones reconocidas por los autores: arXiv v3, section 7, pp. 60–61
  • Versión y aceptación: arXiv:2309.00770v3, revised 12 Jul 2024; accepted at Computational Linguistics 50(3)
  • Contenido y desfase de la recopilación: Official Fair-LLM-Benchmark repository commit b21f3912c4722f1b067e646d1cb100771b65095f; audited 15 Jul 2026
  • Licencias y carpetas sin datos locales: Official repository commit b21f3912, root README and dataset folders; audited 15 Jul 2026