Measuring gender and racial biases in large language models: Intersectional evidence from automated resume evaluation

Aplicaciones, sesgos y seguridad2025PNAS NexusRevisión editorial aprobada

Título original: Measuring Gender and Racial Biases in Large Language Models: Intersectional Evidence from Automatic Resume Evaluation

Autores: Jiafu An, Difang Huang, Chen Lin, Mingzhu Tai

Palabras clave: Large Language Models, Gender bias, Racial bias, Intersectionality, Resume evaluation, Hiring discrimination

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
10
Hallazgos
33
Limitaciones
12
Evidencias

Resumen editorial

Español

El estudio audita si cinco modelos de lenguaje asignan puntuaciones distintas a currículos de cualificación comparable cuando cambia la identidad social sugerida por el nombre. Los autores partieron de 149 anuncios de empleo y eligieron 20 puestos de entrada. Extrajeron experiencia, educación y habilidades de 25.000 currículos de Indeed y recombinaron esas características para generar aproximadamente 361.000 currículos ficticios en cinco estados de Estados Unidos. Cada currículo recibió una identidad aleatoria y equilibrada entre mujer negra, mujer blanca, hombre negro y hombre blanco. GPT-3.5 Turbo, GPT-4o, Gemini 1.5 Flash, Claude 3.5 Sonnet y Llama 3-70b puntuaron la adecuación al puesto entre 0 y 100 con temperatura cero, salvo Llama con 0,01. Las regresiones controlan características observables del currículo e incluyen efectos fijos de puesto, estado y último cargo, con errores agrupados en 100 combinaciones puesto-estado. En GPT-3.5 Turbo, el efecto medio estimado de ser mujer es +0,452 puntos y el de ser una persona negra es −0,074; frente a hombres blancos, las diferencias son +0,379 para mujeres negras, +0,223 para mujeres blancas y −0,303 para hombres negros. Los otros cuatro modelos también puntúan más alto a las mujeres: los efectos globales oscilan entre +0,646 y +1,110 puntos. Para hombres negros, la diferencia frente a hombres blancos es −0,591 en GPT-4o, −0,252 en Gemini y −0,611 en Claude; en Llama es −0,104 y no resulta estadísticamente distinguible de cero. La dirección del efecto racial agregado cambia según modelo porque combina patrones interseccionales opuestos. Aunque la muestra produce intervalos estrechos, las diferencias son pequeñas respecto a la escala y a la dispersión de las puntuaciones. Su posible impacto aumenta al imponer umbrales: con GPT-3.5 y corte en 80, el artículo estima aproximadamente +1,7 puntos porcentuales para mujeres negras, +1,4 para mujeres blancas y −1,4 para hombres negros. Esas no son contrataciones observadas, sino probabilidades hipotéticas derivadas de convertir puntuaciones muy redondeadas en una decisión binaria. Las pruebas con descripciones de puesto más largas, submuestras y estratos conservan la dirección general, pero solo GPT-3.5 recibe la prueba alternativa de prompt. Una extensión con otras 360.000 simulaciones encuentra desventajas grandes para nombres asiáticos e hispanos en GPT-3.5 y patrones distintos en modelos posteriores, reforzando que no existe un único eje estable de “sesgo racial”. La evidencia demuestra sensibilidad sistemática de las puntuaciones a nombres asociados con género y origen racial o étnico bajo este protocolo; no mide decisiones laborales reales ni demuestra que la IA mejore o empeore la discriminación humana. La reproducibilidad es parcial: OSF publica cinco datasets derivados y código Stata para las cinco figuras principales, pero no los currículos, nombres, generador, llamadas y salidas crudas, datos de etnias adicionales ni identificadores exactos de los modelos. Dos figuras dependen además de resultados almacenados manualmente y el muestreo repetido no fija semilla.

English

The study audits whether five language models assign different scores to comparably qualified resumes when the social identity implied by the applicant's name changes. The authors started from 149 job advertisements and selected 20 entry-level positions. They extracted work history, education, and skills from 25,000 Indeed resumes and recombined those characteristics into approximately 361,000 fictitious resumes across five US states. Each resume received a randomized identity, balanced among Black women, White women, Black men, and White men. GPT-3.5 Turbo, GPT-4o, Gemini 1.5 Flash, Claude 3.5 Sonnet, and Llama 3-70b rated job suitability from 0 to 100 at temperature zero, except Llama at 0.01. The regressions control for observed resume characteristics and absorb position, state, and latest-job-title fixed effects, with standard errors clustered across 100 position-state cells. For GPT-3.5 Turbo, the estimated average effect of being female is +0.452 score points and that of being Black is −0.074. Relative to White men, the differences are +0.379 for Black women, +0.223 for White women, and −0.303 for Black men. The other four models also give women higher scores, with overall female coefficients from +0.646 to +1.110 points. For Black men relative to White men, the difference is −0.591 in GPT-4o, −0.252 in Gemini, and −0.611 in Claude; Llama's −0.104 estimate is not statistically distinguishable from zero. The aggregate race coefficient changes direction across models because it combines opposing intersectional patterns. Although the large sample yields narrow intervals, the score differences are small relative to the 0–100 scale and observed score dispersion. Their apparent impact grows when a cutoff is imposed: at GPT-3.5's 80-point threshold, the paper estimates roughly +1.7 percentage points for Black women, +1.4 for White women, and −1.4 for Black men. These are not observed hiring outcomes; they are hypothetical probabilities obtained by converting highly rounded model scores into a binary decision. Longer job-description prompts, subsamples, and stratified analyses broadly preserve the direction of results, but only GPT-3.5 receives the alternative-prompt test. An extension based on another 360,000 simulations reports large disadvantages for Asian- and Hispanic-associated names in GPT-3.5 and different patterns in newer models, showing that there is no single stable axis of racial bias. The evidence establishes systematic sensitivity of model scores to names associated with gender and racial or ethnic origin under this protocol. It does not measure real employment decisions or show whether AI improves or worsens human discrimination. Reproducibility is partial: OSF provides five derived datasets and Stata code for the five main figures, but not the resumes, name lists, generation code, API calls and raw outputs, additional-ethnicity data, or exact model snapshot identifiers. Two figures also rely on manually stored estimates, and the repeated subsampling does not set a random seed.

Pregunta de investigación

¿Cambian las puntuaciones que cinco LLM asignan a candidaturas de entrada cuando la identidad de género y racial o étnica sugerida por el nombre varía aleatoriamente, cómo interactúan ambas dimensiones y cómo se traducen esas diferencias bajo umbrales hipotéticos de selección?

Método

Experimento de auditoría con currículos sintéticos. A partir de 25.000 currículos reales para 20 puestos, los autores muestrean con reemplazo experiencia, educación y habilidades dentro de celdas puesto-estado, construyen aproximadamente 361.000 perfiles y asignan aleatoriamente nombres asociados con cuatro intersecciones de género y raza. Cinco LLM puntúan cada perfil de 0 a 100. Se estiman regresiones lineales con controles, efectos fijos de puesto, estado y último cargo, y errores agrupados por 100 celdas puesto-estado; se añaden regresiones cuantílicas, interacciones con una medida derivada de calidad, 500 submuestras aleatorias del 20 %, prompts alternativos para GPT-3.5 y modelos lineales de probabilidad para seis umbrales. Una extensión incorpora nombres asiáticos e hispanos.

Muestra: El marco parte de 20 puestos de entrada, cinco estados y 25.000 currículos reales. El experimento principal genera 361.000 currículos equilibrados al 25 % entre mujer negra, mujer blanca, hombre negro y hombre blanco. Tras valores atípicos, puntuaciones inválidas y observaciones absorbidas, los N de regresión son 332.886 para GPT-3.5, 319.478 para GPT-4o, 322.819 para Gemini, 318.145 para Claude y 330.438 para Llama. La extensión combina otros 360.000 currículos con identidades asiáticas e hispanas y presenta N entre 622.235 y 659.900 según modelo. No hay solicitantes, reclutadores ni decisiones de contratación reales en el experimento.

Hallazgos

  • En GPT-3.5 Turbo, ser mujer se asocia con +0,4521 puntos y ser una persona negra con −0,0736 puntos, condicionando por los controles y efectos fijos; el segundo resultado solo alcanza el umbral del 10 %.
  • Frente a hombres blancos, GPT-3.5 puntúa +0,3786 a mujeres negras, +0,2227 a mujeres blancas y −0,3032 a hombres negros.
  • Los cuatro modelos adicionales muestran coeficientes globales positivos para mujeres: +0,6455 en GPT-4o, +1,0174 en Gemini, +1,1098 en Claude y +0,7488 en Llama.
  • La diferencia para hombres negros frente a hombres blancos es −0,5907 en GPT-4o, −0,2517 en Gemini y −0,6114 en Claude; en Llama es −0,1043 y no significativa.
  • El coeficiente racial agregado es negativo en GPT-4o y Claude, no significativo en Gemini y positivo en Llama, por lo que ocultar la intersección entre género y raza cambia sustancialmente la lectura.
  • Las puntuaciones se concentran en múltiplos de cinco: el 99,4 % de las de GPT-3.5 y el 100 % de las de Gemini en los datos publicados son múltiplos de cinco. Esto hace que pequeñas diferencias de puntuación puedan producir saltos al aplicar un corte.
  • Con GPT-3.5 y un corte hipotético de 80, el artículo estima alrededor de +1,7 puntos porcentuales para mujeres negras, +1,4 para mujeres blancas y −1,4 para hombres negros frente a hombres blancos.
  • La dirección general persiste en estratos por composición ocupacional, estado asignado, 500 submuestras del 20 % y, para GPT-3.5, prompts con una descripción real del puesto con o sin cláusula de igualdad de oportunidades.
  • En la extensión, GPT-3.5 penaliza fuertemente los nombres asiáticos e hispanos en ambos géneros, mientras que los cuatro modelos posteriores muestran signos y magnitudes diferentes; no hay un patrón racial único entre modelos.
  • La auditoría de OSF confirma cinco datasets derivados y 1.045 líneas de Stata para las figuras principales. Los N y medias publicadas son coherentes con esos archivos, pero la generación y puntuación crudas no pueden reconstruirse.

Limitaciones

  • El resultado observado es una puntuación producida por un LLM, no una entrevista, oferta, contratación, salario ni trayectoria laboral real.
  • No hay comparación con reclutadores humanos ni con un criterio validado de calidad o desempeño laboral, por lo que no puede determinarse si los modelos reducen o agravan el sesgo humano.
  • Los efectos son pequeños respecto a la escala y la dispersión de puntuaciones; su relevancia práctica depende de reglas de decisión no observadas.
  • Las probabilidades de contratación son construcciones hipotéticas basadas en seis cortes arbitrarios, no probabilidades calibradas con decisiones reales.
  • La fuerte concentración en múltiplos de cinco vuelve los resultados de umbral discontinuos y sensibles a elegir 60, 65, 70, 75, 80 u 85.
  • La extrapolación a cientos de miles de empleos supone adopción universal, igual umbral, aplicabilidad a todos los puestos y una relación directa entre puntuación y vacante; el experimento no valida esos supuestos.
  • La identidad se infiere solo mediante nombres; no hay comprobación de cómo los modelos perciben cada nombre y los nombres pueden transmitir señales sociales adicionales a género y raza.
  • El diseño principal reduce género a mujer/hombre y raza a negra/blanca; la extensión añade asiática e hispana, pero no representa identidades no binarias, multirraciales ni variación intragrupal.
  • Cada identidad se asigna a un currículo distinto en lugar de puntuar versiones emparejadas del mismo currículo con varios nombres; la gran muestra equilibra covariables en promedio, pero se pierde un contraste dentro del mismo perfil.
  • Los currículos ficticios recombinan experiencias, educación y habilidades con reemplazo y asumen trayectorias sin huecos; no se valida con personas si los perfiles resultantes son coherentes o realistas.
  • Los 25.000 currículos de Indeed se rastrearon de la web y aportan texto laboral real, pero el artículo no presenta una discusión detallada de consentimiento, revisión ética, gobernanza o términos de uso.
  • Solo se estudian 20 puestos de entrada y cinco estados de Estados Unidos en inglés; la validez para trabajos especializados, dirección, otros países, idiomas o culturas no está establecida.
  • El prompt principal solo indica el título del puesto y simula deliberadamente un reclutador no entrenado; no representa un sistema de selección profesional configurado, evaluado y supervisado.
  • La prueba con descripciones completas y cláusula de igualdad se limita a GPT-3.5 y no permite afirmar robustez de prompt para los otros cuatro modelos.
  • No se informan los identificadores exactos de las instantáneas, fechas de API para cada modelo, proveedor o checkpoint de Llama ni parámetros completos de generación.
  • El suplemento afirma que todos los ítems se entregan en una sola sesión pero también que los currículos se envían en varias pasadas por límites de tokens; no documenta tamaño de lote, orden, reinicios ni efectos de contexto.
  • Cada modelo parece puntuar cada currículo una sola vez; no hay repeticiones por currículo para medir estabilidad temporal, estocástica o entre sesiones.
  • Los modelos descartan puntuaciones inválidas sin un diagrama de flujo ni análisis formal de selección. En el dataset de cuatro modelos faltan aproximadamente 3,8 % de GPT-4o, 2,8 % de Gemini, 4,2 % de Claude y 0,5 % de Llama, con tasas ligeramente distintas por identidad.
  • La medida alternativa de calidad del currículo se deriva de la misma puntuación del modelo y en la misma muestra, sin criterio externo ni validación fuera de muestra, lo que hace circular su interpretación.
  • Las regresiones cuantílicas ordenan la propia puntuación del modelo y la presentan como calidad del currículo; con resultados discretos y redondeados, los coeficientes extremos no identifican limpiamente calidad objetiva.
  • Comparar R² entre grupos no prueba que el modelo use la información por igual ni que elimine la discriminación de atención, porque R² depende también de la varianza del resultado y del error.
  • Se realizan muchas comparaciones entre grupos, modelos, puestos, estados, cuantiles y umbrales sin corrección explícita por multiplicidad.
  • Los errores se agrupan en 100 celdas puesto-estado; los análisis por estratos tienen menos conglomerados y no se complementan con inferencia de aleatorización.
  • La tabla comparativa de modelos incluye tamaños, datos de entrenamiento y estrategias de mitigación estimados o especulativos sin fuentes; contiene incoherencias internas, como atribuir a Gemini una ventana de unos 7.000 tokens y también de un millón.
  • Las diferencias entre modelos no son un experimento controlado: cambian arquitectura, entrenamiento, alineamiento, proveedor, fecha y comportamiento de puntuación, por lo que no identifican la causa de las diferencias.
  • La explicación que atribuye la ventaja femenina al postentrenamiento o debiasing es una conjetura; el estudio no compara de forma emparejada modelos base y ajustados ni observa los datos o procesos de alineamiento.
  • OSF publica variables derivadas, no los currículos, nombres, identificadores, generador, prompts por lote, respuestas crudas, errores de API o scripts de limpieza; por ello no puede reproducirse el experimento de extremo a extremo.
  • Los datos de la extensión asiática e hispana y los experimentos de prompt alternativo no están en los cinco datasets depositados, de modo que esas tablas no se pueden recalcular desde el paquete público.
  • Los archivos no incluyen un identificador de currículo. En el dataset GPT-3.5 hay una puntuación ausente y 186 filas adicionales exactamente duplicadas sobre todas las variables publicadas; sin texto ni ID no se puede saber si son duplicados reales o perfiles distintos que colapsan a los mismos campos.
  • El código de las figuras 3 y 4 utiliza estimaciones guardadas manualmente; el muestreo repetido no fija semilla y el README no enumera todas las dependencias, como el comando eststo, por lo que una ejecución limpia no es totalmente determinista.
  • El proyecto OSF no es un registro previo y fue creado pocos días antes de la publicación; no permite distinguir decisiones confirmatorias de exploraciones realizadas durante el análisis.
  • Hay errores internos de redacción: la declaración de significación dice erróneamente que se favorece a hombres negros, mientras el resultado central muestra una penalización, y la discusión menciona más de 36.000 en vez de aproximadamente 361.000 currículos.
  • El experimento es una instantánea de 2023–2024. Los servicios propietarios pueden cambiar sin aviso, por lo que los coeficientes no deben tratarse como propiedades actuales y permanentes de las marcas evaluadas.

Qué no demuestra

  • No demuestra discriminación en contrataciones reales; demuestra diferencias en puntuaciones simuladas bajo un prompt concreto.
  • No prueba que sustituir reclutadores humanos por LLM reduzca o aumente la desigualdad laboral, porque no existe comparación humana ni resultado laboral observado.
  • No demuestra que mujeres negras o blancas obtendrían cientos de miles de empleos adicionales ni que hombres negros perderían ese número de empleos.
  • No establece que una diferencia estadísticamente significativa sea materialmente importante sin especificar una política real de selección y su calibración.
  • No identifica el origen causal de los patrones en datos de preentrenamiento, RLHF, filtros, anotadores, instrucciones o mitigación de sesgo.
  • No demuestra que los modelos hayan corregido o “sobrecorregido” una discriminación previa; esos términos son interpretaciones, no contrastes longitudinales.
  • No establece que favorecer en promedio a un grupo vuelva justo al sistema, porque equidad no equivale a invertir el signo de una diferencia media.
  • No permite inferir la probabilidad de contratación de una persona concreta ni la calidad laboral de los candidatos.
  • No generaliza a otros idiomas, países, periodos, puestos de alta cualificación, entrevistas, cartas de motivación o procesos multietapa.
  • No prueba que los nombres midan exclusivamente raza y género percibidos ni que todas las personas interpretarían las identidades del mismo modo.
  • No demuestra que Llama sea más transparente o justo por ser abierto, ni que los modelos propietarios compartan un mecanismo común de sesgo.
  • No establece que los modelos actuales con esos nombres comerciales reproduzcan los coeficientes, porque faltan snapshots exactos y los servicios cambian.
  • No prueba que los modelos utilicen por igual la información del currículo ni que hayan eliminado la discriminación por atención a partir de similitudes de R².

Trazabilidad

Alcance: Texto completo

Versión: PNAS Nexus 4(3), pgaf089; advance access 12 March 2025; PMC11937954.1; CC BY-NC 4.0

Fuente consultada: https://pmc-oa-opendata.s3.amazonaws.com/PMC11937954.1/PMC11937954.1.pdf

Revisión: Codex full-text, visual, supplementary-material, OSF, code and dataset audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-3.5 Turbo (snapshot exacto no informado)
  • GPT-4o (snapshot exacto no informado)
  • Gemini 1.5 Flash (snapshot exacto no informado)
  • Claude 3.5 Sonnet (snapshot exacto no informado)
  • Llama 3-70b (checkpoint y proveedor de API no informados)

Instrumentos y métricas

  • Experimento de auditoría con identidades asignadas mediante nombres
  • Puntuación LLM de adecuación al puesto de 0 a 100
  • Regresión lineal con efectos fijos de alta dimensión
  • Errores estándar agrupados por combinación puesto-estado
  • Regresión cuantílica
  • Modelos lineales de probabilidad bajo umbrales de 60 a 85
  • 500 submuestras aleatorias del 20 %

Datos utilizados

  • 149 anuncios filtrados de Indeed y Snagajob
  • 25.000 currículos de Indeed usados para construir distribuciones, no publicados
  • Aproximadamente 361.000 currículos ficticios del experimento principal
  • Aproximadamente 360.000 currículos adicionales para identidades asiáticas e hispanas
  • OSF 4dahv: data_gpt35_baseline.dta
  • OSF 4dahv: data_gpt35_heter.dta
  • OSF 4dahv: data_score_4models.dta
  • OSF 4dahv: data_bootstrap_gpt35.dta
  • OSF 4dahv: data_magnitude_gpt35.dta

Evidencia y localización

  • Pregunta, modelos, resultado general y licencia: Artículo, p. 1, Abstract, Significance Statement y aviso de licencia
  • Selección de 20 puestos y origen de los anuncios: Suplemento, pp. 3–6, Supplementary Note 1 y Material S1
  • Construcción de 361.000 currículos y asignación de nombres: Artículo, pp. 10–11, Resume creation; suplemento, pp. 7–13, Supplementary Note 2
  • Prompt, temperatura, modelos y procesamiento por lotes: Artículo, p. 11, LLM scoring; suplemento, pp. 13–15, Supplementary Note 3
  • Especificación estadística y agrupación de errores: Artículo, pp. 11–12, Regression model; suplemento, Tables S6–S19
  • Coeficientes de GPT-3.5 e intersecciones: Artículo, pp. 2–3, Figure 1; suplemento, pp. 22–23, Tables S5–S6
  • Resultados de GPT-4o, Gemini, Claude y Llama: Artículo, pp. 6–8, Figure 5; suplemento, pp. 31–32, Tables S12–S13
  • Robustez, calidad y submuestras repetidas: Artículo, pp. 3–6, Figures 2–3; suplemento, Tables S7–S17 y Figures S3–S7
  • Conversión a probabilidades hipotéticas de contratación: Artículo, pp. 6–7, Figure 4; suplemento, pp. 42–46, Table S18
  • Extensión a identidades asiáticas e hispanas: Artículo, p. 7, Assessing more ethnicity groups; suplemento, pp. 47–49 y 65–67, Table S19 y Figure S9
  • Límites declarados y conjetura sobre postentrenamiento: Artículo, pp. 9–10, Discussion and limitations
  • Disponibilidad y auditoría de reproducibilidad: OSF 4dahv, ReadMe.txt, Code.do y cinco archivos Stata; proyecto creado 7 March 2025 y modificado 8 March 2025