Theory-Grounded Measurement of U.S. Social Stereotypes in English Language Models

Aplicaciones, sesgos y seguridad2022ACL AnthologyRevisión editorial aprobada

Autores: Yang Trista Cao, Anna Sotnikova, Hal Daumé III, Rachel Rudinger, Linda Zou

Palabras clave: Natural Language Processing, Social Stereotypes, Language Models, Intersectional Identities, ABC Stereotype Model

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
20
Hallazgos
25
Limitaciones
10
Evidencias

Resumen editorial

Español

Cao y coautores intentan que la medición de estereotipos en modelos de lenguaje deje de depender de listas oportunistas de profesiones o adjetivos. Adoptan de la psicología social el modelo Agency-Beliefs-Communion (ABC), que organiza la percepción de grupos en 16 pares bipolares y tres dimensiones: agencia o éxito socioeconómico, creencias conservadoras-progresistas y comunión o calidez. Los pares incluyen powerless–powerful, poor–wealthy, traditional–modern, religious–science-oriented, cold–warm y threatening–benevolent. El marco gana cobertura y comparabilidad entre grupos, pero pierde especificidad: detecta una asociación abstracta con threatening o dominant, no tropos concretos como angry Black woman.

El artículo compara tres familias de medida sobre BERT-large-cased y RoBERTa-large. ILPS observa cuánto eleva un grupo la probabilidad de un adjetivo en una plantilla enmascarada y la normaliza con un grupo enmascarado; ILPS* extiende el cálculo a palabras divididas en varios subwords. CEAT mide distancias de embeddings contextualizados usando hasta 1.000 frases de Reddit por palabra. La contribución nueva, Sensitivity Test (SeT), pregunta cuánto habría que perturbar la última matriz lineal del modelo para que un rasgo pase a ser la predicción con mayor logit por un margen de uno, y normaliza esa distancia respecto de una plantilla sin grupo. SeT no mide probabilidad observada ni frecuencia de entrenamiento; mide una robustez local de la capa de salida bajo una intervención matemática específica.

La referencia humana procede de una encuesta aprobada por IRB. Se pagaron $2 a 247 participantes de Prolific por unos diez minutos, $12/h, ligeramente por debajo del salario mínimo de Maryland citado, $12,20, y 133 superaron tres controles: recordar el grupo, recordar rasgos marcados alto y bajo, y alcanzar al menos 80% de consistencia al repetir el quinto grupo. Cada participante calificó cuatro grupos únicos y una repetición; el análisis busca 20 evaluaciones válidas para cada uno de 25 grupos y 16 escalas. La pregunta pide cómo cree la persona que la sociedad estadounidense ve al grupo, no su opinión personal, en un slider 0–100. La muestra cubre 26 estados, pero 63,3% reside en California, Nueva York, Texas o Florida y más de 96% tiene 40 años o menos.

Las plantillas no se fijan antes de evaluar. Para cada combinación de modelo y medida, los autores prueban variaciones como That [group] is [trait], All [group] are [trait] o [group] should be [trait], y eligen hasta dos que maximizan Kendall τ en un piloto de cuatro grupos, Asian, Black, Hispanic e immigrant, con cinco anotaciones por grupo. Sobre los 25 grupos, RoBERTa supera en general a BERT. RoBERTa-SeT obtiene el mayor τ global, 0,199, y P@3 de 0,653; RoBERTa-ILPS* queda en 0,175 y también 0,653, mientras RoBERTa-ILPS alcanza 0,169 y 0,620. Son asociaciones moderadas, no una equivalencia entre modelo y población. Además, el resultado global reutiliza los grupos del piloto. En el control del apéndice que excluye esos cuatro grupos, SeT da τ=0,174 e ILPS* τ=0,173: la ventaja de la nueva medida se reduce a 0,001. P@3 binariza cada promedio humano en 50 y cuenta coincidencias entre los tres rasgos superiores e inferiores; que coincidan aproximadamente dos de tres no informa por sí solo de intensidad, incertidumbre o acuerdo entre personas.

Para identidades compuestas, el trabajo aplica RoBERTa-SeT a pares lógicamente admisibles de los grupos individuales y conserva ambos órdenes cuando la gramática lo permite. La correlación media del par con su componente más parecido es 0,56; con el primer y segundo componente es 0,43 y 0,46, y entre órdenes invertidos 0,69. El orden parece importar menos que la presencia de un componente dominante, aunque no se presenta un test de equivalencia ni intervalos. Una regla con diferencia de correlación de al menos 0,1 clasifica edad y política como dominios dominantes, y raza y nacionalidad como dominados. Para buscar rasgos emergentes, los autores restan al score del par el máximo de sus dos componentes. Encuentran asociaciones como Hispanic unemployed–egotistic, Democrat teenager–altruistic y male doctor–benevolent, pero admiten que muchos casos solo elevan a la media un componente con score muy bajo. Frente a rasgos de intersecciones raza-género de Ghavami y Peplau, el detector alcanza precisión 0,83 y recall 0,65; la referencia aleatoria ya obtiene 0,72 y 0,50, y no se ofrecen intervalos ni prueba de diferencia.

El artefacto público, bajo licencia MIT, conserva código, datasheet y tres JSON, pero no permite reproducir el artículo de extremo a extremo. Incluye 26 grupos agregados, el control average people explica la diferencia con los 25 analizados, 133 registros de respuestas y 134 registros demográficos cuyos identificadores se desligaron deliberadamente. De los 133 registros de respuesta, 123 contienen cuatro grupos y diez solo tres; una anotación de Jewish people tiene un único rasgo en vez de 16. Los promedios agregados coinciden con los microdatos salvo redondeo y dos celdas de women: poor–wealthy es 57,1 en los datos liberados frente a 56,4 en el agregado, y untrustworthy–trustworthy 57,1 frente a 57,95. No hay datos crudos de la repetición, código de limpieza ni forma de reconciliar esas diferencias.

Las divergencias del código son más importantes. La ecuación del PDF define SeT mediante el logaritmo de una razón de distancias, pero quick_set.py calcula log(1-‖W-W'‖) para grupo y prior y luego los resta; para rasgos con varios subwords conserva el mínimo, mientras el texto dice tomar el máximo. El artículo afirma que, tras un preliminar con sinónimos, volvió a los 32 adjetivos ABC; test_templates.py usa de dos a cuatro sinónimos por polo y toma la mediana, con errores como athiestic y avante-garde. El script está fijado a RoBERTa y solo llama a SeT, no guarda las tablas prometidas por el README y presupone un directorio results ausente. Tampoco se publican dependencias fijadas, outputs, selección de plantillas, correlaciones, P@3 ni código interseccional. La sintaxis compila, pero los números del trabajo no pueden regenerarse con los doce archivos depositados.

La contribución defendible es conceptual: un marco psicológico común permite comparar muchos grupos y muestra que las asociaciones de BERT/RoBERTa se alinean solo de forma moderada y muy dependiente de plantilla con un promedio humano estadounidense. SeT es una hipótesis interesante de robustez local, no una medida ya validada como superior: en grupos no usados para seleccionar plantillas empata prácticamente con ILPS*. El estudio tampoco demuestra que el modelo comprenda identidades ni que sus scores produzcan discriminación en un sistema desplegado. Para usarlo como benchmark de referencia habría que fijar la implementación exacta, publicar outputs y análisis, separar selección y test, informar incertidumbre y renovar tanto modelos como muestra cultural.

English

Cao and coauthors try to move language-model stereotype measurement away from opportunistic lists of occupations or adjectives. They adopt the Agency-Beliefs-Communion (ABC) model from social psychology, organizing group perception into 16 bipolar trait pairs and three dimensions: agency or socioeconomic success, conservative-progressive beliefs, and communion or warmth. Pairs include powerless–powerful, poor–wealthy, traditional–modern, religious–science-oriented, cold–warm, and threatening–benevolent. The framework gains coverage and comparability across groups at the cost of specificity: it can identify an abstract association with threatening or dominant, not a concrete trope such as the angry Black woman stereotype.

The paper compares three measurement families on BERT-large-cased and RoBERTa-large. ILPS asks how much a group raises the probability of an adjective in a masked template and normalizes against a masked group; ILPS* extends the calculation to words split into multiple subwords. CEAT measures contextualized embedding distances with up to 1,000 Reddit sentences per word. The new Sensitivity Test (SeT) asks how much the model's final linear matrix must be perturbed to make a trait the highest-logit prediction by a margin of one, normalized against a group-free template. SeT is neither an observed probability nor an estimate of training frequency. It is a local output-layer robustness measure under a specific mathematical intervention.

The human reference comes from an IRB-approved survey. All 247 Prolific participants were paid $2 for roughly ten minutes, $12 per hour, slightly below the cited Maryland minimum wage of $12.20, and 133 passed three checks: recalling the group, recalling a high- and low-rated trait, and achieving at least 80% consistency on a repeated fifth group. Each participant rated four unique groups and one repeat; the analysis targets 20 valid annotations for each of 25 groups and 16 scales. The question asks how the participant thinks US society views a group, not for their personal opinion, using a 0–100 slider. Participants cover 26 states, but 63.3% live in California, New York, Texas, or Florida, and more than 96% are at most 40 years old.

Templates are not fixed before evaluation. For each model-measure combination, the authors test variants such as That [group] is [trait], All [group] are [trait], and [group] should be [trait], then select up to two that maximize Kendall's τ in a pilot using four groups, Asian, Black, Hispanic, and immigrant, with five annotations per group. Across all 25 groups, RoBERTa generally outperforms BERT. RoBERTa-SeT has the largest overall τ, 0.199, and P@3 of 0.653; RoBERTa-ILPS* reaches 0.175 and the same 0.653, while RoBERTa-ILPS reaches 0.169 and 0.620. These are moderate associations, not equivalence between model and population. The overall result also reuses the pilot groups. In the appendix check that excludes them, SeT obtains τ=0.174 and ILPS* τ=0.173, reducing the new measure's advantage to 0.001. P@3 dichotomizes each human mean at 50 and counts overlap among the three highest and lowest traits; agreement on roughly two of three does not itself express intensity, uncertainty, or interpersonal agreement.

For compound identities, the study applies RoBERTa-SeT to logically admissible pairs of individual groups and retains both orders where grammar permits. Mean correlation between a pair and its most similar component is 0.56; correlations with the first and second components are 0.43 and 0.46, and between reversed orders 0.69. Order appears less consequential than the presence of a dominant component, but no equivalence test or intervals are reported. A rule requiring at least a 0.1 correlation difference labels age and politics as dominant domains and race and nationality as dominated. To identify emergent traits, the authors subtract the maximum component score from the pair score. Examples include Hispanic unemployed–egotistic, Democrat teenager–altruistic, and male doctor–benevolent, but the paper acknowledges that many cases merely lift a component with a very low score toward the average. Against Ghavami and Peplau's race-gender intersection traits, detection reaches precision 0.83 and recall 0.65; a random baseline already reaches 0.72 and 0.50, and no confidence interval or difference test is supplied.

The public MIT-licensed artifact preserves code, a datasheet, and three JSON files, but it does not reproduce the paper end to end. It includes 26 aggregate groups, the average people control explains the difference from the 25 analyzed groups, 133 response records, and 134 demographic records whose identifiers were deliberately delinked. Of the 133 response records, 123 contain four groups and ten contain only three; one Jewish people annotation contains one trait rather than 16. Aggregate means match released microdata apart from rounding and two women cells: poor–wealthy is 57.1 in the released responses versus 56.4 in the aggregate, while untrustworthy–trustworthy is 57.1 versus 57.95. The repeated raw ratings and preprocessing code are absent, so those differences cannot be reconciled.

Code-paper divergences are more consequential. The PDF equation defines SeT through the logarithm of a distance ratio, but quick_set.py computes log(1-‖W-W'‖) for group and prior and subtracts the two; for multi-subword traits it retains the minimum, while the text says it takes the maximum. The paper says that after a synonym experiment it reverted to the 32 ABC adjectives; test_templates.py uses two to four synonyms per pole and takes their median, including misspellings such as athiestic and avante-garde. The script is fixed to RoBERTa and calls only SeT, does not save the tables promised by the README, and assumes a missing results directory. There is no pinned environment, released output, template-selection analysis, correlation or P@3 code, or intersectional code. The Python syntax compiles, but the reported numbers cannot be regenerated from the twelve deposited files.

The defensible contribution is conceptual: a shared psychological framework enables broad group comparisons and shows that BERT/RoBERTa associations align only moderately, and very template-dependently, with an aggregate US human reference. SeT is an interesting local-robustness hypothesis, not an already validated superior measure: on groups withheld from template selection it is effectively tied with ILPS*. The study also does not show that models understand identities or that their scores cause discrimination in deployment. A reference-quality benchmark would need a fixed implementation, published outputs and analysis, clean selection/test separation, uncertainty estimates, and renewed models and cultural samples.

Pregunta de investigación

¿Hasta qué punto las asociaciones grupo-rasgo de BERT y RoBERTa, medidas con CEAT, ILPS, ILPS* o la nueva SeT y organizadas mediante el modelo ABC, coinciden con juicios agregados de participantes estadounidenses; y qué patrones aparecen al combinar identidades?

Método

Comparación de medidas intrínsecas y encuesta humana. Se puntúan 32 polos de 16 pares ABC para más de 50 grupos individuales mediante BERT-large-cased y RoBERTa-large. CEAT usa embeddings contextuales; ILPS probabilidades enmascaradas; ILPS* corrige subwords; SeT calcula una perturbación mínima de la capa de salida. Las plantillas se eligen en cuatro grupos piloto y se comparan con promedios humanos de 25 grupos mediante Kendall τ y P@3. RoBERTa-SeT se aplica después a pares de identidades para estudiar orden, dominancia de dominios y rasgos emergentes. La auditoría editorial leyó y renderizó las 20 páginas, verificó ACL, congeló el commit público, inspeccionó código y datasheet, compiló los scripts y reconcilió los JSON agregados con los microdatos liberados.

Muestra: 247 participantes estadounidenses de Prolific completaron la encuesta y cobraron; 133 pasaron los controles y alimentan el análisis. Cada uno puntuó cuatro grupos únicos y repitió un quinto, 16 pares por grupo; se buscaron 20 anotaciones válidas por cada uno de 25 grupos de cinco dominios. La muestra procede de 26 estados, 63,3% de cuatro estados, más de 96% tiene 40 años o menos y el artículo informa 48,2% hombres, 49,6% mujeres y 2,2% genderqueer, agender o questioning. El JSON demográfico liberado contiene 134, no 133, registros.

Hallazgos

  • RoBERTa presenta en general mayor alineación con los promedios humanos que BERT, pero el resultado depende de medida y plantilla.
  • En los 25 grupos, RoBERTa-SeT obtiene el mayor Kendall τ, 0,199, frente a 0,175 de ILPS*, 0,169 de ILPS y 0,019 de CEAT.
  • RoBERTa-SeT e ILPS* empatan en P@3=0,653; ILPS alcanza 0,620 y CEAT 0,500.
  • BERT-SeT obtiene τ=0,116 y P@3=0,613; el cambio de arquitectura altera tanto la alineación como las plantillas preferidas.
  • Las correlaciones significativas globales siguen siendo moderadas y varían mucho por grupo; algunas son negativas.
  • Al excluir Asian, Black, Hispanic e immigrant, usados para seleccionar plantillas, SeT e ILPS* sobre RoBERTa quedan casi iguales: τ=0,174 y 0,173.
  • RoBERTa suele preferir plantillas como That [group] is [trait], mientras BERT obtiene mejores resultados con All [group] are [trait] o [group] should be [trait].
  • CEAT no produce scores para algunos grupos ausentes del corpus Reddit 2014, entre ellos Hispanic, non-binary y autistic en las tablas por grupo.
  • La correlación media de una identidad compuesta con el componente al que más se parece es 0,56.
  • Las correlaciones medias con primer y segundo componente son 0,43 y 0,46; entre órdenes invertidos, 0,69.
  • Con un umbral descriptivo de diferencia 0,1, edad y política dominan otros dominios, mientras raza y nacionalidad suelen quedar dominados.
  • El detector de rasgos emergentes raza-género obtiene precisión 0,83 y recall 0,65 frente a 0,72 y 0,50 de una referencia aleatoria.
  • La propia inspección de ejemplos emergentes muestra validez facial mixta y efectos de elevar componentes con scores inicialmente muy bajos.
  • Solo 133 de 247 participantes superan los tres controles de calidad; 114 se excluyen aunque se les paga.
  • Los promedios humanos ocultan desacuerdo, intensidad y prototipos diferentes: 50 puede significar consenso neutral o una mezcla polarizada de 0 y 100.
  • El artefacto incluye datos y licencia MIT, pero no outputs ni scripts para las correlaciones, P@3, selección de plantillas o análisis interseccional.
  • Dos celdas agregadas de women no son la media de los microdatos publicados: poor–wealthy 56,4 frente a 57,1 y untrustworthy–trustworthy 57,95 frente a 57,1.
  • Diez de 133 registros completos contienen solo tres grupos y una anotación Jewish people contiene un rasgo; el procesamiento que produjo el agregado no está publicado.
  • El código SeT publicado usa log(1-distancia) y mínimo entre subwords, en lugar de implementar literalmente la razón de distancias y máximo descritos en el PDF.
  • El script principal usa sinónimos y mediana pese a que el método final declara volver a los 32 adjetivos canónicos.

Limitaciones

  • Solo se evalúan dos masked language models anteriores a 2020; no generadores autorregresivos, modelos instruidos ni sistemas actuales.
  • La encuesta y la interpretación están restringidas a inglés y estereotipos de Estados Unidos.
  • La muestra es joven y geográficamente concentrada, y no representa probabilísticamente a la población estadounidense.
  • La tasa de exclusión es 114 de 247, por lo que quienes superan pruebas de memoria y consistencia pueden ser un subconjunto selectivo.
  • Pedir qué piensa la sociedad reduce opinión directa pero introduce atribución de consenso, sensación de no estar cualificado y posible refuerzo de estereotipos.
  • Promediar juicios confunde neutralidad consensuada con polarización y borra la distribución entre participantes.
  • El efecto de defaulting puede hacer que man signifique implícitamente cis, heterosexual y White tanto para humanos como para corpus.
  • Los rasgos ABC ofrecen cobertura abstracta, pero no capturan estereotipos concretos, contexto, pragmática ni lenguaje natural de despliegue.
  • Las plantillas son artificiales y algunas, como All [group] are o should be, expresan generalizaciones más fuertes que consultas ordinarias.
  • La selección de plantillas usa respuestas humanas y cuatro grupos que reaparecen en la evaluación global, generando optimismo por ajuste al piloto.
  • La ventaja test-only de SeT sobre ILPS* es 0,001 y no se prueba estadísticamente como diferencia entre correlaciones dependientes.
  • P@3 binariza en 50 y no aporta intervalos, significación, calibración ni baseline ajustada a la prevalencia de polos.
  • CEAT depende de que el nombre del grupo aparezca en Reddit 2014 y falta para varios grupos, por lo que las comparaciones no tienen cobertura idéntica.
  • Para subwords, SeT solo calcula una cota basada en piezas individuales; la composición semántica del término completo no queda resuelta.
  • SeT interviene solo la última capa lineal y no caracteriza la robustez de representaciones internas ni de comportamiento generativo completo.
  • La regla de dominancia usa un umbral 0,1 sin justificación inferencial y resume distribuciones de pares en una sola media.
  • La conclusión de que el orden no importa carece de test de equivalencia, intervalos y distribución por par.
  • La detección emergente por diferencia respecto al máximo puede confundir interacción genuina con regresión hacia la media o escalas inestables.
  • El baseline aleatorio de precisión 0,72 ya es alto; la mejora a 0,83 no se acompaña de incertidumbre ni prueba de significación.
  • La correspondencia manual entre rasgos externos y dimensiones ABC no se publica como tabla reproducible ni se analiza su sensibilidad.
  • El JSON demográfico tiene 134 registros y el de respuestas 133; sus identificadores están deliberadamente desvinculados, impidiendo reproducir tablas por subgrupo.
  • Los microdatos contienen registros incompletos y dos discrepancias no triviales con el agregado; no hay raw data ni código de preprocesamiento.
  • No hay requirements, lockfile, versiones exactas de Transformers/PyTorch, tests, CI, outputs ni comando reproducible.
  • El código público y el PDF divergen en la transformación de distancia de SeT, agregación de subwords y uso de sinónimos.
  • El estudio mide asociaciones intrínsecas; no verifica su transferencia a clasificación, completado, recomendación o decisiones sobre personas.

Qué no demuestra

  • No demuestra que BERT o RoBERTa tengan creencias, intenciones o una psicología humana.
  • No valida SeT como medida inequívocamente superior a ILPS*; fuera del piloto sus correlaciones son prácticamente idénticas.
  • No prueba que las asociaciones intrínsecas causen discriminación o daño en un sistema desplegado.
  • No establece que el promedio de 133 participantes sea la verdad de los estereotipos estadounidenses.
  • No demuestra que cada asociación emergente sea un estereotipo interseccional socialmente documentado.
  • No muestra que edad o política dominen identidades en personas; solo describe scores de RoBERTa-SeT bajo su regla.
  • No generaliza a otros idiomas, países, periodos, modelos o formulaciones naturales.
  • No permite regenerar las tablas y conclusiones con el repositorio público sin reconstruir código, versiones, outputs y decisiones ausentes.
  • No autoriza usar los datos para perfiles, clasificadores o decisiones reales sobre miembros de los grupos estudiados.

Trazabilidad

Alcance: Texto completo

Versión: NAACL 2022 main paper 92, pages 1276–1295; DOI 10.18653/v1/2022.naacl-main.92

Fuente consultada: https://aclanthology.org/2022.naacl-main.92.pdf

Revisión: Codex full-text, visual, code and released-data consistency audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • bert-large-cased masked language model
  • roberta-large masked language model

Instrumentos y métricas

  • Agency-Beliefs-Communion model with 16 bipolar trait pairs and 32 canonical adjectives
  • Sensitivity Test (SeT) with margin gamma=1 and column-squishing update
  • Increased Log Probability Score (ILPS)
  • Multi-subword modified ILPS (ILPS*)
  • Contextualized Embedding Association Test (CEAT)
  • Template bank spanning number, interrogative, adverbial, belief, expectation, word order and comparison variants
  • Kendall rank correlation
  • Precision at 3 for positive and negative trait poles
  • Prolific/Qualtrics 0–100 group-trait survey with three quality checks

Datos utilizados

  • Crowdsourced U.S. Stereotypes Measured across Agency, Beliefs, and Communion
  • Aggregated_scores.json with 26 groups by 16 trait pairs
  • data_full.json with 133 retained response records
  • Annotators_demographics.json with 134 delinked demographic records
  • Reddit 2014 contextual sentences used by the adopted CEAT method
  • Ghavami and Peplau 2013 intersectional stereotype traits for external comparison
  • GitHub TristaCao/U.S_Stereotypes at commit 5b1f382d838c6aff4c392dc60bd23c1a67e54949

Evidencia y localización

  • Marco ABC, cobertura, ventajas y trade-off con especificidad: NAACL paper pp. 1–3, Introduction, Background and Tables 1–3
  • Definición de ILPS, CEAT, SeT, subwords y plantillas: NAACL paper pp. 3–5, Section 3, equations and Table 4
  • Encuesta, pago, controles, participantes y demografía: NAACL paper pp. 5–6, Section 4; Appendix D–E and Tables A14–A18
  • Selección de plantillas y alineación global/test-only: NAACL paper pp. 6–7, Section 5.1, Tables 5–6; Appendix Tables A11–A13 and A19
  • Orden, dominancia y rasgos emergentes en pares: NAACL paper pp. 7–9, Section 5.2; Appendix Tables A8–A10
  • Limitaciones, riesgo de refuerzo y alcance no desplegado: NAACL paper pp. 9–10, Sections 6–7
  • Metadatos, autoría, DOI y paginación: ACL Anthology record 2022.naacl-main.92, checked 15 Jul 2026
  • Composición, licencia y restricciones del dataset: GitHub TristaCao/U.S_Stereotypes commit 5b1f382, LICENSE and dataset/Datasheet.md
  • Registros incompletos y discrepancias agregado-microdatos: Editorial reconciliation of Aggregated_scores.json, data_full.json and Annotators_demographics.json, 15 Jul 2026
  • Divergencias entre ecuación y código, sinónimos y falta de análisis reproducible: Repository quick_set.py, test_templates.py, code/readme.md and complete file inventory, audited 15 Jul 2026