Cao y coautores intentan que la medición de estereotipos en modelos de lenguaje deje de depender de listas oportunistas de profesiones o adjetivos. Adoptan de la psicología social el modelo Agency-Beliefs-Communion (ABC), que organiza la percepción de grupos en 16 pares bipolares y tres dimensiones: agencia o éxito socioeconómico, creencias conservadoras-progresistas y comunión o calidez. Los pares incluyen powerless–powerful, poor–wealthy, traditional–modern, religious–science-oriented, cold–warm y threatening–benevolent. El marco gana cobertura y comparabilidad entre grupos, pero pierde especificidad: detecta una asociación abstracta con threatening o dominant, no tropos concretos como angry Black woman.
El artículo compara tres familias de medida sobre BERT-large-cased y RoBERTa-large. ILPS observa cuánto eleva un grupo la probabilidad de un adjetivo en una plantilla enmascarada y la normaliza con un grupo enmascarado; ILPS* extiende el cálculo a palabras divididas en varios subwords. CEAT mide distancias de embeddings contextualizados usando hasta 1.000 frases de Reddit por palabra. La contribución nueva, Sensitivity Test (SeT), pregunta cuánto habría que perturbar la última matriz lineal del modelo para que un rasgo pase a ser la predicción con mayor logit por un margen de uno, y normaliza esa distancia respecto de una plantilla sin grupo. SeT no mide probabilidad observada ni frecuencia de entrenamiento; mide una robustez local de la capa de salida bajo una intervención matemática específica.
La referencia humana procede de una encuesta aprobada por IRB. Se pagaron $2 a 247 participantes de Prolific por unos diez minutos, $12/h, ligeramente por debajo del salario mínimo de Maryland citado, $12,20, y 133 superaron tres controles: recordar el grupo, recordar rasgos marcados alto y bajo, y alcanzar al menos 80% de consistencia al repetir el quinto grupo. Cada participante calificó cuatro grupos únicos y una repetición; el análisis busca 20 evaluaciones válidas para cada uno de 25 grupos y 16 escalas. La pregunta pide cómo cree la persona que la sociedad estadounidense ve al grupo, no su opinión personal, en un slider 0–100. La muestra cubre 26 estados, pero 63,3% reside en California, Nueva York, Texas o Florida y más de 96% tiene 40 años o menos.
Las plantillas no se fijan antes de evaluar. Para cada combinación de modelo y medida, los autores prueban variaciones como That [group] is [trait], All [group] are [trait] o [group] should be [trait], y eligen hasta dos que maximizan Kendall τ en un piloto de cuatro grupos, Asian, Black, Hispanic e immigrant, con cinco anotaciones por grupo. Sobre los 25 grupos, RoBERTa supera en general a BERT. RoBERTa-SeT obtiene el mayor τ global, 0,199, y P@3 de 0,653; RoBERTa-ILPS* queda en 0,175 y también 0,653, mientras RoBERTa-ILPS alcanza 0,169 y 0,620. Son asociaciones moderadas, no una equivalencia entre modelo y población. Además, el resultado global reutiliza los grupos del piloto. En el control del apéndice que excluye esos cuatro grupos, SeT da τ=0,174 e ILPS* τ=0,173: la ventaja de la nueva medida se reduce a 0,001. P@3 binariza cada promedio humano en 50 y cuenta coincidencias entre los tres rasgos superiores e inferiores; que coincidan aproximadamente dos de tres no informa por sí solo de intensidad, incertidumbre o acuerdo entre personas.
Para identidades compuestas, el trabajo aplica RoBERTa-SeT a pares lógicamente admisibles de los grupos individuales y conserva ambos órdenes cuando la gramática lo permite. La correlación media del par con su componente más parecido es 0,56; con el primer y segundo componente es 0,43 y 0,46, y entre órdenes invertidos 0,69. El orden parece importar menos que la presencia de un componente dominante, aunque no se presenta un test de equivalencia ni intervalos. Una regla con diferencia de correlación de al menos 0,1 clasifica edad y política como dominios dominantes, y raza y nacionalidad como dominados. Para buscar rasgos emergentes, los autores restan al score del par el máximo de sus dos componentes. Encuentran asociaciones como Hispanic unemployed–egotistic, Democrat teenager–altruistic y male doctor–benevolent, pero admiten que muchos casos solo elevan a la media un componente con score muy bajo. Frente a rasgos de intersecciones raza-género de Ghavami y Peplau, el detector alcanza precisión 0,83 y recall 0,65; la referencia aleatoria ya obtiene 0,72 y 0,50, y no se ofrecen intervalos ni prueba de diferencia.
El artefacto público, bajo licencia MIT, conserva código, datasheet y tres JSON, pero no permite reproducir el artículo de extremo a extremo. Incluye 26 grupos agregados, el control average people explica la diferencia con los 25 analizados, 133 registros de respuestas y 134 registros demográficos cuyos identificadores se desligaron deliberadamente. De los 133 registros de respuesta, 123 contienen cuatro grupos y diez solo tres; una anotación de Jewish people tiene un único rasgo en vez de 16. Los promedios agregados coinciden con los microdatos salvo redondeo y dos celdas de women: poor–wealthy es 57,1 en los datos liberados frente a 56,4 en el agregado, y untrustworthy–trustworthy 57,1 frente a 57,95. No hay datos crudos de la repetición, código de limpieza ni forma de reconciliar esas diferencias.
Las divergencias del código son más importantes. La ecuación del PDF define SeT mediante el logaritmo de una razón de distancias, pero quick_set.py calcula log(1-‖W-W'‖) para grupo y prior y luego los resta; para rasgos con varios subwords conserva el mínimo, mientras el texto dice tomar el máximo. El artículo afirma que, tras un preliminar con sinónimos, volvió a los 32 adjetivos ABC; test_templates.py usa de dos a cuatro sinónimos por polo y toma la mediana, con errores como athiestic y avante-garde. El script está fijado a RoBERTa y solo llama a SeT, no guarda las tablas prometidas por el README y presupone un directorio results ausente. Tampoco se publican dependencias fijadas, outputs, selección de plantillas, correlaciones, P@3 ni código interseccional. La sintaxis compila, pero los números del trabajo no pueden regenerarse con los doce archivos depositados.
La contribución defendible es conceptual: un marco psicológico común permite comparar muchos grupos y muestra que las asociaciones de BERT/RoBERTa se alinean solo de forma moderada y muy dependiente de plantilla con un promedio humano estadounidense. SeT es una hipótesis interesante de robustez local, no una medida ya validada como superior: en grupos no usados para seleccionar plantillas empata prácticamente con ILPS*. El estudio tampoco demuestra que el modelo comprenda identidades ni que sus scores produzcan discriminación en un sistema desplegado. Para usarlo como benchmark de referencia habría que fijar la implementación exacta, publicar outputs y análisis, separar selección y test, informar incertidumbre y renovar tanto modelos como muestra cultural.