Large Language Models Portray Socially Subordinate Groups as More Homogeneous, Consistent with a Bias Observed in Humans

Aplicaciones, sesgos y seguridad2024ACMRevisión editorial aprobada

Autores: Messi H.J. Lee, Jacob M. Montgomery, Calvin K. Lai

Palabras clave: Large Language Models, Social bias, Homogeneity perception, Racial minorities, Fairness, Accountability

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
25
Hallazgos
42
Limitaciones
11
Evidencias

Resumen editorial

Español

El artículo introduce la homogeneidad representacional como una dimensión de sesgo distinta de asociar grupos con atributos estereotípicos: pregunta si ChatGPT produce un repertorio semántico menos variado para grupos estadounidenses socialmente subordinados. El estudio principal, prerregistrado en OSF antes de recoger datos, cruza cuatro etiquetas raciales o étnicas, African, Asian, Hispanic y White American, dos géneros, man y woman, y 13 formatos breves. El 25 de julio de 2023 se solicitaron 500 completaciones de aproximadamente 30 palabras para cada una de las 104 combinaciones, 52.000 textos en total, mediante el alias `gpt-3.5-turbo`, rol de sistema `chatbot` y parámetros predeterminados salvo cuatro lotes de 128, 128, 128 y 116 respuestas. Cincuenta negativas detectadas mediante seis expresiones se sustituyeron; el dataset final conserva exactamente 500 textos por celda, sin vacíos. Su longitud media es 26,61 palabras (DE 2,70; intervalo 9–68) y solo 3.645 textos tienen exactamente 30 palabras. La medida principal codifica cada texto con la penúltima capa de BERT-base-uncased y calcula las 124.750 similitudes coseno posibles entre los 500 textos de cada celda. Después estandariza globalmente 12.974.000 valores y ajusta modelos lineales mixtos con raza, género, su interacción y un intercepto aleatorio para formato. Se añaden, sin prerregistro, BERT en la antepenúltima capa, dos capas de RoBERTa y tres Sentence-BERT. En BERT−2, frente a White Americans, los coeficientes raciales estandarizados son 0,33 para African Americans, 0,31 para Asian Americans y 0,18 para Hispanic Americans; el coeficiente agregado de women frente a men es 0,037. La interacción BERT−2 estima diferencias mujer-hombre de 0,0099, 0,013 y 0,12 en los tres grupos minoritarios, mientras que 0,00021 en White Americans no difiere de cero según el análisis publicado. La dirección subordinado-versus-White se mantiene en las siete representaciones y al eliminar del texto palabras de raza y género. La conclusión de género es más frágil: African e Hispanic Americans mantienen una diferencia positiva en las siete representaciones, pero el signo cambia según el encoder para Asian y White Americans. Un STM exploratorio encuentra que los temas de adversidad dominan el 41,86% de textos African, 26,15% Asian, 18,65% Hispanic y 3,57% White. Dos seguimientos no prerregistrados, 10.400 textos con una prohibición explícita de mencionar discriminación, hardship o adversity, y 800 historias de una persona cocinando para un ser querido, además de comparaciones dentro de dos temas de adversidad, conservan la dirección racial. Esto apoya que la alineación temática observada no es la única fuente de la señal, pero no identifica su causa. La principal reserva afecta a toda la inferencia: las 12.974.000 filas no son réplicas independientes. Cada uno de los 52.000 textos participa en 499 pares, y los pares que comparten un texto están correlacionados; el modelo solo incluye un intercepto por formato y no representa textos, díadas o generaciones. Por tanto, errores estándar inferiores a 0,001, grados de libertad cercanos a 12,97 millones, valores z de cientos y los tests de seguimiento son anticonservadores. Además, la Tabla 2 declara N=124.750 por grupo interseccional, aunque el código agrega 13 formatos, es decir, 1.621.750 pares por grupo, mientras la Tabla 3 usa 12.974.000. El repositorio permite auditar los textos, prompts y fórmulas y tiene licencia MIT, pero no es ejecutable de extremo a extremo tal como está publicado: faltan archivos `.RData` y Feather cargados por los scripts, entornos bloqueados, snapshots de encoders, pruebas y CI; varias rutas no coinciden con la estructura y el último commit eliminó las instrucciones todavía enlazadas en el README. La contribución defendible es un patrón descriptivo de menor diversidad semántica para tres etiquetas raciales minoritarias en una recogida concreta de ChatGPT, robusto a varios encoders y prompts. No demuestra una propiedad general de los LLM, una causa en los datos de entrenamiento, equivalencia con percepción humana ni la precisión inferencial publicada.

English

The paper introduces representational homogeneity as a bias dimension distinct from associating groups with stereotypical attributes: it asks whether ChatGPT produces a narrower semantic repertoire for socially subordinate U.S. groups. The main study was registered on OSF before data collection and crosses four racial or ethnic labels, African, Asian, Hispanic, and White American, two genders, man and woman, and 13 short text formats. On 25 July 2023, the authors requested 500 approximately 30-word completions for each of the 104 combinations, 52,000 texts in total, using the `gpt-3.5-turbo` alias, a `chatbot` system role, and default parameters except for batches of 128, 128, 128, and 116 responses. Fifty refusals detected with six expressions were replaced; the final released dataset has exactly 500 texts per cell and no blanks. Mean length is 26.61 words (SD 2.70, range 9–68), and only 3,645 texts contain exactly 30 whitespace-separated words. The primary measure encodes each text with the penultimate layer of BERT-base-uncased and calculates all 124,750 pairwise cosine similarities among the 500 texts in each cell. It then standardizes 12,974,000 values globally and fits linear mixed models with race, gender, their interaction, and a random intercept for text format. Unregistered robustness analyses add the third-to-last BERT layer, two RoBERTa layers, and three Sentence-BERT encoders. Under BERT−2, standardized race coefficients relative to White Americans are 0.33 for African Americans, 0.31 for Asian Americans, and 0.18 for Hispanic Americans; the aggregate women-versus-men coefficient is 0.037. The BERT−2 interaction estimates women-minus-men differences of 0.0099, 0.013, and 0.12 in the three minority groups, while 0.00021 for White Americans is not different from zero under the published analysis. The subordinate-versus-White direction holds across all seven encoders and after removing race and gender words. The gender conclusion is less stable: African and Hispanic Americans retain a positive difference under all seven representations, whereas signs change by encoder for Asian and White Americans. An exploratory structural topic model finds that adversity topics dominate 41.86% of African, 26.15% of Asian, 18.65% of Hispanic, and 3.57% of White texts. Two unregistered follow-ups, 10,400 texts explicitly instructed not to mention discrimination, hardship, or adversity, and 800 stories about a chef preparing a meal for a loved one, plus within-topic comparisons for two adversity topics preserve the racial direction. This supports the claim that observed topical alignment is not the signal's only source, but it does not identify its cause. The central reservation affects all inference: the 12,974,000 rows are not independent replications. Every one of the 52,000 texts occurs in 499 pairs, so pairs sharing a text are correlated; the model includes only a format intercept and does not represent texts, dyads, or generation batches. Standard errors below 0.001, degrees of freedom near 12.97 million, z statistics in the hundreds, and follow-up tests are therefore anti-conservative. Table 2 also reports N=124,750 per intersectional group although the code combines 13 formats, 1,621,750 pairs per group, while Table 3 uses 12,974,000. The repository makes the text, prompts, and formulas auditable and is MIT-licensed, but it is not end-to-end executable as published: scripts load absent `.RData` and Feather files, no locked environments or encoder snapshots are supplied, there are no tests or CI, several paths do not match the tree, and the latest commit deleted the instructions still linked by the README. The defensible contribution is a descriptive pattern of reduced semantic diversity for three racial-minority labels in one dated ChatGPT collection, robust across several encoders and prompts. It does not establish a general LLM property, a training-data cause, equivalence to human perception, or the reported inferential precision.

Pregunta de investigación

¿Genera ChatGPT textos semánticamente más homogéneos sobre grupos raciales o étnicos y de género socialmente subordinados que sobre grupos dominantes, y es consistente el efecto de género entre grupos raciales o étnicos?

Método

Diseño factorial prerregistrado de 4 etiquetas raciales o étnicas × 2 géneros × 13 formatos, con 500 generaciones `gpt-3.5-turbo` por celda. Se calculan todas las similitudes coseno por pares dentro de cada celda usando BERT−2 y seis representaciones alternativas, se estandarizan globalmente y se ajustan modelos mixtos con intercepto aleatorio de formato. La auditoría editorial leyó y renderizó las 20 páginas, leyó y renderizó los dos DOCX de la prerregistración OSF, congeló el commit público, revisó código, tablas y datasets, perfiló las 52.000 filas y contrastó el grano de los datos con la unidad inferencial.

Muestra: El estudio principal contiene 52.000 textos: 104 celdas de prompt con 500 completaciones cada una. Cada celda produce 500×499/2=124.750 similitudes, para 12.974.000 pares por encoder. La unidad generativa real son 52.000 textos obtenidos en cuatro lotes por prompt; los 12,974 millones de pares no son observaciones independientes. El seguimiento 1 añade 10.400 textos, 100 por las mismas 104 celdas; el seguimiento 2 añade 800 textos, 100 por cada combinación de cuatro grupos y dos géneros.

Hallazgos

  • La fuente publicada es el paper de FAccT 2024, DOI 10.1145/3630106.3658975, de 20 páginas y con licencia CC BY 4.0.
  • La inscripción OSF kxz6b se registró públicamente el 26 de julio de 2023 y contiene el plan analítico y las 104 viñetas.
  • La auditoría del dataset confirma 52.000 filas, cuatro columnas, 104 celdas y exactamente 500 textos por celda, sin valores vacíos.
  • Los 50 rechazos del primer lote se retiran; tres sustituciones vuelven a activar el filtro y se reemplazan en una segunda ronda.
  • El dataset final contiene tres duplicados exactos adicionales y cuatro tras normalizar mayúsculas y espacios, una tasa inferior a 0,01%.
  • La media de longitud reproducida es 26,610 palabras y la desviación estándar 2,696; el intervalo observado es 9–68 palabras.
  • Solo 3.645 de 52.000 textos tienen exactamente 30 palabras; 44.792 quedan por debajo y 3.563 por encima.
  • Cada celda de 500 textos genera 124.750 pares y cada texto reaparece en 499 observaciones de similitud.
  • BERT−2 estima diferencias raciales de 0,33, 0,31 y 0,18 desviaciones estándar para African, Asian e Hispanic Americans frente a White Americans.
  • La dirección racial se mantiene en las siete representaciones de texto examinadas.
  • El efecto agregado de women frente a men es 0,037 desviaciones estándar en BERT−2 y es menor que los efectos raciales publicados.
  • En BERT−2, la diferencia mujer-hombre es positiva en African, Asian e Hispanic Americans y prácticamente nula en White Americans.
  • La dirección de género es estable entre encoders en African e Hispanic Americans, pero cambia en Asian y White Americans.
  • Al eliminar palabras que señalan raza y género, las diferencias raciales son 0,34, 0,28 y 0,18, y la diferencia agregada de género es 0,073.
  • La robustez de preprocesamiento altera la interacción: también obtiene una diferencia positiva para White American women frente a men.
  • Los temas 1 y 10, asociados a hardship y adversity, dominan 41,86%, 26,15%, 18,65% y 3,57% de los textos African, Asian, Hispanic y White.
  • La propia Tabla A2 contradice la expectativa de que los textos White tengan la distribución temática más dispersa.
  • El seguimiento sin hardship reduce las menciones de adversity o barrier entre los tres grupos minoritarios de 24,80% a 3,00% y conserva la dirección racial.
  • El seguimiento de cocina contiene 800 textos balanceados y conserva la dirección racial publicada.
  • Las comparaciones dentro de los temas 1 y 10 también mantienen mayor similitud media para los tres grupos minoritarios que para White Americans.
  • La Tabla 2 informa N=124.750 por grupo interseccional, pero el código usa 13 veces esa cantidad por grupo y la Tabla 3 informa 12.974.000 observaciones.
  • Los grados de libertad y errores estándar publicados tratan los pares solapados como residuos independientes.
  • El repositorio publica datos, prompts, código, figuras y preregistro bajo licencia MIT, lo que permite una auditoría estática sustantiva.
  • El commit congelado no incluye los `.RData` ni los archivos Feather que cargan varias fases del análisis.
  • El README enlaza Instructions.md, pero el commit vigente lo eliminó; el archivo sigue accesible únicamente en el historial de Git.

Limitaciones

  • Se estudia una sola recogida del alias `gpt-3.5-turbo` en una única fecha.
  • No se conserva el identificador exacto del snapshot devuelto por la API.
  • El alias del modelo, parámetros predeterminados y servicio pueden cambiar con el tiempo.
  • No se publican IDs de petición, timestamps por lote, errores, reintentos ni orden de respuestas.
  • Los 52.000 textos no son 52.000 ejecuciones independientes: cada solicitud devuelve hasta 128 opciones bajo un mismo contexto de API.
  • La medida cuantifica similitud de embeddings, no percepción humana de homogeneidad.
  • No se valida que las diferencias de coseno correspondan a daños, estereotipos o una gama más estrecha de experiencia humana percibida por personas.
  • La elección de un encoder puede incorporar geometría y sesgos propios ajenos a ChatGPT.
  • Aunque siete representaciones refuerzan la dirección racial, sus checkpoints y revisiones exactas no están fijados.
  • Las 12.974.000 similitudes comparten nodos: cada texto aparece en 499 pares.
  • El modelo no añade efectos aleatorios por texto, díada, lote o prompt individual.
  • Un intercepto por 13 formatos no corrige la dependencia entre pares que comparten texto.
  • Los errores estándar inferiores a 0,001 y los valores p son anticonservadores bajo esa pseudo-replicación.
  • La misma dependencia invalida la interpretación convencional de los t-tests y modelos de los seguimientos.
  • La Tabla 2 presenta un N por grupo incompatible con el total construido por el código.
  • La estandarización global hace que los coeficientes dependan de la mezcla completa de grupos y formatos.
  • Solo se usan etiquetas explícitas y binarias en inglés estadounidense.
  • No se estudian personas no binarias, Native American, Middle Eastern American u otros grupos menores.
  • No se prueban nombres, nacionalidades específicas, etiquetas alternativas ni identidades implícitas.
  • Los términos White American y man son marcados artificialmente aunque suelen ser no marcados en discurso.
  • Los textos breves de aproximadamente 30 palabras no representan conversaciones, documentos largos o interacción desplegada.
  • Solo 7,01% de los textos cumple exactamente la longitud solicitada de 30 palabras.
  • El filtro de rechazos usa seis coincidencias sensibles a mayúsculas y no demuestra cobertura exhaustiva de negativas o reformulaciones.
  • Los 50 reemplazos se generan después y pueden pertenecer a un estado distinto del servicio.
  • Los seis encoders alternativos y los estudios de seguimiento no estaban prerregistrados.
  • No se presenta un registro estructurado de desviaciones entre preregistro, análisis confirmatorio y exploratorio.
  • El STM elige 15 temas entre cuatro candidatos y la identificación de adversity depende de la interpretación de palabras principales.
  • Buscar solo adversity y barrier es una comprobación incompleta de que los seguimientos eliminan el tema.
  • Las comparaciones dentro de temas condicionan en una clasificación estimada por el mismo corpus y no aíslan causalmente el contenido.
  • Los seguimientos modifican simultáneamente el prompt, el contenido y potencialmente el comportamiento del modelo.
  • No se interviene en datos de entrenamiento ni se observa su composición, por lo que selección y asociaciones estereotípicas son hipótesis.
  • No hay comparación con textos humanos equivalentes ni una línea base de diversidad humana.
  • No hay evaluación humana ciega de diversidad, calidad, naturalidad o daño.
  • No se realizan réplicas temporales, entre proveedores, idiomas o familias de LLM.
  • El repositorio no fija versiones de R, Python y paquetes mediante un lockfile ejecutable.
  • Los scripts principales usan `../data` mientras el directorio publicado se llama `Data`, lo que falla en sistemas sensibles a mayúsculas.
  • Los scripts de generación construyen rutas de salida anidadas que no coinciden con las instrucciones ni con el árbol publicado.
  • Varios scripts cargan incondicionalmente `.RData` ausentes después de dejar comentada la línea que los guardaría.
  • Los tres archivos Feather de Sentence-BERT no están publicados y el notebook requiere cambiar manualmente el modelo entre ejecuciones.
  • No existen pruebas automatizadas, CI, contenedor, checksums internos ni una ejecución limpia documentada.
  • El README vigente enlaza un documento de instrucciones eliminado en el último commit.
  • La afirmación del README de que todo el código y datos necesarios están disponibles no equivale a reproducción de extremo a extremo en el estado congelado.

Qué no demuestra

  • No demuestra que todos los LLM representen grupos subordinados como más homogéneos.
  • No demuestra que el comportamiento persista en versiones actuales de ChatGPT.
  • No establece que el estatus social sea la causa de las diferencias observadas.
  • No identifica causalmente el origen del patrón en los datos de entrenamiento.
  • No prueba equivalencia entre similitud de embeddings y homogeneidad percibida por humanos.
  • No demuestra que personas usuarias adopten estereotipos o discriminen a partir de esas generaciones.
  • No demuestra que la alineación temática haya sido descartada por completo.
  • No sustenta tratar 12,974 millones de pares como réplicas independientes.
  • No valida la magnitud ni los intervalos inferenciales publicados bajo dependencia diádica.
  • No generaliza a texto largo, otros prompts, idiomas, culturas, identidades o contextos desplegados.
  • No establece que mencionar explícitamente grupos dominantes sea un control neutral.
  • No ofrece todavía una reproducción ejecutable de extremo a extremo desde un entorno limpio.

Trazabilidad

Alcance: Texto completo

Versión: FAccT 2024 paper 90; proceedings pages 1321–1340; DOI 10.1145/3630106.3658975; CC BY 4.0

Fuente consultada: https://facctconference.org/static/papers24/facct24-90.pdf

Revisión: Codex full-text, visual, preregistration, repository, code, data-quality and statistical-grain audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI gpt-3.5-turbo alias accessed 25 July 2023; exact returned snapshot not preserved
  • BERT-base-uncased penultimate layer (preregistered primary representation; exact revision not pinned)
  • BERT-base-uncased third-to-last layer
  • RoBERTa-base penultimate layer
  • RoBERTa-base third-to-last layer
  • sentence-transformers/all-mpnet-base-v2
  • sentence-transformers/all-distilroberta-v1
  • sentence-transformers/all-MiniLM-L12-v2
  • 15-topic structural topic model

Instrumentos y métricas

  • 104 prompts crossing four racial or ethnic labels, two gender labels and 13 text formats
  • Thirty-word generation instruction
  • Pairwise cosine similarity of sentence embeddings as representational homogeneity
  • Globally standardized cosine similarity
  • Linear mixed-effects models with a random intercept for text format
  • Likelihood-ratio tests for race, gender and interaction terms
  • Estimated marginal means for within-race gender comparisons
  • Identity-term removal robustness analysis
  • Structural topic model with 15 topics
  • No-hardship follow-up prompt
  • Chef preparing a meal follow-up prompt

Datos utilizados

  • Released main dataset generated_text_final.csv, 52,000 texts
  • Four original generation batches totaling 52,000 texts
  • Fifty first-round and three second-round replacement generations
  • Suppression study 1 dataset, 10,400 texts
  • Suppression study 2 dataset, 800 texts
  • Suppression pilot dataset, 1,040 texts
  • Released Topic 1 and Topic 10 subsets
  • OSF registration kxz6b and two frozen preregistration documents
  • GitHub repository at commit a08b419ccec38136aa977b4ccf21b8901445d364

Evidencia y localización

  • Pregunta, diseño, recogida y medida principal: FAccT 2024 pp. 1321–1324, Abstract and Sections 1–2
  • Resultados raciales, de género e interacción: FAccT 2024 pp. 1324–1326, Figures 1–4 and Tables 2–3
  • Discusión, límites reconocidos y conclusión: FAccT 2024 pp. 1326–1327, Sections 4–6
  • Seguimientos de adversidad, cocina y análisis dentro de temas: FAccT 2024 pp. 1329–1331, Supplement A.2
  • Distribución temática, rechazos y preprocesamiento: FAccT 2024 pp. 1331–1332, Supplement A.3–A.5
  • Robustez de siete representaciones: FAccT 2024 pp. 1333–1340, Tables A3–A10
  • Plan confirmatorio y 104 viñetas: OSF registration kxz6b, registered 26 Jul 2023; preregistration pp. 1–3 and vignettes pp. 1–2
  • Grano de 12.974.000 pares y modelo con intercepto solo por formato: Frozen repository commit a08b419, BERT-2/bert2.R lines 79–231; compared with Table 3
  • Perfil de calidad de 52.000 textos, balance, duplicados y longitudes: Frozen generated_text_final.csv, independently profiled 15 Jul 2026
  • Reemplazo de negativas y datasets de seguimiento: Frozen repository commit a08b419, Data/merge_texts.R and Supplement.Suppression datasets and scripts
  • Huecos de ejecución, rutas, artefactos y documentación: Frozen repository commit a08b419 tree and code; Instructions.md recovered from parent commit 4f85271; audited 15 Jul 2026