El artículo introduce la homogeneidad representacional como una dimensión de sesgo distinta de asociar grupos con atributos estereotípicos: pregunta si ChatGPT produce un repertorio semántico menos variado para grupos estadounidenses socialmente subordinados. El estudio principal, prerregistrado en OSF antes de recoger datos, cruza cuatro etiquetas raciales o étnicas, African, Asian, Hispanic y White American, dos géneros, man y woman, y 13 formatos breves. El 25 de julio de 2023 se solicitaron 500 completaciones de aproximadamente 30 palabras para cada una de las 104 combinaciones, 52.000 textos en total, mediante el alias `gpt-3.5-turbo`, rol de sistema `chatbot` y parámetros predeterminados salvo cuatro lotes de 128, 128, 128 y 116 respuestas. Cincuenta negativas detectadas mediante seis expresiones se sustituyeron; el dataset final conserva exactamente 500 textos por celda, sin vacíos. Su longitud media es 26,61 palabras (DE 2,70; intervalo 9–68) y solo 3.645 textos tienen exactamente 30 palabras. La medida principal codifica cada texto con la penúltima capa de BERT-base-uncased y calcula las 124.750 similitudes coseno posibles entre los 500 textos de cada celda. Después estandariza globalmente 12.974.000 valores y ajusta modelos lineales mixtos con raza, género, su interacción y un intercepto aleatorio para formato. Se añaden, sin prerregistro, BERT en la antepenúltima capa, dos capas de RoBERTa y tres Sentence-BERT. En BERT−2, frente a White Americans, los coeficientes raciales estandarizados son 0,33 para African Americans, 0,31 para Asian Americans y 0,18 para Hispanic Americans; el coeficiente agregado de women frente a men es 0,037. La interacción BERT−2 estima diferencias mujer-hombre de 0,0099, 0,013 y 0,12 en los tres grupos minoritarios, mientras que 0,00021 en White Americans no difiere de cero según el análisis publicado. La dirección subordinado-versus-White se mantiene en las siete representaciones y al eliminar del texto palabras de raza y género. La conclusión de género es más frágil: African e Hispanic Americans mantienen una diferencia positiva en las siete representaciones, pero el signo cambia según el encoder para Asian y White Americans. Un STM exploratorio encuentra que los temas de adversidad dominan el 41,86% de textos African, 26,15% Asian, 18,65% Hispanic y 3,57% White. Dos seguimientos no prerregistrados, 10.400 textos con una prohibición explícita de mencionar discriminación, hardship o adversity, y 800 historias de una persona cocinando para un ser querido, además de comparaciones dentro de dos temas de adversidad, conservan la dirección racial. Esto apoya que la alineación temática observada no es la única fuente de la señal, pero no identifica su causa. La principal reserva afecta a toda la inferencia: las 12.974.000 filas no son réplicas independientes. Cada uno de los 52.000 textos participa en 499 pares, y los pares que comparten un texto están correlacionados; el modelo solo incluye un intercepto por formato y no representa textos, díadas o generaciones. Por tanto, errores estándar inferiores a 0,001, grados de libertad cercanos a 12,97 millones, valores z de cientos y los tests de seguimiento son anticonservadores. Además, la Tabla 2 declara N=124.750 por grupo interseccional, aunque el código agrega 13 formatos, es decir, 1.621.750 pares por grupo, mientras la Tabla 3 usa 12.974.000. El repositorio permite auditar los textos, prompts y fórmulas y tiene licencia MIT, pero no es ejecutable de extremo a extremo tal como está publicado: faltan archivos `.RData` y Feather cargados por los scripts, entornos bloqueados, snapshots de encoders, pruebas y CI; varias rutas no coinciden con la estructura y el último commit eliminó las instrucciones todavía enlazadas en el README. La contribución defendible es un patrón descriptivo de menor diversidad semántica para tres etiquetas raciales minoritarias en una recogida concreta de ChatGPT, robusto a varios encoders y prompts. No demuestra una propiedad general de los LLM, una causa en los datos de entrenamiento, equivalencia con percepción humana ni la precisión inferencial publicada.
Pregunta de investigación
¿Genera ChatGPT textos semánticamente más homogéneos sobre grupos raciales o étnicos y de género socialmente subordinados que sobre grupos dominantes, y es consistente el efecto de género entre grupos raciales o étnicos?