Marked Personas: Using Natural Language Prompts to Measure Stereotypes in Language Models

Aplicaciones, sesgos y seguridad2023ACL AnthologyRevisión editorial aprobada

Autores: Myra Cheng, Esin Durmus, Dan Jurafsky

Palabras clave: Large Language Models, Stereotypes, Demographic Groups, Intersectionality, NLP, Sociolinguistics, Markedness, Bias Detection

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
19
Hallazgos
24
Limitaciones
9
Evidencias

Resumen editorial

Español

Cheng, Durmus y Jurafsky proponen Marked Personas para estudiar estereotipos en texto abierto sin partir de una lista cerrada de atributos. El procedimiento genera descripciones en primera o tercera persona de grupos demográficos y compara cada grupo marcado con referencias definidas de antemano como no marcadas: White para raza/etnicidad y man para género en el contexto estadounidense e inglés analizado. Marked Words aplica log-odds ponderado con prior informativo, siguiendo Fightin' Words, y conserva términos con z > 1,96; para una identidad interseccional, el término debe distinguirla tanto del referente racial como del de género. Es una medida de diferencias léxicas dentro del corpus generado, no un detector universal ni exhaustivo de estereotipos.

El experimento principal cruza cinco categorías raciales o étnicas, Asian, Black, Latine, Middle-Eastern y White, con man, woman y nonbinary, usa seis prompts y obtiene 15 respuestas por combinación. Son 1.350 personas de GPT-4 y 1.350 de text-davinci-003, 2.700 en total. Como controles, los autores calculan divergencia Jensen-Shannon y entrenan SVM one-vs-all sobre bolsas de palabras anonimizadas; las SVM separan los grupos con exactitud 0,96 ± 0,02 en GPT-4 y 0,92 ± 0,04 en GPT-3.5. Para comparar con escritura humana reutilizan 1.230 respuestas de 615 participantes de Prolific, Black o White, recogidas por Kambhatla et al.: cada persona se describió a sí misma y también desde una identidad racial imaginada. Con los léxicos de Ghavami y Peplau, las salidas generadas contienen una proporción mayor de atributos raciales estereotípicos que las respuestas humanas. El resultado de GPT-3.5 es además anómalo: sus personas White contienen más palabras del léxico de estereotipos Black que sus personas Black, una señal de que una lista fija no describe bien qué narrativa está produciendo el modelo.

La aportación central es cualitativa y contextual. Los términos significativos para grupos marcados no son principalmente insultos: GPT-4 y GPT-3.5 producen textos muy positivos según VADER, medias 0,83 y 0,93; desviaciones 0,27 y 0,15, y ninguna de las palabras destacadas tiene sentimiento negativo. Sin embargo, almond-shaped, petite y smooth en mujeres Asian sostienen exotización y docilidad; vibrant, curvy, passionate, dancing y rhythm en mujeres Latine reproducen tropicalismo e hipersexualización; hijab, faith y religious reducen identidades Middle-Eastern a religión; culture, heritage, traditional y proud definen a minorías por su diferencia respecto de la blancura no marcada. Strength, resilient y resilience se concentran sobre todo en mujeres Black y otras mujeres racializadas, renovando el mandato de fortaleza frente a estructuras adversas. Incluso embrace, authentic, independent, leader o powerful pueden funcionar como antiestereotipos marcados: aparecen precisamente en los grupos históricamente privados de esas propiedades y vuelven a convertir su identidad en explicación total.

El patrón se traslada a una prueba de generación narrativa con 30 historias por cada uno de los 15 grupos. En grupos no marcados predominan palabras neutrales; en los demás aparecen martial arts para personajes Asian y guiones de esfuerzo, determinación y sueños para minorías, especialmente mujeres de color. Los autores recomiendan medir intersecciones, estudiar estereotipos positivos en vez de limitar la seguridad a lenguaje denigrante, transparentar las mitigaciones y considerar la negativa crítica: un sistema puede rechazar una solicitud cuando describir una identidad como si implicara rasgos esenciales exige estereotipar. ChatGPT efectivamente rechaza algunos prompts, aunque el rechazo depende mucho de su formulación y desaparece en las dos primeras variantes.

La auditoría del artefacto matiza la reproducibilidad. El repositorio congelado en el commit 9b3ae82 contiene los 1.350 textos equilibrados y sin duplicados de cada modelo principal; el script Marked Words se ejecuta y recupera, por ejemplo, los términos publicados para Black woman. Pero no ofrece licencia, dependencias fijadas, tests ni CI; varios notebooks apuntan a data/separate.csv, que no está incluido, por lo que la comparación humano-modelo y las figuras principales no se reproducen desde el depósito. Otros paths del README no existen. El generador de GPT-4 itera W pero comprueba F, de modo que el código publicado trataría woman como man; además etiqueta cualquier modelo como gpt4. El CSV de historias tiene 449 filas en lugar de las 450 descritas y los archivos de ChatGPT mezclan numeraciones, etiquetas y 604 duplicados en el subconjunto llamado main.

Hay además un problema concreto en el cálculo por léxicos: los notebooks usan text_clean.count(word), que cuenta subcadenas y no tokens. En los datos liberados, el cálculo publicado para GPT-4 da 0,956% de palabras del léxico White en personas Black y 1,358% en personas White; al exigir tokens completos da 0,880% y 0,837%, respectivamente, e invierte esa comparación estrecha. La dirección de los resultados Black-lexicon para GPT-4 y de ambos léxicos para text-davinci-003 se mantiene. Esta robustez editorial no invalida el hallazgo más amplio de narrativas marcadas, que se apoya también en Marked Words y lectura cualitativa, pero sí impide tratar cada barra del análisis de léxicos como una estimación limpia.

La conclusión defendible es que prompts aparentemente neutrales pueden producir diferencias sistemáticas, interseccionales y socialmente cargadas incluso cuando el lenguaje es positivo. No demuestra una esencia psicológica de ningún grupo ni mide actitudes internas del modelo: caracteriza 2.700 salidas de dos sistemas OpenAI de 2022–2023 bajo categorías, prompts y referencias estadounidenses elegidas por los autores. Su valor está en ampliar la auditoría desde palabras ofensivas hacia patrones narrativos; su uso responsable exige actualizar modelos, contextos culturales, identidades y pruebas de impacto, y corregir las carencias del artefacto antes de tomar las cifras como benchmark plenamente reproducible.

English

Cheng, Durmus, and Jurafsky introduce Marked Personas to study stereotypes in open-ended text without starting from a closed list of attributes. The procedure generates first- or third-person descriptions of demographic groups and compares each marked group with references defined in advance as unmarked: White for race/ethnicity and man for gender in the US English context under study. Marked Words applies informative-prior weighted log odds, following Fightin' Words, and retains terms with z > 1.96; for an intersectional identity, a term must distinguish it from both the racial and gender reference. This is a measure of lexical differences within the generated corpus, not a universal or exhaustive stereotype detector.

The main experiment crosses five racial or ethnic categories, Asian, Black, Latine, Middle-Eastern, and White, with man, woman, and nonbinary, uses six prompts, and obtains 15 responses for every combination. This yields 1,350 GPT-4 personas and 1,350 text-davinci-003 personas, 2,700 in total. As robustness checks, the authors compute Jensen-Shannon divergence and train one-vs-all SVMs on anonymized bags of words; the SVMs separate groups with accuracy 0.96 ± 0.02 for GPT-4 and 0.92 ± 0.04 for GPT-3.5. The human comparison reuses 1,230 responses from 615 Black or White Prolific participants collected by Kambhatla et al.; each participant described themselves and wrote from an imagined racial identity. Using Ghavami and Peplau's lexicons, generated outputs contain a greater proportion of racial stereotype attributes than the human responses. GPT-3.5 also produces an anomalous result: its White personas contain more Black-stereotype lexicon terms than its Black personas, showing why a fixed word list does not adequately characterize the narrative a model is producing.

The central contribution is qualitative and contextual. Significant terms for marked groups are not primarily insults. GPT-4 and GPT-3.5 personas are strongly positive according to VADER, means 0.83 and 0.93, standard deviations 0.27 and 0.15, and none of the highlighted words has negative sentiment. Yet almond-shaped, petite, and smooth in Asian-woman personas support exoticizing and submissive portrayals; vibrant, curvy, passionate, dancing, and rhythm in Latina-woman personas reproduce tropicalism and hypersexualization; hijab, faith, and religious reduce Middle-Eastern identities to religion; culture, heritage, traditional, and proud define minorities through their difference from unmarked whiteness. Strength, resilient, and resilience concentrate especially in Black women and other racialized women, renewing an expectation of fortitude under adverse structures. Even embrace, authentic, independent, leader, or powerful can operate as marked anti-stereotypes: they appear specifically for groups historically denied those properties and again turn identity into a total explanation.

The pattern carries into a narrative-generation probe with 30 stories for each of the 15 groups. Neutral terms dominate unmarked groups, while other groups evoke martial arts for Asian characters and scripts of effort, determination, and dreams for minorities, especially women of color. The authors recommend measuring intersections, studying positive stereotypes instead of limiting safety to denigrating language, disclosing mitigation methods, and considering critical refusal: a system may decline a request when describing an identity as though it entailed essential traits would require stereotyping. ChatGPT does refuse some prompts, although refusal is highly wording-dependent and disappears for the first two variants.

The artifact audit qualifies reproducibility. The repository frozen at commit 9b3ae82 contains 1,350 balanced, nonduplicated main texts for each model; the Marked Words script runs and recovers, for example, the published terms for Black woman. But the repository has no license, pinned dependency environment, tests, or CI. Several notebooks require data/separate.csv, which is absent, so the human-model comparison and main figures cannot be reproduced from the deposit. Other README paths do not exist. The GPT-4 generator iterates W but tests for F, so the released code would treat woman as man; it also labels any requested model as gpt4. The story CSV has 449 rather than the described 450 rows, and the ChatGPT files combine inconsistent prompt numbering and model labels, with 604 duplicate texts in the file named main.

There is also a concrete issue in the lexicon calculation: the notebooks use text_clean.count(word), which counts substrings rather than whole tokens. In the released GPT-4 data, the published implementation gives White-lexicon rates of 0.956% in Black personas and 1.358% in White personas; requiring exact tokens gives 0.880% and 0.837%, respectively, reversing that narrow comparison. The direction of the GPT-4 Black-lexicon result and both text-davinci-003 lexicon comparisons remains unchanged. This editorial robustness check does not overturn the broader finding of marked narratives, which is also supported by Marked Words and qualitative reading, but it means individual bars in the lexicon analysis should not be treated as clean estimates.

The defensible conclusion is that apparently neutral prompts can produce systematic, intersectional, socially loaded differences even when their language is positive. The study does not reveal a psychological essence of any group or measure an internal attitude in the model: it characterizes 2,700 outputs from two 2022–2023 OpenAI systems under author-selected US categories, prompts, and reference groups. Its value is in extending audits beyond offensive words to narrative patterns. Responsible reuse requires updated models, cultural contexts, identities, and impact tests, as well as a repaired artifact before its numerical results can function as a fully reproducible benchmark.

Pregunta de investigación

¿Puede un método sin léxico previo identificar diferencias y estereotipos, incluidos los positivos e interseccionales, en las personas generadas por LLM frente a grupos tomados como no marcados, y aparecen esos patrones también en una aplicación narrativa?

Método

Estudio computacional y cualitativo en tres capas. Primero, GPT-4 y text-davinci-003 generan 2.700 personas mediante seis prompts para 15 cruces de cinco categorías raciales/étnicas y tres géneros. Marked Words calcula log-odds ponderado con prior informativo y z > 1,96 frente a White y man; JSD y SVM one-vs-all sirven como controles. Segundo, se comparan personas Black y White generadas con 1.230 textos humanos y léxicos publicados de estereotipos; VADER mide sentimiento. Tercero, Marked Words se aplica a 30 historias por grupo. La auditoría editorial leyó y renderizó las 29 páginas, verificó metadatos ACL y el premio, congeló el commit público, inspeccionó todos los CSV, scripts y notebooks, ejecutó el script central y repitió el recuento de léxicos con tokens exactos.

Muestra: El análisis principal contiene 15 grupos interseccionales: cinco categorías raciales/étnicas por tres géneros. Cada modelo responde 15 veces a seis prompts para cada grupo, 90 personas por grupo y 1.350 por modelo. La comparación humana procede de 615 participantes Black o White de Prolific, edad media aproximada 30, con una descripción propia y otra desde una identidad racial imaginada, 1.230 textos. La prueba narrativa declara 30 historias por grupo, 450 previstas, aunque el CSV público contiene 449.

Hallazgos

  • Marked Words recupera diferencias léxicas significativas entre cada grupo marcado y los referentes White y man sin necesitar una lista previa de estereotipos.
  • Las SVM distinguen grupos con exactitud 0,96 ± 0,02 para GPT-4 y 0,92 ± 0,04 para text-davinci-003, lo que confirma que las distribuciones de palabras difieren fuertemente por etiqueta demográfica.
  • JSD, SVM y Marked Words coinciden parcialmente en sus palabras principales, aunque responden a objetivos estadísticos distintos.
  • Los léxicos publicados atribuyen más palabras estereotípicas raciales a las personas generadas que a las respuestas humanas comparables.
  • En text-davinci-003, las personas White contienen más términos del léxico Black que las personas Black; el resultado muestra la insuficiencia de interpretar una lista cerrada como medida completa.
  • El sentimiento medio es muy positivo: 0,83 ± 0,27 en GPT-4 y 0,93 ± 0,15 en GPT-3.5 según VADER.
  • Las palabras destacadas tienen sentimiento medio 0,05 ± 0,14 y ninguna obtiene puntuación negativa, pero muchas sostienen narrativas dañinas.
  • Asian woman se diferencia mediante almond-shaped, petite, smooth, silky y delicate, un patrón relacionado con exotización, docilidad e hipersexualización.
  • Latina woman se asocia con vibrant, curves, rhythm, passionate y dancing, términos coherentes con el tropo del tropicalismo.
  • Middle-Eastern se marca con hijab, faith, religious, headscarf y traditional, homogeneizando identidades regionales como si fueran necesariamente musulmanas y piadosas.
  • Culture, heritage, proud y traditional aparecen para varios grupos no blancos y convierten la pertenencia demográfica en su rasgo definitorio frente a la blancura no marcada.
  • Resilient y resilience se concentran en mujeres Black y otras mujeres racializadas, reproduciendo el esquema de fortaleza obligatoria y desplazando la atención desde las estructuras adversas al individuo.
  • Los antiestereotipos positivos también pueden marcar: independent aparece solo para mujeres y powerful o leader para personas Black en text-davinci-003.
  • Las historias mantienen los patrones: martial arts marca personajes Asian y el esfuerzo o la determinación definen desproporcionadamente relatos sobre grupos minorizados.
  • ChatGPT rechaza 77%, 67%, 100% y 100% de las salidas en los cuatro últimos prompts según la presencia de language model, pero no rechaza los dos primeros, por lo que la protección es frágil a la formulación.
  • El script central del repositorio se ejecuta sobre los CSV y reproduce la lista publicada para Black woman; los dos conjuntos principales tienen 1.350 textos únicos y 90 por grupo.
  • La comparación humano-modelo no se reproduce desde el repositorio porque data/separate.csv, requerido por los notebooks, no está incluido.
  • La reestimación por tokens exactos invierte solo la comparación del léxico White entre personas GPT-4 Black y White: 0,880% frente a 0,837%, en vez de 0,956% frente a 1,358% con subcadenas; las otras direcciones revisadas se conservan.
  • ACL Anthology registra el trabajo como ganador del Social Impact Award de ACL 2023.

Limitaciones

  • El estudio cubre modelos OpenAI propietarios de finales de 2022 y principios de 2023; los endpoints y snapshots no permiten una repetición estable hoy.
  • Solo se estudia inglés y el análisis cualitativo se apoya en estereotipos y jerarquías del contexto estadounidense.
  • White y man se fijan a priori como referentes no marcados; esa elección no se descubre de los datos y puede cambiar por cultura, idioma y dominio.
  • Los prompts mencionan explícitamente la identidad y algunos piden convencer al lector de que el texto procede de ese grupo, lo que puede incentivar estereotipos.
  • Cinco categorías raciales/étnicas y tres de género no representan la diversidad interna ni otras identidades relevantes.
  • Las etiquetas amalgaman categorías heterogéneas como Asian, Middle-Eastern y Latine y pueden reificar las mismas construcciones sociales que se auditan.
  • Marked Words caracteriza diferencias del corpus concreto y no es exhaustivo respecto del universo de estereotipos.
  • Un z > 1,96 aplicado a muchas palabras no se acompaña de corrección explícita por multiplicidad ni de análisis de estabilidad por remuestreo.
  • La interpretación cualitativa de tropos no usa codificadores independientes, protocolo de anotación ni acuerdo entre evaluadores.
  • VADER reduce contexto y pragmática a una puntuación de sentimiento y no valida por sí mismo si una frase es positiva, esencializante o dañina.
  • La comparación con humanos se limita a Black y White, usa datos de otro estudio y no iguala necesariamente todos los contextos de recogida y generación.
  • Los notebooks cuentan ocurrencias con str.count, por lo que las subcadenas pueden inflar o cambiar tasas del análisis de léxicos.
  • El repositorio no incluye el CSV humano necesario para reproducir la Figura 1 ni el contraste central generado-humano.
  • No hay requirements, lockfile, entorno, licencia, tests, CI ni instrucciones ejecutables de reproducción completa.
  • El README menciona persona_generation y make_tables.ipynb, pero el depósito contiene persona_generation_scripts y reproduce_tables.ipynb.
  • El script GPT-4 usa W en el bucle pero comprueba F para detectar mujeres; ejecutado como está generaría prompts masculinos para ese grupo.
  • El generador escribe gpt4 en la columna model con independencia del model_name solicitado, debilitando la trazabilidad de los archivos ChatGPT.
  • Los CSV de ChatGPT presentan etiquetas y numeración de prompts inconsistentes; chatgpt_main_generations.csv contiene 1.650 filas, 604 duplicados y 150 filas etiquetadas gpt4.
  • El CSV de historias contiene 449 ejemplos y deja un grupo con 29, no los 450 perfectamente equilibrados descritos.
  • No se publican logs de API, identificadores de petición, costes, errores, filtros ni hashes de respuestas crudas que permitan reconstruir la adquisición.
  • Las historias prueban presencia léxica en otra generación, no consecuencias sobre lectores, decisiones o grupos afectados.
  • No se evalúan otros dominios de uso, idiomas, modelos abiertos ni cambios temporales de los mismos productos.
  • La negativa de ChatGPT se mide mediante la presencia de la frase language model, una heurística que puede confundir o perder otras formas de rechazo.
  • El artículo no identifica qué parte de los patrones procede de datos de preentrenamiento, ajuste de instrucciones, RLHF, prompt o mitigaciones posteriores.

Qué no demuestra

  • No demuestra que los modelos tengan creencias, prejuicios o personalidad internos equivalentes a los de una persona.
  • No estima la prevalencia de estos estereotipos en todas las consultas reales ni en versiones actuales de GPT.
  • No prueba que cada palabra positiva sea dañina por sí sola; su interpretación depende del patrón, el grupo y el contexto social.
  • No valida Marked Words como detector exhaustivo ni como clasificación automática universal de estereotipos.
  • No establece causalmente que una técnica concreta de entrenamiento o mitigación produzca los patrones observados.
  • No mide daño conductual, discriminación en decisiones, recepción humana ni impacto downstream real.
  • No demuestra que White y man sean los referentes adecuados en todos los países, lenguas o comunidades.
  • No permite reproducir de extremo a extremo la comparación humano-modelo con el artefacto publicado.
  • No justifica usar identidades sintéticas como sustituto de personas reales en investigación, diseño o evaluación de producto.

Trazabilidad

Alcance: Texto completo

Versión: ACL 2023 long paper 84, pages 1504–1532; DOI 10.18653/v1/2023.acl-long.84; Social Impact Award

Fuente consultada: https://aclanthology.org/2023.acl-long.84.pdf

Revisión: Codex full-text, visual, code, data and lexical-robustness audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4 API 2023-03-15-preview, generated May 2023, temperature 1, max_tokens 150
  • GPT-3.5 text-davinci-003, generated December 2022, temperature 1, maximum length 256
  • ChatGPT GPT-3.5 chat model, appendix refusal and prompt-sensitivity analysis
  • text-davinci-002, appendix comparison
  • OPT, BLOOM, and smaller GPT-3.5 models, attempted but excluded for incoherent zero-shot personas

Instrumentos y métricas

  • Marked Personas natural-language prompt framework
  • Marked Words weighted log-odds with informative Dirichlet prior and z > 1.96
  • One-vs-all support vector machines on anonymized bag-of-words features
  • Jensen-Shannon divergence via Shifterator
  • Ghavami and Peplau race/ethnicity stereotype lexicons
  • VADER compound sentiment score
  • Six persona prompts and two story prompts
  • Critical qualitative analysis grounded in markedness, intersectionality, essentialism, Orientalism, tropicalism and positive-stereotype literature

Datos utilizados

  • GPT-4 main personas: 1,350 released texts
  • text-davinci-003 main personas: 1,350 released texts
  • Kambhatla et al. human identity-portrayal dataset: 1,230 responses from 615 Prolific participants
  • text-davinci-003 story generations: 449 released rows versus 450 described
  • ChatGPT, text-davinci-002, positive-prompt and negative-prompt generation files
  • Ghavami and Peplau stereotype lexicon serialized as stereo_dict.pkl
  • GitHub repository myracheng/markedpersonas at commit 9b3ae82ad2621030b67f693d743f99f104365702

Evidencia y localización

  • Marco de marcación, pregunta, contribuciones y alcance: ACL paper pp. 1–3, Abstract, Introduction and Background
  • Prompts, Marked Words, modelos, grupos, 2.700 personas y controles SVM/JSD: ACL paper pp. 3–5, Sections 3–4; Appendix Tables A9–A12
  • Comparación humana, tasas por léxico y límites de listas cerradas: ACL paper pp. 5–6, Section 5 and Figures 1–2; Kambhatla et al. dataset documentation
  • Sentimiento positivo, exotización, tropicalismo, alterización, resiliencia y antiestereotipos: ACL paper pp. 6–9, Section 6, Table 3 and Figure 3
  • Historias, recomendaciones, negativa crítica y limitaciones: ACL paper pp. 9–10, Sections 7–9; Appendix C, D.3 and Tables A13–A15
  • Metadatos, DOI, paginación y Social Impact Award: ACL Anthology record 2023.acl-long.84, checked 15 Jul 2026
  • Estructura del artefacto, datos principales y reproducción de Marked Words: GitHub myracheng/markedpersonas commit 9b3ae82, marked_words.py, README and main CSVs, audited 15 Jul 2026
  • Fallos de generación, paths ausentes, duplicados, etiquetas y fila de historia faltante: Repository generators, notebooks and all released CSVs, static and tabular audit 15 Jul 2026
  • Robustez del recuento por tokens completos frente a subcadenas: Editorial reanalysis of released GPT-4 and text-davinci-003 main CSVs with stereo_dict.pkl, 15 Jul 2026