When LLMs Imagine People: A Human-Centered Persona Brainstorm Audit for Bias and Fairness in Creative Applications

Aplicaciones, sesgos y seguridad2026arXivRevisión editorial aprobada

Autores: Hongliu Cao, Eoin Thomas, Rodrigo Acuna Agost

Palabras clave: Large Language Models, Personality, Bias, Fairness, Persona

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
20
Hallazgos
70
Limitaciones
11
Evidencias

Resumen editorial

Español

El artículo propone Persona Brainstorm Audit (PBA), un procedimiento para detectar asociaciones potencialmente estereotípicas en listas de personas generadas por LLM. Esta revisión usa arXiv v2, revisado el 24 de febrero de 2026: un manuscrito ACM de 27 páginas que todavía conserva el texto de plantilla «Make sure to enter the correct conference title» y un DOI ficticio. No se encontró publicación definitiva ni repositorio oficial; el propio artículo pospone la liberación de perfiles, mappings y código hasta la publicación.

El prompt base pide en cada llamada «20 diverse user profiles» en JSON, con ocho campos: nombre, género, etnia, orientación sexual, clase social, educación, ocupación e interés principal. Se generan nominalmente 10.000 perfiles por cada uno de 12 modelos: nueve aliases de OpenAI, GPT-3.5, GPT-4, GPT-4o, tres GPT-4.1 y tres GPT-5, y tres versiones Mistral. La temperatura es 1. Los valores se pasan a minúsculas, se someten a stemming, se deduplican y luego GPT-5 los consolida en categorías, supuestamente con validación humana. La reducción es extrema: por ejemplo, 1.128 etiquetas de etnia de GPT-5 terminan en seis categorías; 689 niveles educativos, en cinco; 1.384 ocupaciones, en 18; y 1.501 intereses, en 15. Para nombre solo se conservan los 50 más frecuentes del conjunto de modelos.

PBA cruza cuatro ejes tratados como identidad, nombre, género, etnia y orientación sexual, con cuatro dimensiones sociales, clase, educación, ocupación e interés, construye 16 tablas de contingencia y calcula Cramér V. Después transforma V mediante umbrales dependientes de los grados de libertad en una escala de severidad: 0–0,33 pequeña, 0,33–0,66 media, 0,66–1 alta y >1 muy alta. El algoritmo exacto de esta segunda normalización no está especificado matemáticamente. Cramér V mide asociación, no perjuicio, discriminación ni falta de equidad; una asociación puede ser semánticamente esperable o variar por los márgenes y por las categorías creadas. Además, el artículo llama «bounded» a la métrica normalizada aunque sus resultados superan 1.

En el análisis principal, GPT-4o obtiene la media menor (0,678), seguido de Ministral-3B (0,699), GPT-4 y GPT-5 nano (ambos 0,707). GPT-4.1 mini (0,969), GPT-5 (0,950), GPT-5 mini (0,920) y Mistral-medium (0,893) quedan arriba. Las asociaciones con nombre son las mayores en promedio (1,113), y ocupación e interés concentran los valores altos. Los heatmaps muestran concentración de identidades no heterosexuales en Creative & Design y baja presencia en Engineering, asociaciones por género en ocupaciones y diferencias al combinar género × orientación sexual × clase. El ejemplo fino de enfermería asigna más del 90 % a mujeres en casi todos los modelos; GPT-4.1 nano llega al 100 %. Estas distribuciones sí documentan patrones generados que merecen inspección, pero la puntuación agregada no determina por sí sola cuáles son dañinos.

El artículo presenta GPT-3.5 → GPT-4 → GPT-4o → GPT-4.1 → GPT-5 como una trayectoria longitudinal y concluye que el sesgo baja y reaparece. Sin snapshots exactos, fechas de inferencia ni checkpoints comparables, esto es una comparación transversal de productos distintos, no seguimiento controlado del mismo sistema. Las pruebas t pareadas tratan las 16 dimensiones correlacionadas como réplicas para comparar modelos, lo que no satisface claramente la independencia. El tamaño publicado tampoco es exactamente 120.000 tras deduplicar: se eliminan 3.778 perfiles y quedan 116.222; Mistral-medium pierde 2.060 (20,6 %) frente a solo 3 de GPT-5. La deduplicación desigual cambia las distribuciones y elimina precisamente una señal de colapso o concentración del modelo.

La sensibilidad a tamaño compara 5k, 10k, 15k y 20k en seis modelos y obtiene ICC y correlaciones altas en la mayoría de dimensiones, pero no se indica si son muestras independientes o subconjuntos anidados, no hay réplicas ni intervalos. Con el rol de UX researcher, casi todas las severidades se mantienen. Con el prompt de debiasing, la estabilidad cae mucho: recalculando las 16 filas de la Tabla 5, las medias son ICC(C,1)=0,381, ICC(A,1)=0,361, Spearman=0,422, Kendall=0,306 y diferencia de severidad=0,312. La fila «Mean» impresa, 0,320, 0,319, −0,200, −0,200, 0,167, no es la media de las filas. Pese a ello, abstract y conclusión afirman estabilidad bajo prompts de debiasing. Además, el prompt base ya exige perfiles «diversos», por lo que la intervención no contrasta una condición neutral; y ausencia de p<0,05 con pocos modelos no demuestra ausencia de efecto ni equivalencia.

La validación humana es exploratoria: nueve evaluadores comparan solo dos gráficos de Gender × Occupation seleccionados porque GPT-5 mini puntúa 1,134 y GPT-5 nano 0,779. Todos ven más sesgo en el primero. Esto aporta validez aparente para ese contraste evidente, pero no valida las 16 dimensiones, los umbrales, la comparabilidad entre grados de libertad ni el uso regulatorio. No se reportan protocolo ético, consentimiento, composición exacta DEI/no-DEI, compensación, aleatorización del orden o acuerdo entre evaluadores.

La contribución defendible es un protocolo sencillo para producir datos categóricos abiertos y localizar asociaciones que un auditor humano puede investigar, con ejemplos útiles de zoom macro/micro. No queda establecido que la escala normalizada mida fairness de forma válida y comparable, que sea robusta a prompts de debiasing ni que sustente rankings de modelos, umbrales de despliegue o certificación. La ficha debe presentar PBA como instrumento exploratorio de señalización, no como métrica de equidad ya validada.

English

The paper proposes the Persona Brainstorm Audit (PBA), a procedure for detecting potentially stereotypical associations in LLM-generated persona lists. This review uses arXiv v2, revised on 24 February 2026: a 27-page ACM manuscript that still contains the template text “Make sure to enter the correct conference title” and a placeholder DOI. No definitive publication or official repository was found; the paper itself postpones release of profiles, mappings, and code until publication.

The base prompt asks for “20 diverse user profiles” in JSON per call, with eight fields: name, gender, ethnicity, sexual orientation, social class, education, occupation, and top personal interest. The study nominally generates 10,000 profiles from each of 12 models: nine OpenAI aliases, GPT-3.5, GPT-4, GPT-4o, three GPT-4.1 variants, and three GPT-5 variants, and three Mistral releases. Temperature is 1. Values are lowercased, stemmed, deduplicated, and consolidated into categories by GPT-5, reportedly followed by human validation. The reduction is extreme: for example, GPT-5's 1,128 ethnicity strings become six categories; 689 education strings become five; 1,384 occupations become 18; and 1,501 interests become 15. Only the 50 most frequent names across models are retained for name-based analysis.

PBA crosses four identity axes, name, gender, ethnicity, and sexual orientation, with four social dimensions, class, education, occupation, and interest, builds 16 contingency tables, and computes Cramér's V. It then transforms V through degree-of-freedom-dependent thresholds into severity scores: 0–0.33 small, 0.33–0.66 medium, 0.66–1 high, and >1 very high. The exact algorithm for this second normalization is not specified mathematically. Cramér's V measures association, not harm, discrimination, or unfairness; an association may be semantically expected or vary with margins and analyst-created categories. The paper also calls the normalized metric “bounded” although its results exceed 1.

In the main analysis, GPT-4o has the lowest mean score (0.678), followed by Ministral-3B (0.699), GPT-4 and GPT-5 nano (both 0.707). GPT-4.1 mini (0.969), GPT-5 (0.950), GPT-5 mini (0.920), and Mistral-medium (0.893) rank highest. Name associations are largest on average (1.113), while occupation and interest concentrate high scores. Heatmaps show non-heterosexual identities clustering in Creative & Design and appearing less in Engineering, gender-linked occupations, and differences when gender × sexual orientation × social class are combined. The nurse drill-down assigns more than 90% of nurses to women in almost every model; GPT-4.1 nano reaches 100%. These distributions document generated patterns worth inspecting, but the aggregate score alone does not determine which patterns are harmful.

The paper presents GPT-3.5 → GPT-4 → GPT-4o → GPT-4.1 → GPT-5 as a longitudinal trajectory and concludes that bias declines and resurfaces. Without exact snapshots, inference dates, or comparable checkpoints, this is a cross-sectional comparison of distinct products, not controlled longitudinal tracking of one system. Paired t-tests treat the 16 correlated dimensions as replicates when comparing models, with unclear independence. The analyzed sample is also not exactly 120,000 after deduplication: 3,778 profiles are removed, leaving 116,222; Mistral-medium loses 2,060 (20.6%) compared with only 3 for GPT-5. Unequal deduplication changes the distributions and removes a direct signal of model collapse or concentration.

The sample-size analysis compares 5k, 10k, 15k, and 20k profiles on six models and reports high ICCs and correlations for most dimensions, but it does not state whether samples are independent or nested, and provides no repeated samples or intervals. Under the UX-researcher role, most severity labels persist. Under the debiasing prompt, stability drops sharply: recomputing the 16 rows in Table 5 gives means ICC(C,1)=0.381, ICC(A,1)=0.361, Spearman=0.422, Kendall=0.306, and severity difference=0.312. The printed “Mean” row, 0.320, 0.319, −0.200, −0.200, 0.167, is not the mean of the rows. Nevertheless, the abstract and conclusion claim stability under debiasing prompts. The base prompt already requires “diverse” profiles, so the intervention is not compared with a neutral condition; and a lack of p<0.05 with few models does not demonstrate no effect or equivalence.

Human validation is exploratory: nine evaluators compare only two Gender × Occupation charts selected because GPT-5 mini scores 1.134 and GPT-5 nano 0.779. Everyone judges the former more biased. This provides face validity for one obvious contrast, but does not validate all 16 dimensions, the thresholds, degree-of-freedom comparability, or regulatory use. The paper does not report ethics review, consent, exact DEI/non-DEI composition, compensation, order randomization, or inter-rater agreement.

The defensible contribution is a simple protocol for generating open categorical data and locating associations for human auditors to investigate, with useful macro-to-micro drill-down examples. It does not establish that the normalized scale validly and comparably measures fairness, that it is robust to debiasing prompts, or that it supports model rankings, deployment thresholds, or certification. PBA should be presented as an exploratory signal-detection instrument rather than a validated fairness metric.

Pregunta de investigación

¿Puede una generación abierta de perfiles estructurados revelar asociaciones entre identidades y roles sociales, compararlas entre 12 LLM, mostrar patrones interseccionales y seguir cambios entre versiones mediante una normalización de Cramér V?

Método

Cada llamada pide 20 perfiles «diversos» en JSON con ocho atributos. Se generan nominalmente 10.000 por modelo en 12 LLM a temperatura 1. Tras minúsculas, stemming y deduplicación, GPT-5 consolida los valores a 3 géneros, 6 etnias, 5 orientaciones sexuales, 3 clases, 5 niveles educativos, 18 ocupaciones y 15 intereses; nombre usa el top 50. Se calculan 16 Cramér V y una normalización de severidad no formalizada. Se comparan modelos mediante t pareadas y BH-FDR, se inspeccionan heatmaps e intersecciones, y se prueban tamaños 5k–20k, un rol UX, un prompt de debiasing y una validación humana n=9.

Muestra: 120.000 perfiles nominales antes de deduplicar; 116.222 después. La pérdida varía de 3 en GPT-5 a 2.060 en Mistral-medium. Cada llamada co-genera 20 perfiles y la unidad de independencia no se modela. La sensibilidad usa seis modelos y cuatro tamaños sin réplicas descritas. La validación humana incluye nueve profesionales de procedencia no detallada, mezclando expertos DEI y no expertos sin desglose.

Hallazgos

  • GPT-4o tiene la menor media PBA (0,678) y GPT-4.1 mini la mayor (0,969) en la Tabla 2.
  • GPT-5 obtiene 0,950, con nueve de 16 dimensiones en la categoría muy alta y ninguna baja.
  • Las asociaciones con nombre son las mayores en promedio (1,113); Name × Occupation alcanza 1,195.
  • Occupation e Interest concentran asociaciones altas para las cuatro identidades.
  • Ethnicity × Occupation promedia 1,091 y Gender × Interest, 1,013.
  • Gender × Education y Gender × Social Class son menores que Gender × Occupation e Interest.
  • Los heatmaps muestran concentración de identidades queer en Creative & Design y baja presencia en Engineering en muchos modelos.
  • La familia GPT-5 aumenta la asignación a IT para varias orientaciones no heterosexuales frente a GPT-3.5/GPT-4.x.
  • Los patrones de Mistral concentran perfiles lesbianos en Healthcare en algunas versiones.
  • El análisis interseccional muestra diferencias de clase entre combinaciones género × orientación sexual que no aparecen en ejes aislados.
  • En enfermería, la representación femenina supera 90 % en casi todos los modelos; GPT-4.1 nano reporta 100 %.
  • La brecha L1 hombre–mujer por ocupación va de 54 en GPT-4/GPT-5 nano a 90 en Mistral-medium.
  • El gráfico de cinco aliases OpenAI muestra caída desde GPT-3.5 a GPT-4o y repunte posterior en varias dimensiones.
  • La sensibilidad 5k–20k reporta ICC y correlaciones altas en la mayoría de las 16 dimensiones.
  • La severidad no cambia en diez de 16 dimensiones en el análisis de tamaño de muestra.
  • El rol UX mantiene la mayoría de patrones, salvo muy baja concordancia en Sexual Orientation × Education.
  • El prompt de debiasing reduce notablemente la concordancia: medias recalculadas de ICC 0,381/0,361, Spearman 0,422 y Kendall 0,306.
  • Ninguna de las 16 t pareadas del prompt de debiasing alcanza p<0,05; esto no es una prueba de equivalencia.
  • Los nueve evaluadores ordenan el gráfico GPT-5 mini como más sesgado que GPT-5 nano en Gender × Occupation.
  • Los resultados localizan asociaciones generadas que pueden guiar inspección humana, pero no validan por sí solos daño o unfairness.

Limitaciones

  • El manuscrito conserva un título de conferencia y DOI de plantilla, por lo que no es una publicación ACM definitiva.
  • No se encontró una versión revisada por pares ni aceptación verificable.
  • Código, perfiles, mappings y outputs se prometen tras publicación y no están disponibles.
  • No hay repositorio oficial localizado por título, arXiv ID o nombre del método.
  • No pueden reproducirse normalización, deduplicación, tablas, figuras ni pruebas estadísticas de extremo a extremo.
  • GPT-3.5, GPT-4 y GPT-4o son aliases sin identificadores de snapshot.
  • Tampoco se fijan snapshots exactos de GPT-4.1/GPT-5, fechas de inferencia ni región/proveedor de API.
  • No se informan system prompt, max tokens, top_p, seed, timeout, reintentos, errores JSON o respuestas descartadas.
  • Solo se reporta temperatura 1; no se controla la estocasticidad entre modelos.
  • El prompt base ya exige perfiles «diversos», por lo que el baseline no es neutral respecto de la equidad.
  • El prompt de debiasing repite parcialmente la instrucción de diversidad del baseline.
  • Edad, capacidades y región se piden en la instrucción de debiasing pero no son campos de salida, y su efecto no se mide.
  • Cada llamada genera 20 perfiles conjuntamente; esas filas no son observaciones iid y pueden balancearse dentro del lote.
  • El número de llamadas, orden, contexto entre llamadas y aislamiento de conversaciones no se detalla.
  • El texto afirma 10.000 perfiles sin duplicados por modelo, pero la Tabla 7 encuentra 3.778 duplicados.
  • Tras deduplicar quedan 116.222, no 120.000 observaciones analizadas.
  • La deduplicación es muy desigual: 20,6 % en Mistral-medium, 7,76 % en Ministral-3B y 0,03 % en GPT-5.
  • Eliminar duplicados puede ocultar colapso o concentración, que son comportamientos relevantes para diversidad.
  • No se aclara si las muestras se rellenan hasta 10.000 únicos o se comparan tamaños finales distintos.
  • GPT-5 define la consolidación semántica usada para auditar también modelos GPT, introduciendo dependencia del evaluador.
  • La validación humana de los mappings no reporta evaluadores, rúbrica, desacuerdos, cambios o fiabilidad.
  • Las reducciones 1.128→6 etnias, 689→5 niveles y 1.501→15 intereses implican decisiones normativas masivas.
  • Los mappings pueden fusionar identidades no equivalentes y fabricar o borrar asociaciones.
  • No se reporta missingness ni categorías desconocidas o ambiguas.
  • Para nombres se usa solo el top 50 global sin informar qué fracción de cada modelo se excluye.
  • Los nombres codifican cultura, lengua, género y etnia; su asociación con otros atributos no equivale automáticamente a sesgo.
  • Cramér V cuantifica asociación simétrica, no dirección, valencia, perjuicio ni discriminación.
  • Independencia estadística no es una definición normativa suficiente de fairness; algunas asociaciones pueden ser legítimas y otras dañinas aunque V sea bajo.
  • Cramér V depende de márgenes, cardinalidad, sparsity y decisiones de agrupación.
  • No se reportan frecuencias esperadas; la fuente estadística citada exige revisar celdas <5 y <1 para la aproximación chi-cuadrado.
  • Tablas como 50 nombres × 18 ocupaciones pueden ser dispersas incluso con miles de perfiles tras exclusiones.
  • No se usa ni discute corrección de sesgo de Cramér V para tablas grandes o dispersas.
  • La fórmula exacta de la normalización por umbrales no aparece en el artículo.
  • La referencia Kim solo muestra umbrales hasta cinco grados de libertad; la extrapolación para tablas mayores no se documenta.
  • El artículo alterna grados de libertad de la prueba (r−1)(c−1) y el mínimo usado en Cramér V sin especificar cuál gobierna el umbral.
  • La métrica normalizada supera 1, contradiciendo la descripción de etiquetas o puntuaciones bounded en conclusión.
  • Promediar scores normalizados heterogéneos entre 16 constructos no tiene una interpretación calibrada.
  • Los cortes 0,33/0,66/1 no se validan empíricamente para fairness o daño.
  • El umbral de despliegue propuesto <1,0 carece de validación de riesgo, dominio o población.
  • Las t pareadas entre modelos usan 16 dimensiones correlacionadas como réplicas y no justifican independencia o normalidad de diferencias.
  • Las 16 dimensiones comparten los mismos perfiles y categorías, generando dependencia.
  • No se publican tamaños de efecto o intervalos para las diferencias entre modelos.
  • Los aliases OpenAI no son checkpoints controlados de una sola línea evolutiva.
  • La supuesta trayectoria longitudinal es una comparación transversal de productos con entrenamiento, arquitectura y fechas desconocidos.
  • No puede atribuirse el repunte a escala, alineamiento o generación del modelo sin diseño causal.
  • La sensibilidad de tamaño no dice si 5k, 10k, 15k y 20k son muestras independientes o subconjuntos anidados.
  • No hay réplicas por tamaño, seeds, bootstrap ni intervalos; una sola serie no mide variación muestral.
  • La robustez de tamaño se evalúa solo en seis de 12 modelos.
  • ICC y correlaciones con seis modelos como unidades ofrecen estimaciones inestables y no se acompañan de intervalos.
  • Las pruebas de rol y debiasing parecen usar pocos modelos; el n efectivo y la construcción de muestras no se explicitan completamente.
  • p>0,05 no demuestra ausencia de efecto, equivalencia ni insuficiencia general del prompt engineering.
  • No se aplica prueba de equivalencia ni se define margen de no inferioridad.
  • La Tabla 5 imprime una fila Mean aritméticamente falsa: tampoco coincide con las medias recalculadas de sus 16 filas.
  • El texto dice que la mayoría de métricas de debiasing supera 0,40, pero muchas ICC y Kendall están claramente por debajo.
  • Abstract y conclusión afirman estabilidad bajo debiasing pese a concordancias bajas y negativas en varias dimensiones.
  • La diferencia de severidad usa bins gruesos y puede ocultar cambios grandes dentro de una categoría.
  • La validación humana selecciona dos sistemas ya separados por la métrica y una sola dimensión.
  • Nueve evaluadores no permiten calibrar 16 dimensiones ni múltiples culturas o formas de daño.
  • No se informa cuántos eran expertos DEI, sus perfiles, reclutamiento, compensación o conflictos.
  • No se documentan consentimiento, revisión ética o exención para el estudio humano.
  • Anonimizar marcas no elimina por sí mismo efectos de orden; no se reporta aleatorización del orden de gráficos.
  • No se calcula acuerdo interevaluador ni incertidumbre de las calificaciones.
  • Dar la escala de cuatro categorías puede inducir la misma discretización que se pretende validar.
  • La validación muestra validez aparente de un contraste obvio, no validez convergente, predictiva o regulatoria.
  • La afirmación de menor riesgo de data leakage es plausible, pero no se prueba frente a memorización de patrones o prompts.
  • La supuesta generalización cultural no se evalúa: todo está en inglés y solo hay proveedores estadounidenses/europeos.
  • El formato es estructurado y categórico; no audita narrativa, tono, agencia, dignidad o estereotipos semánticos de personas completas.
  • No se evalúan outcomes reales ni daño aguas abajo en diseño, contratación, educación o recomendación.
  • Las propuestas de certificación y compliance exceden la validación exploratoria disponible.
  • La referencia [38] asigna erróneamente arXiv:2401.12345 a Prompting Fairness; ese ID corresponde a Distributionally Robust Receive Combining.

Qué no demuestra

  • No establece que Cramér V sea una medida directa de fairness o daño.
  • No demuestra que independencia entre toda identidad y todo rol sea el estado justo deseable.
  • No valida que los scores normalizados sean comparables entre cardinalidades y constructos.
  • No justifica los umbrales pequeña/media/alta/muy alta como niveles de riesgo.
  • No demuestra que GPT-4o sea globalmente más justo que otros modelos fuera de este prompt y mapping.
  • No demuestra que modelos más nuevos causen un resurgimiento del sesgo.
  • No prueba robustez a prompts de debiasing; sus propias concordancias caen sustancialmente.
  • No prueba que un prompt de debiasing no pueda reducir sesgo en otros diseños o con potencia adecuada.
  • No valida el método en idiomas o culturas distintos del inglés occidental.
  • No audita personas narrativas abiertas más allá de ocho campos categóricos estructurados.
  • No demuestra impacto real sobre oportunidades, contratación o decisiones de usuarios.
  • No permite certificación, compliance o gating de despliegue con el umbral <1 propuesto.
  • No establece causalidad entre nombre, género, etnia u orientación y los roles generados.
  • No permite reproducir rankings ni errores mientras código, mappings y perfiles permanezcan sin publicar.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2602.00044v2, revised 24 February 2026; 27-page ACM-submission manuscript with placeholder venue and DOI

Fuente consultada: https://arxiv.org/pdf/2602.00044v2

Revisión: Codex full-text, bilingual-fidelity, arXiv-v2, 27-page visual, Cramer-normalization, contingency-sparsity, batch-independence, category-consolidation, deduplication, table-arithmetic, prompt-robustness, human-validation, citation and artifact-availability audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI GPT-3.5 alias; exact API model snapshot not reported
  • OpenAI GPT-4 alias; exact API model snapshot not reported
  • OpenAI GPT-4o alias; exact API model snapshot not reported
  • OpenAI GPT-4.1, GPT-4.1 mini, and GPT-4.1 nano aliases; exact dated snapshots not reported
  • OpenAI GPT-5, GPT-5 mini, and GPT-5 nano aliases; exact dated snapshots not reported
  • Ministral-3B model identifier ministral-3b-2410
  • Mistral Small model identifier mistral-small-2501
  • Mistral Medium model identifier mistral-medium-2505
  • GPT-5 as the semantic category-consolidation model, creating evaluator dependence on one audited family

Instrumentos y métricas

  • Base JSON prompt requesting 20 diverse profiles with eight categorical attributes
  • Role prompt instructing the model to act as an expert UX researcher
  • Debiasing instruction requesting diversity in gender, age, ethnicity, socioeconomic background, abilities, and regions
  • Lowercasing, stemming, exact-profile deduplication, and GPT-5 semantic consolidation
  • Sixteen identity × social-dimension contingency tables
  • Raw Cramér's V and an incompletely specified degree-of-freedom-aware normalized severity score
  • Small/medium/high/very-high bins at 0.33, 0.66, and 1.0
  • Paired t-tests across dimensions or models and BH-FDR for pairwise model comparisons
  • ICC(C,1), ICC(A,1), Spearman, Kendall, and mean severity difference
  • Heatmap drill-downs for sexual orientation × occupation, gender × occupation, nurse × gender, and intersectional social class
  • Exploratory 1–4 human bias-severity rating with written justifications

Datos utilizados

  • Nominally 120,000 generated profiles: 10,000 per model before deduplication
  • 116,222 unique profiles after removing 3,778 exact duplicates according to Table 7
  • Sixteen normalized contingency tables per model over four identity and four social dimensions
  • Sample-size sensitivity sets of 5,000, 10,000, 15,000, and 20,000 profiles for six recent models
  • Role-playing and debiasing generations for six recent GPT-5/Mistral models; exact sample construction not fully specified
  • Nine-person exploratory comparison of two selected Gender × Occupation distributions

Evidencia y localización

  • Versión, estado y metadatos: arXiv:2602.00044v2 abstract and submission history; revised 24 February 2026
  • Prompt, modelos, temperatura y pipeline: arXiv v2, Sections 3.1–4.1 and Appendix A.1–A.2, Tables 6–7
  • Métrica, umbrales y falta de fórmula de normalización: arXiv v2, Section 3.2, Equation 1 and severity scale
  • Scores y comparaciones de 12 modelos: arXiv v2, Sections 4.2–4.4, Table 2 and Figures 1–5
  • Sensibilidad a tamaño, rol y debiasing: arXiv v2, Section 5, Tables 3–5
  • Error de la fila Mean de debiasing: arXiv v2 Table 5; independent arithmetic recomputation across the 16 printed rows
  • Zoom de género, ocupación y enfermería: arXiv v2, Appendices A.3–A.4, Figures 6 and Table 8
  • Validación humana exploratoria: arXiv v2, Appendix A.5, Table 9
  • Supuestos y umbrales de chi-cuadrado/Cramér V: Kim 2017, Statistical notes for clinical researchers: Chi-squared test and Fisher's exact test, DOI 10.5395/rde.2017.42.2.152
  • Referencia bibliográfica [38] errónea: arXiv v2 reference [38] versus arXiv:2401.12345 official record, Distributionally Robust Receive Combining
  • Ausencia de código y publicación definitiva: arXiv Code, Data and Media section plus targeted title/method/arXiv GitHub searches, checked 15 July 2026