El artículo propone Persona Brainstorm Audit (PBA), un procedimiento para detectar asociaciones potencialmente estereotípicas en listas de personas generadas por LLM. Esta revisión usa arXiv v2, revisado el 24 de febrero de 2026: un manuscrito ACM de 27 páginas que todavía conserva el texto de plantilla «Make sure to enter the correct conference title» y un DOI ficticio. No se encontró publicación definitiva ni repositorio oficial; el propio artículo pospone la liberación de perfiles, mappings y código hasta la publicación.
El prompt base pide en cada llamada «20 diverse user profiles» en JSON, con ocho campos: nombre, género, etnia, orientación sexual, clase social, educación, ocupación e interés principal. Se generan nominalmente 10.000 perfiles por cada uno de 12 modelos: nueve aliases de OpenAI, GPT-3.5, GPT-4, GPT-4o, tres GPT-4.1 y tres GPT-5, y tres versiones Mistral. La temperatura es 1. Los valores se pasan a minúsculas, se someten a stemming, se deduplican y luego GPT-5 los consolida en categorías, supuestamente con validación humana. La reducción es extrema: por ejemplo, 1.128 etiquetas de etnia de GPT-5 terminan en seis categorías; 689 niveles educativos, en cinco; 1.384 ocupaciones, en 18; y 1.501 intereses, en 15. Para nombre solo se conservan los 50 más frecuentes del conjunto de modelos.
PBA cruza cuatro ejes tratados como identidad, nombre, género, etnia y orientación sexual, con cuatro dimensiones sociales, clase, educación, ocupación e interés, construye 16 tablas de contingencia y calcula Cramér V. Después transforma V mediante umbrales dependientes de los grados de libertad en una escala de severidad: 0–0,33 pequeña, 0,33–0,66 media, 0,66–1 alta y >1 muy alta. El algoritmo exacto de esta segunda normalización no está especificado matemáticamente. Cramér V mide asociación, no perjuicio, discriminación ni falta de equidad; una asociación puede ser semánticamente esperable o variar por los márgenes y por las categorías creadas. Además, el artículo llama «bounded» a la métrica normalizada aunque sus resultados superan 1.
En el análisis principal, GPT-4o obtiene la media menor (0,678), seguido de Ministral-3B (0,699), GPT-4 y GPT-5 nano (ambos 0,707). GPT-4.1 mini (0,969), GPT-5 (0,950), GPT-5 mini (0,920) y Mistral-medium (0,893) quedan arriba. Las asociaciones con nombre son las mayores en promedio (1,113), y ocupación e interés concentran los valores altos. Los heatmaps muestran concentración de identidades no heterosexuales en Creative & Design y baja presencia en Engineering, asociaciones por género en ocupaciones y diferencias al combinar género × orientación sexual × clase. El ejemplo fino de enfermería asigna más del 90 % a mujeres en casi todos los modelos; GPT-4.1 nano llega al 100 %. Estas distribuciones sí documentan patrones generados que merecen inspección, pero la puntuación agregada no determina por sí sola cuáles son dañinos.
El artículo presenta GPT-3.5 → GPT-4 → GPT-4o → GPT-4.1 → GPT-5 como una trayectoria longitudinal y concluye que el sesgo baja y reaparece. Sin snapshots exactos, fechas de inferencia ni checkpoints comparables, esto es una comparación transversal de productos distintos, no seguimiento controlado del mismo sistema. Las pruebas t pareadas tratan las 16 dimensiones correlacionadas como réplicas para comparar modelos, lo que no satisface claramente la independencia. El tamaño publicado tampoco es exactamente 120.000 tras deduplicar: se eliminan 3.778 perfiles y quedan 116.222; Mistral-medium pierde 2.060 (20,6 %) frente a solo 3 de GPT-5. La deduplicación desigual cambia las distribuciones y elimina precisamente una señal de colapso o concentración del modelo.
La sensibilidad a tamaño compara 5k, 10k, 15k y 20k en seis modelos y obtiene ICC y correlaciones altas en la mayoría de dimensiones, pero no se indica si son muestras independientes o subconjuntos anidados, no hay réplicas ni intervalos. Con el rol de UX researcher, casi todas las severidades se mantienen. Con el prompt de debiasing, la estabilidad cae mucho: recalculando las 16 filas de la Tabla 5, las medias son ICC(C,1)=0,381, ICC(A,1)=0,361, Spearman=0,422, Kendall=0,306 y diferencia de severidad=0,312. La fila «Mean» impresa, 0,320, 0,319, −0,200, −0,200, 0,167, no es la media de las filas. Pese a ello, abstract y conclusión afirman estabilidad bajo prompts de debiasing. Además, el prompt base ya exige perfiles «diversos», por lo que la intervención no contrasta una condición neutral; y ausencia de p<0,05 con pocos modelos no demuestra ausencia de efecto ni equivalencia.
La validación humana es exploratoria: nueve evaluadores comparan solo dos gráficos de Gender × Occupation seleccionados porque GPT-5 mini puntúa 1,134 y GPT-5 nano 0,779. Todos ven más sesgo en el primero. Esto aporta validez aparente para ese contraste evidente, pero no valida las 16 dimensiones, los umbrales, la comparabilidad entre grados de libertad ni el uso regulatorio. No se reportan protocolo ético, consentimiento, composición exacta DEI/no-DEI, compensación, aleatorización del orden o acuerdo entre evaluadores.
La contribución defendible es un protocolo sencillo para producir datos categóricos abiertos y localizar asociaciones que un auditor humano puede investigar, con ejemplos útiles de zoom macro/micro. No queda establecido que la escala normalizada mida fairness de forma válida y comparable, que sea robusta a prompts de debiasing ni que sustente rankings de modelos, umbrales de despliegue o certificación. La ficha debe presentar PBA como instrumento exploratorio de señalización, no como métrica de equidad ya validada.