El artículo propone auditar sesgos sociodemográficos mediante decisiones simuladas de agentes con personas generadas por el propio LLM. Es relevante para persona prompting y simulación social, pero no estudia personalidad sintética en sentido psicométrico: no mide rasgos, consistencia entre contextos, estabilidad temporal ni una identidad interna del modelo. Su objeto es la disparidad entre decisiones binarias producidas bajo etiquetas demográficas explícitas.
El experimento cruza tres grupos con 14 atributos: género (male, female, non-binary), raza/etnia (White, Hispanic/Latino, Black, Asian, Pacific Islander, Native American) e ideología política (cinco posiciones de very conservative a very liberal). Cada atributo se prueba en cuatro escenarios: evacuar ante una inundación incierta, obedecer una advertencia y no acudir a una protesta, compartir información negativa de un rival electoral y elegir entre astronauta o fontanero. Para cada combinación atributo×escenario y para cada modelo se generan 100 personas, de modo que la condición principal comprende 5.600 decisiones por modelo.
La técnica tiene dos pasos ejecutados con el mismo modelo. Primero se pide generar nombre, trasfondo, personalidad, preferencias y conducta esperable. En la condición principal, el prompt añade una pregunta específica de la tarea, por ejemplo cuán probable es que esa persona evacúe. Después, el modelo recibe esa persona y debe elegir una de dos acciones con una justificación. La métrica llamada sesgo implícito es demographic parity difference (DPD): la diferencia entre la tasa máxima y mínima del acto objetivo dentro de cada grupo sociodemográfico y escenario. La significación se decide comparando el DPD observado con el percentil 95 de simulaciones binomiales bajo paridad.
El comparador denominado sesgo explícito es una tarea distinta. El modelo ve que una persona ya tomó el acto objetivo y debe adivinar su género, raza/etnia o ideología entre una lista que incluye unknown; el prompt idéntico se repite 300, 600 o 500 veces según el número de atributos. El DPD se calcula sobre las frecuencias de etiquetas, tratando las respuestas unknown como no seleccionadas. Por tanto, la comparación acciones-versus-palabras contrapone generación de conducta condicionada por una persona explícita con inferencia demográfica desde una acción. Un modelo que responde unknown casi siempre obtiene DPD próximo a cero, aunque eso puede reflejar cautela o alineamiento de formato y no ausencia del mismo constructo medido en la simulación.
En GPT-4o, 11 de 12 cruces muestran DPD implícito significativo, con media 0,549 y desviación 0,317; el único no significativo es género en elección de carrera. Llama 3.1 y Mixtral-8x7B presentan 8/12 y 6/12 casos significativos. Las diferencias pueden ser extremas: 99/100 agentes etiquetados Asian obedecen la advertencia de la protesta, mientras 0/100 Black y 0/100 Native American lo hacen; 198/200 agentes conservative o very conservative eligen fontanero, frente a 124/200 liberal o very liberal que eligen astronauta. Estas cifras describen salidas de prompts, no comportamiento humano.
El análisis cualitativo identifica vocabulario estereotípico en dos casos seleccionados. Las justificaciones de agentes Asian mencionan seguridad, orden y autoridad con mucha más frecuencia; las de agentes Black o Native American, comunidad y resistencia. En carrera, las personas conservadoras se asocian con familia y comunidad, y las liberales con conocimiento y medioambiente. La versión publicada aclara que el equipo hizo codificación abierta y después recuentos de términos, pero no publica protocolo, codificadores, acuerdo, corpus ni código de análisis; tampoco demuestra que esas palabras causen la decisión.
En la familia GPT, el sesgo explícito reportado cae de 12/12 casos en GPT-3 a 9/12 en GPT-3.5-turbo, 0/12 en GPT-4-turbo y 1/12 en GPT-4o. El DPD implícito pasa de 2/12 casos y media 0,069 en GPT-3 a 10/12 y 0,549 en GPT-3.5-turbo, 9/12 y 0,513 en GPT-4-turbo, y 11/12 y 0,549 en GPT-4o. Esto respalda un salto grande respecto a GPT-3, pero no un aumento monotónico: la media baja entre GPT-3.5 y GPT-4-turbo y GPT-4o vuelve exactamente a 0,549. Los modelos no tienen snapshots inmutables ni una escala común de capacidad, por lo que «los modelos más avanzados son más sesgados» es una interpretación más fuerte que los resultados.
La ablación compara ausencia de persona, persona no contextualizada y persona contextualizada en GPT-4o, Llama 3.1 y Mixtral-8x7B. Las disparidades aparecen con mayor frecuencia cuando la persona se genera preguntando explícitamente por su conducta en la misma tarea. Esta observación es importante, pero también limita la inferencia: el paso de generación puede introducir una predicción demográfica estereotipada que el segundo paso simplemente conserva. Al usar el mismo LLM para construir y actuar la persona, el diseño no separa sesgo de generación, condicionamiento contextual y decisión.
La comparación con comportamiento real parte de 131 estudios localizados en Google Scholar. Se excluyen 84, quedan 47, se derivan 23 predicciones y solo se retienen seis apoyadas por varios artículos; las seis coinciden direccionalmente con GPT-4o. El paper reconoce que la publicación selectiva impide evaluar falsos positivos y que no puede comparar magnitudes por falta de control contextual. Por ello, el resultado válido es alineación de seis predicciones seleccionadas, no validación general de realismo. El abstract afirma además que los sesgos están «marcadamente amplificados», aunque el método dice que la magnitud humano-LLM no es comparable. No se publica protocolo reproducible, registro de cribado, evaluación de calidad ni extracción doble.
La versión FAccT conserva errores internos relevantes. En Results 5.1 llama «único caso insignificante» al de autoridad×ideología donde GPT-4o elige politically liberal en 500/500 repeticiones; con su propia definición ese DPD es 1 y es precisamente el único caso significativo. En el apéndice del prompt explícito de autoridad, después de «join the protest» se insertan por error las frases de evacuación y «the person decides to evacuate». Además, los textos de contexto para Negative Information Sharing y Career Path Selection aparecen intercambiados. Los resultados cualitativos parecen compatibles con los contextos correctos, pero sin el código ejecutado no puede determinarse si son erratas del apéndice o contaminación real del experimento.
La reproducibilidad es insuficiente. El paper enlaza `Yassellee/agent-decisions-bias` como futura liberación de datos y código, pero el commit público único contiene solo README, `.gitignore` y una licencia CC0: no hay código, datos, salidas, semillas, fechas de inferencia, revisiones exactas, dependencias, pruebas ni CI. Tampoco se corrige por múltiples comparaciones, el contraste implícito-explícito usa un t-test de dos muestras pese a que los 12 casos están emparejados, y el estudio se apoya en un único enunciado y orden de opciones por escenario.
La conclusión fiel es más acotada que el titular: bajo estas personas demográficas explícitas y estos cuatro dilemas binarios, varios LLM producen grandes diferencias entre tasas de decisión, especialmente cuando la generación de la persona está contextualizada con la misma conducta objetivo. El trabajo no demuestra sesgo implícito psicológico, personalidad estable, decisiones reales de agentes, representatividad humana, causalidad del atributo demográfico, una tendencia monotónica con la capacidad del modelo ni reproducibilidad de extremo a extremo.