Este trabajo estudia cómo cambian las respuestas de cinco LLM cuando el prompt asigna identidades demográficas a dos participantes de una situación social y si esa variación es mayor cuando existe desigualdad de poder. Es pertinente para persona prompting, pero no mide personalidad. Las personas combinan una etiqueta demográfica con un rasgo contextual generado para la escena; no hay cuestionarios, rasgos psicométricos, estabilidad temporal ni inferencia de una identidad interna del modelo.
GPT-4o genera 100 escenarios en diez dominios: trabajo, educación, sanidad, finanzas, política, justicia, vecindario, información, vivienda y asistencia social. En cada dominio hay cinco escenas donde Blake, el respondedor, tiene ventaja sobre Alex y cinco donde ambos están en pie de igualdad. Los escenarios se revisan manualmente. Alex es SUB y Blake RES; el modelo adopta a Blake y responde a Alex. Un límite esencial es que las 50 escenas con desigualdad y las 50 sin ella son situaciones distintas, no versiones emparejadas de una misma escena. Por tanto, cualquier diferencia entre condiciones de poder también puede deberse a roles, redacción, stakes y contenido.
El paper afirma evaluar nueve ejes demográficos, pero Table 2 y los datos finales contienen ocho: raza, identidad de género, edad, religión, posición política, discapacidad, nacionalidad y apariencia física. Sus tamaños producen 111 combinaciones SUB×RES dentro del mismo eje; al añadir una línea base sin demografía resultan 112 condiciones por escenario y 11.200 respuestas por modelo. No se prueban combinaciones entre ejes: una persona conjunta como «hombre caucásico ateo de mediana edad» nunca aparece como tratamiento experimental.
Se evalúan GPT-4o-mini, Llama 3.1 8B Instruct, Qwen 2 7B, Gemma 2 9B Instruct y Mistral 7B Instruct v0.3, a temperatura 0. La sensibilidad semántica es 1 menos la similitud coseno entre embeddings all-mpnet-base-v2 de la respuesta demográfica y su línea base. La calidad se aproxima con un juez GPT-4o-mini que compara ambas respuestas bajo Helpful-Honest-Harmless en los dos órdenes; el score final puede ser 0, 0,25, 0,5, 0,75 o 1. Después, el artículo llama «sesgo implícito» a la desviación estándar de esos promedios entre combinaciones demográficas. Estas son operacionalizaciones útiles para explorar, pero distancia, preferencia del juez y variabilidad no equivalen por sí solas a sesgo, daño o discriminación.
Los mínimos de distancia coseno suelen recaer, según modelo y lado del diálogo, en las etiquetas middle-aged, abled, native-born, average-looking, centrist, Caucasian y atheist. El paper interpreta esos mínimos como una «persona por defecto». La lectura fiel es más limitada: son prompts explícitos que cambian menos el contenido respecto a una respuesta base. No demuestran que el modelo sin prompt adopte internamente esas identidades. Además, el resultado de género no sostiene un default masculino único: Table 4 atribuye el mínimo de RES a male en 2/5 modelos y a female en 2/5. El abstract une mínimos marginales de ejes separados y los presenta como una persona masculina conjunta que no fue probada.
Las mayores distancias aparecen con frecuencia en pares asociados a edad, discapacidad mental, identidades non-binary/transgender, migración, apariencia, política y religión, aunque el patrón varía por modelo. El juez GPT-4o-mini también prefiere o penaliza distintos pares demográficos. Deben describirse como preferencias relativas de ese juez frente a una única respuesta base, no como calidad objetiva. Para GPT-4o-mini existe además autoevaluación: el mismo modelo que genera una de las familias de respuestas actúa como juez, sin comparación con otro juez.
En la comparación de poder, la desviación estándar de win rate aumenta en los cinco modelos. La variabilidad semántica aumenta en Gemma 2, GPT-4o-mini, Llama 3.1 y Mistral, pero disminuye en Qwen 2. La auditoría recompone los valores redondeados de Table 6 desde los CSV públicos. Esto confirma la estadística descriptiva, pero no un efecto causal de la desigualdad: las condiciones no usan escenas emparejadas y la métrica identifica dispersión entre celdas, no trato injusto validado.
La validación humana usa tres estudiantes voluntarios. El acuerdo entre humanos es bajo/fair (Fleiss κ=0,340); al incluir al juez AI es 0,393 y el Cohen κ humano-AI medio es 0,447. En una segunda fase se muestra a las personas el veredicto y la razón del AI antes de pedir acuerdo, por lo que el Likert alto valida plausibilidad después de exposición, no corrección independiente. Table 10 contiene un error: sus tres κ promedian 0,447 y sus tres Likert 4,117, pero la fila Mean imprime 0,452 y 4,207. El cuerpo sí usa las medias correctas. El formulario publicado dice 25 escenarios por sección, mientras el texto y la tabla hablan de 100 pares; no se explica el batching.
Los artefactos finales son internamente consistentes. Los cinco CSV contienen 56.000 filas: 11.200 por modelo, con 11.100 condiciones demográficas y 100 líneas base, sin claves experimentales duplicadas y con los mismos 11.100 cruces en todos los modelos. El CSV combinado original de Drive y los cinco CSV actuales coinciden celda por celda tras ordenar. El XLSX contiene 100 escenas, diez por dominio y 50/50 por condición de poder. La recomputación reproduce los valores de Table 6 a cuatro decimales.
La trazabilidad anterior al resultado es incompleta. generated_prompts.csv tiene 13.200 filas porque su eje Gender incluye también gay y lesbian: 36 pares en vez de los 16 del estudio final. Eliminar los 20 pares que incluyen esas etiquetas en 100 escenas explica exactamente las 2.000 filas descartadas, pero el release no documenta el filtro. El repositorio solo publica una visualización, datos y un notebook de agregación; no incluye código de generación, embedding, juicio, resultados por orden, anotaciones humanas, revisiones inmutables de modelos, entorno, tests, CI o licencia. Figure 8 también invierte las etiquetas de su prompt: el bloque marcado «power disparity present» pide igualdad y el marcado «absent» pide ventaja de RES, mientras Table 12 y los datos siguen la convención opuesta. Sin el código ejecutado no puede resolverse si es un error de figura o de procedencia.
La conclusión fiel es que, en 100 escenas generadas y bajo etiquetas demográficas explícitas, los modelos muestran cambios semánticos y preferencias de un juez LLM que varían por identidad; la dispersión del win rate es mayor en las escenas etiquetadas con desigualdad. El estudio no demuestra una personalidad sintética estable, una persona conjunta por defecto, causalidad independiente del contenido de la escena, calidad objetiva, daño real, interseccionalidad ni el origen del efecto en los datos de entrenamiento.