Este artículo corto de SIGIR 2025 estudia si añadir instrucciones demográficas cambia la concordancia de cinco LLM con juicios humanos sobre sexismo; no evalúa personalidad psicológica ni demuestra que el modelo adopte una identidad. Usa 7.958 tuits bilingües de EXIST 2023: 6.920 de entrenamiento más 1.038 de desarrollo, no el test separado de 2.076. Cada tuit tiene seis etiquetas binarias, tres de mujeres y tres de hombres y dos por cada grupo 18-22, 23-45 y 46+, para 47.748 juicios. GPT-3.5, GPT-4, GPT-4o, Mistral Small 22B y Qwen2.5-14B producen una etiqueta con un prompt base y con instrucciones que añaden solo sexo o edad. El outcome es alfa de Krippendorff de razón entre la etiqueta del modelo y la proporción humana del grupo por tuit. En la ejecución base, los cinco modelos tienen mayor alfa con el agregado femenino que con el masculino: 0,415/0,371; 0,365/0,325; 0,228/0,191; 0,353/0,310; y 0,378/0,345. Esto describe concordancia diferencial, no identifica por sí solo sesgo causal, personalidad femenina ni qué grupo es normativamente correcto. Por edad no hay dirección común. Las personas demográficas producen efectos mixtos: el prompt femenino eleva el acuerdo objetivo de GPT-4, GPT-4o y Mistral; el masculino solo el de GPT-4 y Qwen. GPT-4 y Qwen mejoran en sus tres condiciones de edad, GPT-3.5 solo en 46+, GPT-4o en ninguna y Mistral en 18-22 y 23-45 pero no en 46+. El texto afirma erróneamente que Mistral mejora consistentemente: la tabla baja de 0,392 a 0,383 para 46+. La lectura defendible es que una frase demográfica puede mover el acuerdo de modo dependiente del modelo y no fiable como mitigación. La selección del prompt también limita la inferencia: tres candidatos se probaron sobre veinte tuits y se eligió el de mayor coincidencia entre tres LLM (75%, frente a 70% y 55%); o1-preview lo reescribió después. El criterio fue consistencia entre modelos, no validez humana, calibración o reducción de sesgo, y no hay confirmación reservada. Cada celda final contiene una sola predicción por tuit; no se estiman repetición, paráfrasis o deriva de API, los cambios para Mistral/Qwen no se especifican y se agregan inglés y español sin desglose. La auditoría estadística descubre un problema sustantivo. Las tasas demográficas son observaciones emparejadas en los mismos tuits, pero el código usa t-test independiente y ANOVA/Tukey independientes. El artefacto reproduce p=0,237; respetando el emparejamiento, la diferencia mujer-hombre es solo 0,00716, pero el t-test pareado da p=0,0463 y Wilcoxon p=0,000383. Cambia la decisión nominal sin convertir 0,72 puntos porcentuales en un efecto grande. Las diferencias de edad siguen detectándose con Friedman emparejado, aunque los post hoc deben rehacerse. Los intervalos tampoco son reproducibles. El paper afirma 10.000 bootstraps e intervalos menores de 0,001, pero la función pública transpone la matriz 2x7.958, la aplana, remuestrea celdas y la reconstruye 7.958x2; la librería interpreta entonces otra estructura y se rompe el emparejamiento. Para mujer-hombre, el alfa objetivo es 0,4768 y el callback defectuoso 0,000254. En 500 remuestreos de auditoría, un bootstrap correcto da aproximadamente [0,4578; 0,4955], mientras el público produce un intervalo estrecho alrededor de cero. El commit previo al paper llama esta función 10.000 veces; como no hay outputs finales, no puede probarse qué ejecución generó el manuscrito, pero si se usó esta función sus intervalos no acotan las tablas. La distancia también importa: alfa de intervalo da 0,647 en vez de 0,477. El repositorio coincidente del primer autor compila, pero no está enlazado ni versionado en el paper y carece de dataset, predicciones finales, outputs Mistral/Qwen, CSV, intervalos, logs y tablas; el JSON intermedio no coincide en varios alfas. No hay tests, CI, tag o release; Ruff encuentra 68 incidencias y el entorno omite OpenAI. La capa API captura cualquier excepción y devuelve None sin publicar tasas finales de fallo. Tampoco hay prueba de contaminación: la nota de que las etiquetas no eran públicas no sostiene una garantía, porque el experimento usa train y desarrollo distribuidos por los organizadores. Las tablas apoyan una advertencia práctica sobre inestabilidad del persona prompting simple, no identidad, empatía, personalidad, equidad ni generalización.
Pregunta de investigación
¿Con qué grupos demográficos de anotadores concuerdan más cinco LLM al clasificar sexismo en EXIST 2023, y añadir sexo o edad al prompt desplaza de forma fiable esa concordancia hacia el grupo indicado?