El artículo estudia cinco LLM desplegados como clasificadores de discurso de odio bajo cuatro prompts de persona política. Su aportación más sólida es mostrar un compromiso operativo que una sola cifra oculta: los modelos clasificados como más «censurados» por una métrica externa producen más salidas utilizables y por eso logran mayor exactitud estricta, mientras los llamados «no censurados» clasifican mejor una vez que sí entregan una etiqueta binaria válida. También documenta que la redacción política mueve el umbral de decisión, sobre todo en el segundo grupo. No es, sin embargo, un experimento causal sobre safety alignment ni una prueba de ideología interna: compara solo cinco sistemas distintos, usa UGI como proxy de censura desplegada, no incluye condición sin persona y mezcla en la métrica principal errores semánticos, rechazos, filtros, fallos de API y problemas de formato.
La versión importa. El preprint v1 y varios registros todavía visibles informan 78,7 % frente a 64,1 %. La versión final reconoce que linajes anteriores habían eliminado silenciosamente filas no parseables, conserva las 65.340 respuestas esperadas y corrige el resultado a 69,0 % frente a 64,1 %. También cambia el ECE agregado a 0,060 y amplía la documentación de modelos y parsing. Esta auditoría usa exclusivamente arXiv v2 y el long paper de ACL 2026; el 78,7 % no es el resultado vigente. La rectificación es una fortaleza metodológica, aunque el paquete que permitiría comprobarla no está públicamente disponible en los lugares inspeccionados.
El benchmark es Latent Hatred, un corpus inglés de Twitter, Gab, Stormfront y Yahoo con 21.480 publicaciones: 1.089 de odio explícito, 7.100 de odio implícito y 13.291 no odiosas. Los autores toman las 1.089 explícitas y muestrean 1.089 implícitas y 1.089 no odiosas, para 3.267 posts equilibrados 1:1:1 por las tres categorías originales. Al fusionar explícito e implícito como HATE, la tarea binaria queda 2:1 frente a NOT_HATE. Por tanto, la exactitud global pesa el recuerdo de odio el doble que la clase no odiosa; los desgloses por tipo de contenido son esenciales para interpretarla.
Los cinco sistemas se eligen por Uncensored General Intelligence (UGI), un leaderboard comunitario que combina disposición a contestar y exactitud en preguntas controvertidas. El grupo de menor UGI, llamado «censored», contiene o3-mini, UGI 22,80, y Llama-3.1-405B-Instruct servido por Vertex AI, 18,48. El de mayor UGI, llamado «uncensored», contiene Mistral Medium, 56,77, GPT-4o-2024-08-06, 49,85, y Mistral Large 2411, 53,16. Que GPT-4o aparezca como «no censurado» muestra que estas etiquetas son operativas y relativas, no descripciones generales del producto. UGI no mide directamente RLHF, cumplimiento de políticas, jailbreak resistance o seguridad. Los autores aproximan capacidad con Elo de LMArena, pero arquitectura, escala, datos, familia, proveedor y filtros de despliegue siguen confundidos.
Cada post se presenta una vez a cada combinación de modelo y persona Progressive, Conservative, Libertarian o Centrist: 3.267 × 5 × 4 = 65.340 ejecuciones, a temperatura 0,7 y sin repeticiones. La salida JSON debe contener HATE, NOT_HATE o CANNOT_CLASSIFY, confianza 0-1 y razonamiento. Los prompts completos del apéndice son arquetipos políticos occidentales muy directivos. Progressive enfatiza justicia social, microagresiones y lenguaje codificado; Libertarian se opone a la censura en casi todas sus formas. Es esperable que cambien el umbral de moderación. No hay baseline sin persona ni manipulation check del razonamiento, así que los contrastes miden sensibilidad relativa a cuatro instrucciones, no desplazamiento desde conducta neutral ni una ideología latente estable.
La «strict accuracy» cuenta como error toda clasificación binaria incorrecta y también CANNOT_CLASSIFY, truncación, filtro del proveedor, error de transporte/API o JSON no recuperable. Es una medida útil de disponibilidad extremo a extremo: en producción, cualquier salida no accionable exige escalado humano. Pero no es exactitud semántica pura. En total, el 19,5 % de respuestas carece de predicción binaria y la exactitud estricta es 66,1 %. El grupo censored obtiene 69,0 % y el uncensored 64,1 %. La descomposición invierte la lectura simplista: en censored, 12,6 % son salidas nulas y 18,5 % errores de etiqueta; en uncensored, 24,2 % y 11,7 %. Condicionado a haber respondido con etiqueta utilizable, censored se equivoca 21,1 % y uncensored 15,4 %. La ventaja estricta del primero procede de responder de forma accionable con más frecuencia, no de discriminar mejor después de responder.
El patrón depende mucho del contenido. En odio explícito, uncensored es claramente mejor: 91,4 % frente a 76,0 %. En odio implícito, censored alcanza 74,7 % frente a 67,3 %. En publicaciones no odiosas, ambos son débiles y la diferencia es 56,2 % frente a 33,7 %. Esto sugiere distintos compromisos entre recuerdo de odio explícito, sensibilidad a señales implícitas y falsos positivos sobre contenido benigno. Entre subtipos implícitos, ironía es el más difícil con 64,4 %, seguido por incitación y amenaza en torno al 71 %; el agregado «other» llega a 83,1 %. Estas cifras son descriptivas del corpus y los cinco endpoints de julio de 2025, no propiedades permanentes de sus familias.
Por persona, la exactitud estricta agregada es 67,8 % Progressive, 66,7 % Centrist, 66,0 % Conservative y 63,7 % Libertarian. Progressive produce mayor tendencia a falsos positivos y menor a falsos negativos; Libertarian desplaza el umbral en sentido opuesto. El artículo llama a estas direcciones «liberal bias» y «conservative bias», pero son definiciones operativas ligadas a errores, no una validación externa de ideología. En censored, las cuatro medias varían solo 0,7 puntos; en uncensored, 6,7. Esto apoya mayor estabilidad relativa del primer grupo ante esos prompts, no que esté anclado en una posición neutral o políticamente correcta.
El análisis logístico agrupado por post informa interacción UGI × persona, Wald χ²(3)=101,279, p<0,001; el efecto conjunto de persona no es significativo dentro de censored, χ²(3)=3,341, p=0,342, y sí dentro de uncensored, χ²(3)=207,635, p<0,001. La precisión aparente debe tomarse con cautela. La categoría UGI se asigna al nivel del modelo y solo existen dos modelos frente a tres; agrupar por post no representa la incertidumbre de ese tratamiento de nivel modelo. El artículo no publica fórmula, coeficientes, errores, implementación de clusters ni código accesible. Tampoco hay draws repetidos, intervalos por seed, bootstrap pareado, efecto aleatorio de modelo o McNemar. Usar la misma temperatura no garantiza ruido simétrico o conservador entre proveedores, rechazos y métricas no lineales.
El análisis de grupos objetivo agrega 19.800 respuestas correspondientes a 990 posts anotados: 19.320 de odio implícito, 380 explícito y 100 no odiosas, ya multiplicadas por cinco modelos y cuatro personas. Un post puede pertenecer a varios grupos. Los n son respuestas repetidas, no observaciones independientes, y cada grupo tiene distinta mezcla de etiquetas y dificultad. Además, etiquetas próximas quedan separadas, black folks, blacks y black_people; jews y jewish_people; whites y white_people. El titular de 54,8 puntos compara non-whites, 91,2 %, con not specified, 36,3 %; «not specified» no es un grupo demográfico comparable. Como los resultados están agrupados sobre modelos y personas, tampoco identifican cuál origina una brecha. Hay heterogeneidad de rendimiento que merece seguimiento, pero no se demuestra por sí sola «protección desigual» en despliegue ni discriminación causal contra una comunidad.
La calibración se calcula solo entre el 80,5 % de salidas con etiqueta utilizable; los rechazos y fallos, precisamente la mayor diferencia entre grupos, quedan fuera. El ECE agregado es 0,060, moderado y no catastrófico. El problema más claro aparece condicionado al error: la confianza media de predicciones incorrectas es 80,1 % en odio explícito, 81,9 % en implícito y 84,1 % en no odio; el 57,0 % de los errores sobre no odio supera 0,8. Son advertencias importantes para human-in-the-loop, pero la confianza solicitada verbalmente no es una probabilidad obtenida de logits y un ECE pooled puede ocultar diferencias por modelo, clase y persona.
La reproducibilidad pública queda incompleta. El apéndice afirma que un bundle sellado el 20 de abril de 2026 contiene dataset canónico, requests, JSONL crudos, tabla combinada, figuras, lockfiles, code/07_audit_bundle.py y reproduce.sh. ACL Anthology solo enlaza PDF y checklist; arXiv solo contiene manuscrito y figuras. El repositorio público del primer autor, sanjerine/beyond-words, es una tesis de 2024, sin releases, con notebooks antiguos y una carpeta latest aún «in progress»; no contiene el experimento final. OpenReview quedó protegido por challenge y no permite excluir un suplemento no indexado. Por ello, los totales pueden comprobarse aritméticamente, pero no se pueden auditar respuestas, hashes, cleaning de targets, regresión o regeneración de figuras. La conclusión correcta es «no recuperado públicamente», no «inexistente».
El checklist oficial dice que se usaron artefactos y que se informan estadísticas, pero responde negativamente a si se documentó una revisión específica de contenido identificable u ofensivo y sus protecciones. Eso importa porque Latent Hatred conserva texto real de redes sociales. El artículo sí discute el uso dual de los prompts, la dignidad de grupos atacados y la subjetividad de las definiciones, pero no detalla auditoría de nombres de usuario, citas borradas, términos de plataformas o gobernanza de razonamientos crudos.
La lectura rigurosa conserva un resultado útil. Para estos cinco despliegues y este benchmark, los modelos de menor UGI son más fiables como servicio porque fallan menos en producir una salida accionable; los de mayor UGI reconocen mejor el odio explícito y cometen menos errores una vez que responden, pero son más frágiles a la redacción política y generan muchas más salidas nulas. La evidencia justifica separar disponibilidad, rechazo, discriminación, sensibilidad al prompt y calibración. No demuestra que safety alignment cause mejor detección, que UGI mida seguridad, que las personas revelen ideología interna, que exista una brecha de fairness en producción ni que los resultados generalicen más allá de cinco endpoints de 2025 y un corpus inglés.