El artículo presenta un marco para estudiar incertidumbre y equidad en recomendaciones generadas por LLM y un experimento con un endpoint denominado Gemini 1.5 Flash. La contribución empírica defendible es más estrecha que el abstract: se comparan listas de canciones y películas generadas con un prompt neutral frente a prompts que añaden etiquetas demográficas. Esto permite observar sensibilidad a la formulación de la persona, pero no mide personalidad psicométrica, calidad de recomendación, perjuicio de equidad ni incertidumbre predictiva propia. Se auditaron las 15 páginas de arXiv v1, las 9 páginas del apéndice y el ZIP oficial de código y datos en el commit 3c5ff5e.
El paper formula dos preguntas. RQ1 pregunta cómo afecta la incertidumbre predictiva, supuestamente cuantificada mediante entropía, a la fiabilidad. RQ2 pregunta si la desigualdad observada en Gemini persiste entre atributos sensibles, dominios, errores tipográficos y prompts multilingües. Sin embargo, RQ1 no contiene un experimento de los autores: es una síntesis narrativa de estudios previos resumidos en la Tabla 2. No se define ni estima una entropía sobre sus salidas, no hay muestreo repetido, probabilidades de token, calibración, tabla de resultados o análisis de asociación entre incertidumbre y exactitud. El artefacto tampoco contiene la palabra o cálculo de entropía. La conclusión de que la incertidumbre degradó la fiabilidad de este experimento y que el marco incorpora cuantificación a nivel de token no está sustentada por datos propios.
El experimento liberado cubre películas y música. El texto describe 1.000 directores, 500 populares según umbrales IMDb y 500 curados manualmente, y 1.000 artistas tomados de una lista MTV. Para cada anchor se solicita un top-25. Los prompts sensibles añaden una etiqueta antes de “fan of [nombre]” y se comparan con el prompt neutral. El paper dice que hay ocho atributos y 31 valores. Su Tabla 1 enumera 30, mientras el JSON liberado tiene 32: edad 3, nacionalidad 7, género 4, continente 3, ocupación 5, raza 4, religión 4 y descripción física 2. La diferencia se debe a que el artefacto incluye boy y girl además de male y female.
La construcción de categorías tiene problemas de validez. Boy/girl mezclan edad con género; American aparece como continente; African American, black, white y yellow mezclan raza y etnia e incluyen una etiqueta racial ofensiva; fat/thin se guardan bajo physics; y Buddhist, Christian, Hinduism e Islamic mezclan adjetivos de persona y nombres de religión. No hay validación humana de equivalencia, naturalidad o interpretación de prompts. Por ello, una diferencia puede proceder de la forma léxica, el error semántico o el estereotipo inducido por el propio prompt, no del trato a un grupo bien definido.
La configuración tampoco coincide plenamente con el paper. El texto afirma búsqueda greedy con temperatura, top_p y frequency_penalty a cero. El código solo fija temperature=0 sobre el alias flotante gemini-1.5-flash; no fija top_p, frequency penalty, seed, revisión inmutable o fecha de consulta. El script musical tiene por defecto 500 anchors, y el notebook calcula explícitamente música con n=500 pese a describir 1.000. La fuente de artistas tiene 2.999 filas, no una selección documentada de 1.000. El archivo de directores tiene 1.000 filas pero solo 949 nombres únicos.
Los scripts publicados parecen instantáneas parciales del proceso. El runner musical quedó configurado con sistema francés y un prompt en francés que pide títulos de películas, aunque procesa artistas. El runner de películas usa sistema y plantilla en inglés incluso para la carpeta french: solo la etiqueta insertada está en francés. Los launchers solo ejecutan música francesa y películas neutral, nacionalidad y francés; no reconstruyen todas las carpetas liberadas. El notebook fija n=500 en la función principal de SNSR/SNSV para cualquier dominio. Por tanto, el estado publicado no reproduce la adquisición ni todos los resúmenes sin reparaciones manuales no documentadas.
Las llamadas tampoco producen conjuntos completos. Música tiene 491 filas neutrales y entre 485 y 494 por archivo sensible, con anchors faltantes distintos; películas tiene 975 filas neutrales, solo 926 nombres únicos y aproximadamente 965–984 filas por condición, con 46–49 duplicados típicos. El parser exige líneas con el patrón número-punto-espacio. Entre todos los archivos devuelve cero ítems para 155 listas musicales y 728 de películas; también aparecen longitudes de 23, 24, 26 o 27. El análisis convierte cada archivo en un diccionario por nombre, sobrescribe duplicados, silencia excepciones y compara solo anchors presentes y parseables en ambos lados. El n emparejado efectivo varía por grupo y nunca se publica, introduciendo una selección no cuantificada.
La métrica base Jaccard mide el solapamiento entre el top-25 neutral y el sensible. SNSR es el rango entre las similitudes medias de los valores de un atributo y SNSV su desviación estándar poblacional. Estas cifras describen dispersión de listas; no identifican por sí mismas un grupo perjudicado ni miden relevancia, satisfacción, representación, exposición, asignación o daño. El marco presupone que parecerse al prompt neutral es más justo, pero no valida el neutral como baseline normativo ni dispone de preferencias o ground truth. Personalización legítima, ruido, errores del parser y estereotipos pueden producir la misma señal.
Incluso las fórmulas y el código divergen. La implementación SERP* pondera posiciones solo en una lista y usa una normalización distinta de la Ecuación 8; una lista idéntica de 25 elementos no alcanza el máximo unitario que implica la ecuación. PRAG* también difiere entre la Ecuación 9 y los bucles liberados. El apéndice llama a SERP* y PRAG* “higher = unfairer”, aunque el texto los define como similitud o acuerdo de ranking y después interpreta una caída como degradación. No existe una dirección coherente para todas las afirmaciones.
La Tabla 3 y la Tabla VIII contienen errores materiales de asignación. En películas, la secuencia Jaccard publicada corresponde exactamente a columnas del CSV en el orden raza, religión, continente, ocupación, país, físico, género y edad, pero el encabezado la renombra religión, continente, ocupación, país, raza, edad, género y físico. En música, la secuencia procede principalmente del orden religión, raza, continente, país, edad, género, ocupación y físico, también con etiquetas desplazadas. Así, el .1363 destacado en el abstract corresponde en el CSV a race/música, no al encabezado impreso de continente. El .0507 destacado no coincide con el SNSV musical de raza (.056084) ni continente (.042542) y se aproxima al valor de continente/películas (.050248), señal de mezcla adicional.
Los problemas son mayores en SERP* y PRAG*. Para películas, la tabla informa SNSR SERP entre .0190 y .0009, mientras el CSV liberado contiene .134154 a .012743; no existe un mapeo coherente. En el apéndice varios mínimos SERP son mayores que sus máximos y el SNSR no es max−min. Los SNSR PRAG de película publicados (.0705 a .0069) tampoco reproducen el CSV (.364045 a .026611). En música algunas celdas siguen el CSV, pero otras no: el PRAG físico publicado .0966 contrasta con .015631 liberado. Por tanto, solo pueden describirse con confianza los valores del artefacto bajo su implementación, no asumir correcta toda la tabla del paper.
Usando los resúmenes liberados, Jaccard muestra mayor rango en música para religión (.347867) y raza (.136282), y en películas para raza (.259877) y religión (.151257). Esto sí apoya heterogeneidad de solapamiento entre las etiquetas creadas por los autores. No prueba qué lista es mejor, si alguien fue perjudicado ni que el patrón sea estable: hay una sola salida por condición, alias mutable, muestras efectivas variables y ningún intervalo, test, bootstrap o corrección múltiple. La sección de amenazas afirma usar tests estadísticos estandarizados y datasets grandes representativos, pero no se reporta o implementa ningún test.
La afirmación de personalidad tampoco se materializa. Los datos varían demografía, ocupación, nacionalidad, cuerpo, typos y francés; no incluyen Big Five, introversión/extraversión, inventario validado o perfil estable. El apéndice menciona diferencias entre personas extrovertidas e introvertidas, pero no existen esos archivos. Big Five aparece únicamente como trabajo futuro. Añadir “Based on my personality” a una instrucción no convierte edad o raza en personalidad. Tampoco existe código para PAFS, datos intermedios o resumen derivado: todos los valores PAFS de las tablas quedan sin soporte reproducible. No se evalúa utilidad de personalización ni un trade-off formal con equidad.
La prueba francesa tampoco es una traducción controlada: en música cambia el idioma y además el dominio verbal a películas; en cine deja la mayor parte del prompt en inglés. Los errores tipográficos comparan formas distintas sin repeticiones. Las curvas demuestran sensibilidad de esas ejecuciones, no robustez multilingüe general ni persistencia estadística de desigualdad.
El repositorio aporta 84 CSV de salidas y permite auditar parcialmente el comportamiento, pero carece de README, licencia, lock de dependencias, tests, CI, release y protocolo ejecutable integral. Su ZIP público contiene además una credencial de Google incrustada en ambos launchers. No se usó ni se registró su valor en esta auditoría; el propietario debe revocarla, rotarla y eliminarla del artefacto e historial. Esta exposición es un defecto crítico de seguridad y de práctica reproducible.
La conclusión fiel es que un conjunto grande pero incompleto de prompts demográficos produjo listas distintas bajo un endpoint Gemini 1.5 Flash, y los CSV liberados muestran heterogeneidad en solapamiento. Es una alerta útil sobre sensibilidad a personas textuales y sobre la necesidad de protocolos rigurosos. No establece entropía predictiva propia, personalidad, PAFS, exactitud, grupos desfavorecidos, daño, significación, robustez multilingüe, generalización a RecLLM ni reproducción exacta de las tablas publicadas.