CFaiRLLM: Consumer Fairness Evaluation in Large-Language Model Recommender System

Aplicaciones, sesgos y seguridad2025ACMRevisión editorial aprobada

Autores: Yashar Deldjoo, Tommaso Di Noia

Palabras clave: Information Retrieval, Computation and Language, Artificial Intelligence, Computers and Society

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
6
Hallazgos
14
Limitaciones
10
Evidencias

Resumen editorial

Español

CFaiRLLM estudia equidad del lado del consumidor en recomendadores basados en LLM; no usa perfiles psicológicos ni evalúa personalidad. Su punto de partida es que comparar una lista neutral con otra que incluye un atributo sensible puede confundir personalización legítima con sesgo. El marco añade dos elementos: contrasta las recomendaciones con interacciones futuras del usuario, que denomina “preferencias verdaderas”, y examina atributos interseccionales. Los perfiles se construyen seleccionando del historial 10 ítems al azar, mejor valorados o más recientes. GPT-3.5 genera recomendaciones para MovieLens-1M y LastFM-1K; GPT-4o mini también se prueba en LastFM. Los atributos son sexo binario, tres grupos de edad y sus seis intersecciones.

La evaluación compara listas neutrales y sensibles mediante Jaccard@K y PRAG@K, primero sobre todos los ítems y después conservando solo recomendaciones presentes en el test temporal de cada usuario. Las diferencias entre grupos se resumen con SNSR y SNSV, donde valores mayores significan mayor desigualdad. Sobre una muestra de 150 usuarios por dominio, el artículo encuentra que introducir atributos sensibles cambia las listas, que las brechas suelen crecer al combinar sexo y edad y que LastFM es menos estable que MovieLens. El muestreo del perfil importa: aleatorio suele favorecer la coincidencia Jaccard, mientras reciente o mejor valorado puede favorecer el orden PRAG; no hay una estrategia universal.

La afirmación central sobre la superioridad de la alineación con preferencias reales no queda demostrada de forma consistente. El propio ejemplo de sexo con muestreo aleatorio da SNSR 0,0210 y SNSV 0,0105 al filtrar por test, frente a 0,0010 y 0,0005 con similitud de listas: la desigualdad es 21 veces mayor, no entre tres y diez veces menor. Otros escenarios de mejor valorados sí muestran reducciones, por lo que la dirección depende del escenario. Además, “significativo” se usa sin tests, intervalos, repeticiones ni control por comparaciones. Un único muestreo aleatorio sin semilla y llamadas no repetidas a APIs cerradas impiden estimar variabilidad.

El filtro de test es una aproximación observacional a preferencia, no una verdad verificada: penaliza recomendaciones novedosas, hereda sesgos del comportamiento histórico y produce coincidencias muy escasas. El estudio no mide satisfacción, utilidad, exposición, daño, equidad de proveedores ni discriminación causal. Tampoco publica tamaños por subgrupo, protocolo reproducible para los 150 usuarios, snapshots completos del modelo, temperatura, semillas o código. Por ello, CFaiRLLM es relevante como propuesta de auditoría de recomendadores e interseccionalidad, pero no aporta evidencia sobre personalidad sintética, rasgos, neuroticismo ni explotación psicológica.

English

CFaiRLLM studies consumer-side fairness in LLM recommender systems; it neither uses psychological profiles nor evaluates personality. It argues that comparing a neutral recommendation list with one generated from a sensitive attribute can mistake legitimate personalization for bias. The framework adds two elements: it compares recommendations with a user's future interactions, which it calls “true preferences,” and evaluates intersectional attributes. Profiles contain 10 history items selected randomly, by highest rating, or by recency. GPT-3.5 produces recommendations for MovieLens-1M and LastFM-1K; GPT-4o mini is also tested on LastFM. Sensitive attributes are binary sex, three age groups, and their six intersections.

Neutral and sensitive lists are compared with Jaccard@K and PRAG@K, first over all items and then after retaining only recommendations present in each user's temporal test set. Across-group differences are summarized by SNSR and SNSV, where larger values mean greater disparity. In samples of 150 users per domain, sensitive attributes alter lists, intersectional gaps are often larger, and LastFM is less stable than MovieLens. Profile sampling matters: random sampling often favors Jaccard hit overlap, whereas recent or top-rated sampling can favor PRAG ranking agreement; no strategy dominates.

The central claim that true-preference alignment is consistently fairer is not supported consistently by the paper's own numbers. Its random-sampling sex example reports held-out SNSR .0210 and SNSV .0105, versus list-similarity SNSR .0010 and SNSV .0005-21 times higher disparity, not three to ten times lower. Some top-rated scenarios do show reductions, so direction depends on the setting. The paper also uses “significant” without tests, confidence intervals, repeated runs, or multiple-comparison control. One unseeded random sample and unrepeated calls to closed APIs do not quantify variability.

Held-out interaction is an observational preference proxy, not verified truth: it penalizes useful novelty, can reproduce historical behavioral bias, and yields very sparse overlaps. The study does not measure satisfaction, utility, exposure, harm, provider fairness, or causal discrimination. It also omits subgroup sizes, a reproducible 150-user sampling protocol, complete model snapshots, temperature, seeds, and public code. CFaiRLLM is therefore relevant as a recommender-auditing and intersectionality proposal, but provides no evidence about synthetic personality, traits, neuroticism, or psychological exploitation.

Pregunta de investigación

¿Cómo cambia la evaluación de equidad del consumidor en recomendadores con LLM al contrastar las listas con interacciones futuras, combinar atributos sensibles interseccionales y variar la selección de ítems del perfil?

Método

Se crea un perfil textual a partir de N=10 ítems del historial de cada usuario mediante muestreo aleatorio, por mejor valoración o por recencia. Se solicita a GPT-3.5 y, en LastFM, GPT-4o mini una lista neutral y listas condicionadas por sexo, edad o sexo×edad. Las listas se emparejan con el catálogo mediante expresiones regulares y difflib. Jaccard@K y PRAG@K cuantifican coincidencia de ítems y orden; SNSR y SNSV resumen disparidades entre grupos. Una segunda evaluación filtra las recomendaciones por las interacciones del test temporal del usuario.

Muestra: Se seleccionan 150 usuarios por dominio para reducir el coste de API. En MovieLens, el train reporta 150 usuarios, 2.537 ítems y 18.428 interacciones; el test, 150 usuarios, 1.590 ítems y 4.023 interacciones. En LastFM, el train reporta 149 usuarios, 21.967 ítems y 37.534 interacciones; el test, 150 usuarios, 7.308 ítems y 9.460 interacciones. No se publican semilla, procedimiento de representatividad, tamaños de los subgrupos sensibles ni repeticiones.

Hallazgos

  • Añadir sexo, edad o su intersección altera las recomendaciones respecto al prompt neutral; el cambio de lista no prueba por sí mismo sesgo o daño.
  • Las mayores brechas se observan con frecuencia en atributos interseccionales y en LastFM, un dominio más disperso y menos estructurado que MovieLens.
  • La estrategia que construye el perfil cambia los resultados. Aleatorio suele mejorar Jaccard, mientras recencia o mejores valoraciones pueden mejorar PRAG; ninguna domina en todos los modelos, dominios y atributos.
  • GPT-4o mini parece mostrar menores brechas que GPT-3.5 en varias comparaciones de LastFM, pero no hay repeticiones ni inferencia estadística para atribuir esa diferencia al modelo.
  • El tamaño del perfil modifica las métricas de manera no monótona. El texto y las figuras no son totalmente consistentes sobre los valores explorados: la visualización muestra 5, 10 y 20, mientras un pasaje menciona 5 y 15.
  • La afirmación de que la alineación con test produce brechas entre tres y diez veces menores contradice el ejemplo aleatorio de sexo: 0,0210/0,0105 frente a 0,0010/0,0005, es decir, 21 veces mayores para SNSR y SNSV.

Limitaciones

  • Las interacciones futuras se llaman “preferencias verdaderas”, pero solo son conducta observada. No verifican satisfacción y pueden contener sesgo histórico, popularidad, restricciones de exposición o ruido.
  • Filtrar por ítems ya presentes en el test penaliza toda recomendación novedosa y deja solapamientos muy escasos; las métricas resultantes pueden ser inestables.
  • SNSR y SNSV miden igualdad de estabilidad frente al prompt neutral, una definición limitada de equidad. No miden utilidad, calidad, satisfacción, exposición, daño, equidad de proveedores o discriminación causal.
  • Sexo se reduce a male/female y la edad a tres bins; no se justifican la validez, procedencia, consentimiento o exactitud de esos atributos.
  • No se informan los tamaños de los seis subgrupos interseccionales. Rangos y desviaciones pueden depender fuertemente de grupos pequeños o desequilibrados.
  • La muestra de 150 usuarios se denomina representativa sin protocolo, semilla o análisis de sensibilidad. LastFM incluso contiene 149 usuarios en train y 150 en test.
  • El muestreo aleatorio y las respuestas de API no se repiten. No hay semillas, intervalos, bootstrap, tests de hipótesis, corrección múltiple o análisis de potencia.
  • El artículo usa “significativo” de forma descriptiva y presenta una afirmación direccional incompatible con parte de sus propios resultados.
  • GPT-3.5 y GPT-4o mini son APIs cambiantes. Faltan snapshots exactos, fechas de ejecución, temperatura, mensajes de sistema, reintentos y otros parámetros necesarios para replicar las salidas.
  • El umbral de difflib usado para vincular títulos generados con el catálogo no se informa; errores de parseo o emparejamiento pueden alterar todas las métricas posteriores.
  • La transformación de reproducciones implícitas de LastFM a una escala 1–5 añade supuestos y no convierte esos valores en preferencias declaradas.
  • No se publica código, configuración ejecutable, prompts completos en formato reutilizable, logs, respuestas de los modelos o resultados tabulares para verificar las cifras.
  • Las celdas grises del apéndice se consideran no pertinentes, pero el texto interpreta algunos efectos cruzados; el criterio de inclusión no queda formalizado.
  • La evaluación es observacional y offline. No incluye usuarios, juicios humanos sobre calidad o equidad, experimentos longitudinales, auditoría de privacidad ni mitigaciones.

Qué no demuestra

  • No demuestra que cualquier diferencia entre una lista neutral y una lista sensible sea sesgo, injusticia o daño.
  • No establece que el historial de test sea una preferencia verdadera, completa o libre de sesgos de exposición.
  • No demuestra una superioridad universal de la alineación con test sobre la similitud de listas; sus resultados cambian de dirección según escenario y métrica.
  • No prueba que GPT-4o mini sea intrínsecamente más justo que GPT-3.5 ni que las brechas sean estadísticamente distintas de variación de muestreo o generación.
  • No permite inferir discriminación causal, experiencia de usuario, beneficio o perjuicio real a ningún grupo.
  • No estudia personalidad psicológica, Big Five, neuroticismo, perfiles psicométricos, identidad persistente ni explotación emocional por recomendadores.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2403.05668v3, submitted 8 March 2024, revised 20 February 2025; author preprint of ACM TIST 2025, 25 pages

Fuente consultada: https://arxiv.org/pdf/2403.05668v3

Revisión: Codex full-text, bilingual-fidelity, 25-page visual, arXiv-v3, ACM-TIST-2025, recommender-fairness, intersectionality, construct-validity, metric-consistency, statistical-claim, API-reproducibility, code-availability, privacy and personality-relevance audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-3.5
  • GPT-4o mini

Instrumentos y métricas

  • Random, top-rated and recent profile sampling
  • Neutral, sex, age and sex-by-age recommendation prompts
  • Regular-expression parsing and Python difflib title matching
  • Jaccard@K
  • PRAG@K pairwise ranking accuracy
  • Sensitive-to-Neutral Similarity Range (SNSR)
  • Sensitive-to-Neutral Similarity Variance (SNSV)
  • Temporal held-out interaction filter as a preference proxy

Datos utilizados

  • MovieLens-1M
  • LastFM-1K

Evidencia y localización

  • Motivación, alcance y contribuciones: Paper, pp. 1–4, Abstract, Introduction and Contributions
  • Marco CFaiRLLM, perfiles y atributos sensibles: Paper, pp. 8–12, Sections 3.1–3.3 and Figures 1–2
  • Jaccard, PRAG, alineación con test, SNSR y SNSV: Paper, pp. 12–14, Sections 3.4–3.5 and equations
  • Datasets, split temporal, muestra, modelos y parsing: Paper, pp. 14–16, Section 4.1 and Table 3
  • Resultados sobre métrica, interseccionalidad y modelo: Paper, pp. 16–19, Sections 4.2–4.4 and Figures 3–5
  • Muestreo, tamaño de perfil y contradicciones internas: Paper, pp. 19–20, Sections 4.5–4.6 and Figures 6–7
  • Conclusiones, limitaciones declaradas y trabajo futuro: Paper, pp. 20–22, Sections 5–7
  • Resultados numéricos detallados por atributo y estrategia: Paper, pp. 22–23, Appendix tables
  • Ausencia de artefacto reproducible citado: Paper, all 25 pages; no code or data release statement or repository URL
  • Inspección visual integral: Paper, all 25 rendered pages, including every figure, table and appendix page