PerFairX: Is There a Balance Between Fairness and Personality in Large Language Model Recommendations?

Aplicaciones, sesgos y seguridad2025IEEERevisión editorial aprobada

Título original: PerFairX: Is There a Balance Between Fairness and Personality in LLM Recommendations?

Autores: Chandan Kumar Sah, Xiaoli Lian

Palabras clave: personality-based recommendation, fairness evaluation, OCEAN model, LLM recommender systems, demographic equity, personalization trade-offs, zero-shot learning

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
48
Hallazgos
118
Limitaciones
22
Evidencias

Resumen editorial

Español

Sah y Lian presentan PerFairX, un marco exploratorio para comparar personalización por rasgos OCEAN y disparidad demográfica en recomendaciones generadas por LLM. El estudio infiere perfiles de personalidad a partir de preferencias de género, selecciona cinco usuarios de MovieLens 10M y cinco de Last.fm 360K, y solicita a ChatGPT y DeepSeek listas top-15 con un prompt genérico y otro sensible a la personalidad. Define diez métricas, aunque solo informa ocho en la comparación final y las agrega con pesos iguales. DeepSeek aumenta su Personality Alignment Score de 0,280 a 0,848 en MovieLens y de 0,315 a 0,872 en Last.fm; ChatGPT, en cambio, baja ligeramente de 0,749 a 0,739 y de 0,782 a 0,728. En ambos modelos y dominios disminuye la alineación género-personalidad y aumentan DP y EO con el prompt sensible, mientras mejora la diversidad intralista. Los FPx publicados favorecen a DeepSeek, pero dependen de una suma no validada con pesos iguales y sin incertidumbre. La evidencia no sostiene un benchmark reproducible: no se identifican snapshots de los modelos, ejecuciones repetidas, código, datos derivados ni protocolo de emparejamiento de títulos. Además, MovieLens 10M declara oficialmente que no contiene datos demográficos, aunque el artículo calcula género, edad y ocupación sin explicar otra fuente; y el texto afirma que ChatGPT tiene menor sesgo pese a que sus propias tablas muestran DP y EO menores para DeepSeek. PerFairX aporta un vocabulario útil para discutir tensiones entre personalización y equidad, pero este experimento pequeño, circular y contradictorio no valida personalidad psicológica, equidad causal ni superioridad general de un modelo.

English

Sah and Lian present PerFairX, an exploratory framework for comparing OCEAN-trait personalization with demographic disparity in LLM-generated recommendations. The study infers personality profiles from genre preferences, selects five MovieLens 10M users and five Last.fm 360K users, and asks ChatGPT and DeepSeek for top-15 lists under a generic prompt and a personality-sensitive prompt. It defines ten metrics, although only eight enter the final comparison and they are aggregated with equal weights. DeepSeek's Personality Alignment Score rises from 0.280 to 0.848 on MovieLens and from 0.315 to 0.872 on Last.fm; ChatGPT instead declines slightly from 0.749 to 0.739 and from 0.782 to 0.728. For both models and domains, genre-personality alignment falls and DP and EO increase under the sensitive prompt, while intra-list diversity improves. The reported FPx scores favor DeepSeek, but they depend on an unvalidated equal-weight sum with no uncertainty analysis. The evidence does not support a reproducible benchmark: exact model snapshots, repeated runs, code, derived data, and the title-matching protocol are absent. MovieLens 10M also states officially that it contains no demographic information, yet the paper computes gender, age, and occupation without explaining another source; and the prose calls ChatGPT less biased even though its own tables report lower DP and EO for DeepSeek. PerFairX offers useful vocabulary for discussing personalization-equity tensions, but this small, circular, and internally contradictory experiment does not validate psychological personality, causal fairness, or general model superiority.

Pregunta de investigación

¿Cómo cambia la alineación entre recomendaciones y rasgos OCEAN inferidos cuando ChatGPT y DeepSeek reciben prompts neutrales o sensibles a la personalidad, qué efecto tiene ese cambio sobre disparidades demográficas y diversidad intralista, y qué modelo obtiene el mejor compromiso según el agregado PerFairX?

Método

El artículo filtra supuestamente usuarios con al menos 200 interacciones, infiere un vector OCEAN de cinco dimensiones mediante afinidad de género, dispersión de puntuaciones, actividad temporal y diversidad de catálogo, y vincula manualmente géneros como ciencia ficción, documental, romance, indie o jazz con rasgos. Selecciona cinco perfiles de MovieLens 10M y cinco de Last.fm 360K. Para cada perfil consulta ChatGPT y DeepSeek con un prompt neutral y otro personalizado y obtiene quince recomendaciones. Calcula PAS y GPA para ajuste de personalidad; DP, EO e ILF para disparidad o diversidad; SNSR, SNSV y Jaccard para sensibilidad al prompt; y Precision@15 y Recall@15 para relevancia. La comparación publicada muestra ocho métricas y construye FPx sumando PAS, GPA, 1-DP, 1-EO, ILF, Jaccard, Precision y Recall con pesos iguales. Aparte, Figure 1 informa una encuesta en redes sociales con 120 personas sobre una sola viñeta de tres celebridades y compara su elección con cuatro LLM no especificados completamente.

Muestra: La evaluación principal usa diez perfiles: cinco de MovieLens 10M y cinco de Last.fm 360K. Con dos modelos y dos condiciones de prompt, el diseño implica cuarenta listas top-15 si cada combinación se ejecutó una vez; el paper no informa repeticiones, semillas ni número final de llamadas. Table 1 describe 17,4 mil mujeres y 43,6 mil hombres en MovieLens y 2 mil mujeres y 8 mil hombres en Last.fm, pero no explica cómo obtiene esos subconjuntos. La fuente oficial de MovieLens 10M registra 71.567 usuarios y ningún atributo demográfico; la fuente oficial de Last.fm 360K registra 359.347 usuarios y 17.559.530 líneas, muy por encima de los 598 mil registros declarados en Table 1. El estudio introductorio de Figure 1 recluta 120 personas mediante LinkedIn, Facebook, X y WeChat; no informa sus características, consentimiento, compensación ni control de duplicados.

Hallazgos

  • El trabajo se publicó en IEEE/CVF ICCV Workshops 2025, Multimodal Continual Learning, páginas 2771-2780, con DOI 10.1109/ICCVW69036.2025.00289.
  • La copia abierta de CVF declara ser idéntica a la versión aceptada salvo por la marca de agua.
  • El PDF final inspeccionado tiene diez páginas y sha256 2c7a7a66a12e37db97a904922746dabe0fa98ace5ee256ea58a7d3e31ac55515.
  • La versión final y arXiv v1 conservan el mismo estudio; la comparación tokenizada alcanza 0,9433 y las diferencias observadas son principalmente tipográficas, de maquetación y metadatos.
  • La ficha y BibTeX oficiales de CVF enumeran a Chandan Kumar Sah y Xiaoli Lian, pero la portada visible, arXiv, DBLP y el registro Crossref del DOI solo muestran a Sah; los metadatos internos del PDF sí incluyen ambos nombres.
  • El experimento principal no evalúa toda la población de los datasets: utiliza cinco perfiles de películas y cinco de música.
  • Cada perfil recibe un prompt neutral y otro sensible a la personalidad para producir quince recomendaciones con ChatGPT y DeepSeek.
  • El enlace de ChatGPT apunta a documentación de GPT-4o, pero no identifica modelo fechado, versión de API ni snapshot.
  • DeepSeek se identifica solo mediante la documentación genérica de su API.
  • Los vectores OCEAN no proceden de un cuestionario: se infieren de afinidad de género, dispersión de ratings, actividad temporal y diversidad de catálogo.
  • El artículo asocia manualmente ciencia ficción y documental con Apertura, romance con Amabilidad, indie y jazz con Apertura y documental o clásica con Responsabilidad.
  • PAS vuelve a proyectar los géneros recomendados sobre un vector de rasgos construido con ese mismo tipo de asociación, creando una evaluación circular.
  • El marco define diez métricas: PAS, GPA, DP, EO, ILF, SNSR, SNSV, Jaccard, Precision y Recall.
  • Los resultados no presentan valores de SNSR ni SNSV.
  • En la sección de resultados SNSR y SNSV cambian de nombre a Semantic Novelty Similarity Ratio y Semantic Novelty Sensitivity Variation, sin reconciliarlo con sus definiciones.
  • Table 4 compara ocho métricas y Figure 5 solo grafica siete, aunque el texto habla de ocho.
  • En MovieLens, el PAS de DeepSeek sube de 0,280 con prompt neutral a 0,848 con prompt sensible.
  • En Last.fm, el PAS de DeepSeek sube de 0,315 a 0,872.
  • El PAS de ChatGPT no mejora: baja de 0,749 a 0,739 en MovieLens y de 0,782 a 0,728 en Last.fm.
  • Por tanto, la afirmación general de que el prompting sensible mejora significativamente la alineación no se cumple para ChatGPT en la propia Table 2.
  • GPA desciende bajo el prompt sensible en las cuatro combinaciones: 0,709 a 0,407; 0,713 a 0,336; 0,695 a 0,421; y 0,731 a 0,352.
  • DP y EO aumentan con el prompt sensible para ambos modelos y datasets, lo que el protocolo interpreta como mayor disparidad demográfica.
  • ILF aumenta en las cuatro combinaciones; el cambio más grande es DeepSeek-MovieLens, de 0,475 a 0,968.
  • Table 4 muestra menor DP y EO para DeepSeek que para ChatGPT bajo el prompt sensible en ambos dominios.
  • La prosa posterior afirma que ChatGPT mantiene menor disparidad en DP y EO, en contradicción directa con Table 4.
  • En MovieLens sensible, DP/EO son 0,825/0,952 para ChatGPT y 0,726/0,901 para DeepSeek.
  • En Last.fm sensible, DP/EO son 0,801/0,935 para ChatGPT y 0,711/0,884 para DeepSeek.
  • DeepSeek obtiene mayor Precision@15 y Recall@15, pero los valores absolutos siguen siendo bajos: como máximo 0,165 y 0,045.
  • El agregado FPx usa PAS + GPA + (1-DP) + (1-EO) + ILF + Jaccard + Precision + Recall con pesos iguales.
  • Los cuatro FPx de Table 5 se reproducen exactamente con esa suma: 1,994 y 2,895 en MovieLens; 2,022 y 2,961 en Last.fm.
  • La superioridad de DeepSeek en FPx depende en gran parte de la gran diferencia de ILF y de una elección de pesos sin validación o análisis de sensibilidad.
  • Table 4 marca Jaccard con flecha hacia abajo, pero la definición y la fórmula FPx tratan un Jaccard mayor como más estabilidad y mayor puntuación.
  • No se publican desviaciones, intervalos, p-valores ni pruebas que sustenten el uso de 'significativamente'.
  • El texto afirma que cambian las percepciones de equidad, confianza y satisfacción, pero el experimento principal no mide ninguno de esos tres constructos con personas.
  • MovieLens 10M declara oficialmente que no contiene información demográfica, mientras Table 1 atribuye género, edad y ocupación sin describir una fuente externa o enlace.
  • Los 61.000 usuarios por sexo que Table 1 atribuye a MovieLens no pueden ser todos el conjunto filtrado a 200 interacciones: el mínimo serían 12,2 millones de ratings, por encima de los 10.000.054 del dataset completo.
  • La fuente oficial de Last.fm 360K informa 359.347 usuarios y 17.559.530 líneas; Table 1 usa 10.000 usuarios por sexo y 598.000 registros sin explicar la reducción.
  • No se explica cómo se enlazan los títulos o artistas en texto libre de los LLM con identificadores de dataset para calcular Precision y Recall.
  • El prompt neutral pide contenido popular para una audiencia general, mientras el sensible pide ajuste individual; la comparación cambia simultáneamente popularidad, objetivo y perfil.
  • Los ejemplos sensibles incluyen además edad y género, de modo que no aíslan el efecto de la personalidad.
  • Figure 3 etiqueta listas de romance para una mujer joven y amable como personalizadas pero injustas, sin demostrar que la estrechez de género equivalga a discriminación demográfica.
  • Figure 1 informa que el 80% de 120 evaluadores eligió a Elon como menos probable consumidor de Interstellar.
  • El texto afirma que cuatro LLM ignoraron esa elección, pero la propia Figure 1 muestra que DeepSeek seleccionó a Elon.
  • La mayoría humana de una viñeta estereotipada no constituye una preferencia real observada ni una verdad psicológica.
  • No existe enlace a código, prompts completos, salidas crudas, perfiles, particiones o resultados reproducibles.
  • El artículo no describe experimentos multimodales ni aprendizaje continuo pese a publicarse en ese workshop y usar esos términos en la conclusión.
  • Los agradecimientos declaran apoyo del Software Engineering Institute de Beihang University y una Chinese Government Scholarship.
  • El trabajo plantea preguntas relevantes, pero la evidencia publicada no alcanza el estándar de un benchmark validado y reproducible.

Limitaciones

  • La evaluación principal usa solo diez perfiles.
  • No se justifica por qué cinco perfiles por dominio son representativos.
  • No se publica la identidad o el vector completo de los diez perfiles.
  • No se informa el procedimiento de muestreo de perfiles.
  • No se informa una semilla de selección.
  • No se repite el muestreo con otros perfiles.
  • No se informa cuántas ejecuciones se realizaron por combinación.
  • No se informa temperatura, top-p, semilla ni parámetros de decodificación.
  • No se informa la fecha de las llamadas a las API.
  • No se identifica el snapshot exacto de GPT-4o o ChatGPT.
  • No se identifica el modelo exacto de DeepSeek.
  • No se informa si las respuestas fallidas o no parseables fueron regeneradas.
  • No se publica el system prompt.
  • Solo se muestran ejemplos parciales de prompts sensibles.
  • Figure 3 presenta más de una redacción neutral y sensible, sin aclarar cuáles produjeron las tablas.
  • El prompt neutral y el sensible no difieren únicamente en personalidad.
  • El prompt neutral optimiza popularidad y generalidad.
  • El prompt sensible cambia también tono, preferencias, exclusiones y en algunos ejemplos atributos demográficos.
  • La comparación no permite atribuir causalmente las diferencias a OCEAN.
  • La personalidad se infiere de comportamiento sin un instrumento psicométrico observado.
  • No se publica la ecuación completa que transforma interacciones en cada dimensión OCEAN.
  • No se publican pesos para afinidad de género, dispersión, actividad temporal y diversidad.
  • No se publican umbrales para determinar rasgos dominantes.
  • No se publica la tabla completa de correspondencias entre géneros y rasgos.
  • Las correspondencias género-rasgo se apoyan en asociaciones poblacionales y se aplican como si describieran individuos.
  • No se valida el vector inferido contra autoinforme OCEAN de los usuarios.
  • No se informa fiabilidad test-retest de los perfiles.
  • PAS evalúa con la misma familia de asociaciones usada para construir el perfil.
  • GPA comparte la misma circularidad entre rasgos inferidos y géneros recomendados.
  • Una puntuación PAS alta puede reflejar obediencia a palabras del prompt y no personalidad estable.
  • El estudio no mide conducta del modelo fuera de la tarea de recomendación.
  • No se prueba estabilidad de la supuesta personalidad entre sesiones o reformulaciones.
  • MovieLens 10M no contiene los atributos demográficos usados por el análisis.
  • No se identifica un dataset auxiliar o proceso de enriquecimiento demográfico para MovieLens.
  • Los conteos de Table 1 no se reconcilian con la documentación oficial de MovieLens.
  • El umbral de 200 interacciones no se reconcilia con los 61.000 usuarios por sexo declarados.
  • No se informa cuántos usuarios sobreviven al filtro de 200 interacciones.
  • No se informa la proporción de datos demográficos ausentes.
  • No se explica cómo se forman las categorías senior y young.
  • No se explica qué edades quedan fuera de esas dos categorías.
  • No se explica cómo se agrupan países o continentes.
  • No se explica cómo se usa ocupación en las comparaciones binarias de DP y EO.
  • Los conteos de Last.fm y el total de registros no coinciden con la fuente oficial sin que se documente el subconjunto.
  • No se publica la partición procesada de Last.fm.
  • No se informa cómo se manejan perfiles con género, edad o país vacíos.
  • No se define con precisión el evento Y-hat=1 para una lista de recomendaciones generada en texto libre.
  • No se define con precisión la relevancia verdadera Y usada en EO.
  • No se describe una partición train-test o temporal para Precision y Recall.
  • No se informa cuántos ítems relevantes tiene cada perfil.
  • No se describe normalización de títulos, alias, remakes o artistas.
  • No se informa cuántas recomendaciones no pertenecen al catálogo.
  • No se informa cómo se tratan alucinaciones de títulos.
  • No se informa cómo se resuelven duplicados en top-15.
  • No se especifica si ILF usa ítems, géneros o una distribución normalizada de categorías.
  • La entropía de diversidad intralista no es por sí misma una medida de equidad.
  • El término Intra-list Fairness puede confundir diversidad de contenido con trato justo entre personas.
  • No se mide exposición de proveedores o creadores.
  • No se estudia daño, utilidad o preferencia real para los grupos protegidos.
  • No se comprueba comparabilidad de preferencias antes de aplicar DP.
  • DP puede penalizar diferencias legítimas de gusto y el artículo no resuelve ese problema.
  • EO requiere ground truth de relevancia, pero el protocolo para obtenerla no se publica.
  • El marco no presenta una medida de disparidad de PAS entre grupos de personalidad.
  • Por ello, la llamada psychological fairness se reduce principalmente a alineación, no a equidad entre tipos psicológicos.
  • SNSR y SNSV se definen pero no se reportan.
  • Los nombres de SNSR y SNSV cambian entre método y resultados.
  • La flecha de Jaccard en Table 4 contradice su interpretación de estabilidad y su signo en FPx.
  • Figure 5 omite Jaccard pese a la comparación anunciada de ocho métricas.
  • No se publican resultados por usuario.
  • No se publican distribuciones por grupo.
  • No se publican desviaciones estándar.
  • No se publican intervalos de confianza.
  • No se publican p-valores.
  • No se realiza ninguna prueba estadística para las afirmaciones de significancia.
  • No se corrige por comparaciones múltiples.
  • No se analiza sensibilidad a prompts alternativos.
  • No se analiza sensibilidad a pesos del agregado FPx.
  • Los ocho componentes de FPx reciben pesos iguales sin justificación empírica.
  • El agregado combina constructos con interpretaciones y escalas diferentes.
  • El gran ILF de DeepSeek domina parte de la diferencia del compuesto.
  • Un único escalar oculta el conflicto real entre DP, EO, alineación, diversidad y exactitud.
  • No se compara FPx con una evaluación humana de utilidad o justicia.
  • No se compara con un recomendador colaborativo tradicional.
  • No se compara con un recomendador de popularidad reproducible.
  • No se compara con una técnica de personalización no psicológica bajo el mismo presupuesto.
  • No se evalúan Gemini, Claude o Llama pese a citarlos como trabajo futuro.
  • Las conclusiones sobre DeepSeek y ChatGPT se basan en versiones no identificadas y pueden no persistir.
  • La frase de que ChatGPT tiene menor DP y EO contradice Table 4.
  • La conclusión de outputs perceived-as-fair no procede de una evaluación humana de percepción.
  • El estudio no mide confianza o satisfacción pese a afirmarlo en la introducción.
  • Figure 1 usa una sola película y tres personas famosas construidas mediante estereotipos.
  • Los rasgos de Figure 1 no proceden de autoinformes de las personas representadas.
  • La preferencia cinematográfica real de esas personas no se observa.
  • La votación humana se trata como ground truth sin validación.
  • No se informan edad, género, país o lengua de los 120 evaluadores.
  • No se informa compensación.
  • No se informa consentimiento.
  • No se informa revisión ética o exención.
  • No se informa control de respuestas duplicadas entre cuatro redes sociales.
  • No se informa el texto exacto del cuestionario o el orden de opciones.
  • Figure 1 muestra que DeepSeek coincide con la mayoría humana, en contra de la afirmación de que los cuatro LLM fallan.
  • No se publican las respuestas completas de los cuatro LLM del caso.
  • No se ofrece código.
  • No se ofrecen archivos de configuración.
  • No se ofrecen perfiles procesados.
  • No se ofrecen recomendaciones crudas.
  • No se ofrecen cálculos intermedios de las métricas.
  • No se ofrece un artefacto que reproduzca las tablas.
  • No se declara una licencia de código o datos derivados.
  • No existe preregistro.
  • No se realiza una replicación independiente.
  • No se estudian idiomas distintos del inglés.
  • No se estudian dominios distintos de películas y música.
  • No se estudia comportamiento longitudinal del usuario.
  • No se estudia cambio de personalidad o preferencia en el tiempo.
  • No se implementa aprendizaje continuo.
  • No se implementa un sistema multimodal.
  • La ubicación en un workshop de aprendizaje multimodal continuo no constituye evidencia sobre esos dos temas.
  • La discrepancia de autoría entre CVF, PDF visible, Crossref, arXiv y DBLP queda sin explicación editorial.

Qué no demuestra

  • No demuestra que los LLM posean rasgos OCEAN psicológicos.
  • No demuestra que el vector inferido describa la personalidad real de los usuarios.
  • No valida las correspondencias entre géneros y rasgos a nivel individual.
  • No demuestra personalidad estable entre prompts, sesiones o tareas.
  • No demuestra que mejorar PAS mejore satisfacción o bienestar del usuario.
  • No demuestra que ILF sea equidad.
  • No demuestra discriminación causal producida por la personalidad.
  • No demuestra que las diferencias de DP y EO se deban solo al prompt de personalidad.
  • No demuestra equidad demográfica sobre MovieLens 10M con la fuente publicada.
  • No demuestra psychological fairness entre tipos de personalidad.
  • No demuestra que PerFairX sea un benchmark reproducible.
  • No demuestra que el agregado FPx represente preferencias sociales válidas sobre los compromisos.
  • No demuestra que pesos iguales sean la agregación correcta.
  • No demuestra una mejora estadísticamente significativa.
  • No demuestra que DeepSeek sea generalmente mejor recomendador.
  • No demuestra que ChatGPT sea más justo por DP o EO.
  • No demuestra que ChatGPT sea percibido como más justo por usuarios.
  • No demuestra confianza o satisfacción de usuarios.
  • No demuestra que la mayoría de 120 votos sea una preferencia verdadera de las celebridades representadas.
  • No demuestra que cuatro LLM fallen el caso de Figure 1.
  • No demuestra generalización a otros modelos, versiones, culturas o dominios.
  • No demuestra funcionamiento en aprendizaje continuo o sistemas multimodales.
  • No justifica desplegar el marco como auditoría de equidad sin resolver procedencia demográfica, validez y reproducibilidad.

Trazabilidad

Alcance: Texto completo

Versión: ICCVW 2025 Multimodal Continual Learning workshop open-access accepted version, pp. 2771-2780; DOI 10.1109/ICCVW69036.2025.00289; CVF copy identical to accepted version apart from watermark

Fuente consultada: https://openaccess.thecvf.com/content/ICCV2025W/MCL/html/Sah_PerFairX_Is_There_a_Balance_Between_Fairness_and_Personality_in_ICCVW_2025_paper.html

Revisión: Codex full-text, peer-reviewed-version, bilingual-fidelity, visual, bibliographic, dataset-provenance, psychometric-validity, fairness-operationalization, metric-recalculation, internal-consistency, reproducibility and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • ChatGPT, linked to GPT-4o documentation but without an exact model snapshot
  • DeepSeek API, exact model and snapshot not reported
  • Four incompletely specified LLMs in the Figure 1 case study, visually represented as xAI, ChatGPT, DeepSeek and Gemini

Instrumentos y métricas

  • Five-dimensional OCEAN profile inferred from behavioral proxies
  • Personality Alignment Score (PAS)
  • Genre-Personality Alignment (GPA)
  • Demographic Parity difference (DP)
  • Equal Opportunity difference (EO)
  • Intra-list Fairness or genre-diversity entropy (ILF)
  • Sensitive-to-Neutral Similarity Range (SNSR@K)
  • Sensitive-to-Neutral Similarity Variance (SNSV@K)
  • Jaccard@15 between neutral and sensitive lists
  • Precision@15 and Recall@15
  • Equal-weight PerFairX aggregate (FPx)
  • Single-question social-media case-study vote

Datos utilizados

  • MovieLens 10M
  • Last.fm Dataset 360K
  • Ten selected or constructed user profiles
  • Top-15 recommendation lists generated under two prompt conditions
  • Figure 1 social-media responses from 120 evaluators

Evidencia y localización

  • Identidad bibliográfica final: IEEE/CVF ICCVW 2025, Multimodal Continual Learning workshop, pp. 2771-2780; DOI 10.1109/ICCVW69036.2025.00289; IEEE document 11375720
  • Texto completo abierto inspeccionado: .cache/editorial-sources/article-085/source.pdf; CVF accepted version; 10 pages; sha256 2c7a7a66a12e37db97a904922746dabe0fa98ace5ee256ea58a7d3e31ac55515
  • Relación entre versión final y preprint: CVF final PDF versus preserved .cache/editorial-sources/article-085/versions/arxiv-v1.pdf; normalized token sequence ratio 0.9433384379785605
  • Discrepancia de autoría: CVF landing page and PDF metadata list Chandan Kumar Sah and Xiaoli Lian; visible title page, arXiv v1, DBLP and Crossref DOI metadata list Chandan Kumar Sah
  • Pregunta y marco propuesto: Abstract and Sections 1-3, final pp. 2771-2775
  • Encuesta de 120 personas y contradicción de Figure 1: Section 1 and Figure 1, final pp. 2771-2772: prose says four LLMs overlooked Elon; figure shows DeepSeek selecting Elon
  • Definición de diez métricas: Sections 3.1.3 and 3.2, equations 1-11, final pp. 2773-2775
  • Inferencia OCEAN y prompts: Sections 3.3-3.5, final p. 2775
  • Muestra de cinco perfiles por dominio: Section 4, final p. 2775
  • Estadísticas y atributos declarados de los datasets: Table 1, final p. 2776
  • MovieLens 10M carece de demografía: Official GroupLens MovieLens 10M README: 10,000,054 ratings, 10,681 movies, 71,567 users and no demographic information
  • Estadísticas oficiales de Last.fm 360K: Official UPF Music Technology Group Last.fm 360K version 1.2 page: 17,559,530 lines, 359,347 unique users, profile fields gender, age, country and signup
  • Resultados de alineación: Table 2 and Section 4.1, final p. 2776
  • Resultados de DP, EO e ILF: Table 3 and Section 4.2, final p. 2776
  • Confusión cualitativa entre personalización y equidad: Figure 3 and its interpretation, final p. 2777
  • Comparación de modelos y contradicción DP/EO: Table 4 versus Section 4.3 prose, final pp. 2777-2778
  • Agregado FPx reproducido: Equation 11 and Table 5, final pp. 2775 and 2778; equal-weight sums reproduce 1.994, 2.895, 2.022 and 2.961
  • Métricas omitidas e inconsistencia Jaccard: Definitions on p. 2774, Table 4 and Figure 5 on p. 2778: SNSR/SNSV absent; Jaccard marked lower-is-better but added positively to FPx
  • Conclusiones y afirmaciones de alcance: Section 5, final p. 2778
  • Financiación declarada: Section 6 Acknowledgments, final p. 2779
  • Ausencia de artefactos reproducibles: Complete final PDF, link annotations and current web search inspected 15 Jul 2026: model documentation links only; no paper code or data repository found
  • Lectura y comprobación visual integral: All 10 final pages rendered and inspected at original resolution, including Figures 1-5, Tables 1-5, equations 1-11, acknowledgments and references; checked 15 Jul 2026