Value-Spectrum: Quantifying Preferences of Vision-Language Models via Value Decomposition in Social Media Contexts

Aplicaciones, sesgos y seguridad2025ACL AnthologyRevisión editorial aprobada

Autores: Jingxuan Li, Yuning Yang, Shengqi Yang, Linfan Zhang, Ying Nian Wu

Palabras clave: Computation and Language, ACL 2025

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
15
Hallazgos
35
Limitaciones
18
Evidencias

Resumen editorial

Español

Value-Spectrum estudia respuestas y navegación simulada de modelos de visión y lenguaje ante contenido de redes sociales, usando los diez valores de Schwartz como etiquetas de recuperación. El corpus declarado contiene 50.191 vídeos de TikTok (39 %), Instagram (32 %) y YouTube (29 %), publicados entre el 31 de julio y el 31 de octubre de 2024; de cada vídeo se conserva un enlace, metadatos y una captura. Para el benchmark estático, los autores redactan diez palabras por valor, recuperan mediante CLIP cinco imágenes por palabra y preguntan a ocho VLM si les gusta cada imagen. La proporción de «sí» en 50 imágenes por valor se denomina intensidad de preferencia. Gemini 2.0 Flash responde afirmativamente entre 82 % y 94 % según el valor, mientras que InternVL2 queda entre 26 % y 54 %; estas diferencias reflejan también propensión general a asentir, capacidad de seguir el formato y selección de imágenes, no sólo valores. El diseño no incluye ítems neutrales, imágenes contrabalanceadas, repetición de generaciones, parámetros de inferencia, intervalos ni tests. Por ello no identifica preferencias «intrínsecas». En una segunda fase, cinco VLM reciben biografías de PersonaChat y deciden si permanecer 45 segundos o saltar cada vídeo. Se ejecutan diez recorridos de 100 vídeos por modelo y plataforma, comparando la tasa de contenido considerado relevante en los primeros y últimos 50. Una estrategia simple usa sí/no; ISQ suma cuatro ratings de 1–10 y dos respuestas binarias, con umbral superior al 60 % para permanecer. Los cambios dependen simultáneamente del modelo, el prompt, el contenido servido y el recomendador de cada plataforma. Por ejemplo, con ISQ el cambio relativo en TikTok va de −2,0 % para Qwen-VL-Plus a 51,9 % para Gemini 1.5 Pro; en YouTube llega a 34,9 % para Claude y en Instagram a 16,4 % para GPT-4o. No hay comparación sobre las mismas secuencias, estimación de incertidumbre ni prueba causal de adopción de personalidad. Dos validaciones humanas aportan evidencia más estrecha: tres anotaciones por 1.500 capturas, 500 por plataforma, consideran representativa del vídeo una captura tomada a los dos segundos en el 90,4 % de los casos; en otra muestra estratificada de 500 pares y tres anotadores, el 90,6 % de los juicios sobre capturas y el 87,6 % sobre vídeos responden que el contenido refleja el valor asignado. Esas tasas validan en parte la recuperación de contenido, pero no miden acuerdo entre anotadores ni validez de las respuestas de los modelos. La auditoría visual confirma además una referencia «Figure ??» sin resolver. El análisis cultural usa captions de GPT-4o y reglas NER/palabras clave sobre 2.614 imágenes; las categorías pueden solaparse, sus cuentas suman 2.797 y sus porcentajes 107 %, aunque la tabla añade un total 2.614/100 %. El repositorio enlazado contradice la frase del abstract que afirma disponer de código y datos completos: en el commit 6f45f1d9cc071a034dfaecfe64bc75dfb30babb6 sólo hay README, licencia e imágenes, y su TODO deja pendientes dataset, evaluación, agente y código de anotación. El resultado defendible es que diferentes VLM muestran tasas de «sí» muy distintas bajo un protocolo concreto y que un agente con prompts de persona puede alterar una señal que alimenta recomendadores reales; no demuestra valores internos, personalidad estable ni steerability causal.

English

Value-Spectrum studies vision-language model responses and simulated browsing behavior on social-media content, using Schwartz’s ten values as retrieval labels. The stated corpus contains 50,191 videos from TikTok (39%), Instagram (32%), and YouTube (29%), dated 31 July to 31 October 2024; each record stores a link, metadata, and one screenshot. For the static benchmark, the authors write ten keywords per value, retrieve five CLIP-nearest images per keyword, and ask eight VLMs whether they like each image. The percentage of yes answers over 50 images per value is called preference intensity. Gemini 2.0 Flash answers yes on 82–94% depending on the value, while InternVL2 ranges from 26–54%. Those differences also reflect general acquiescence, format following, model capability, and image selection, not values alone. There are no neutral items, counterbalanced images, repeat generations, inference parameters, uncertainty intervals, or statistical tests, so the design does not identify intrinsic preferences. In a second phase, five VLMs receive PersonaChat biographies and decide whether to remain for 45 seconds or skip each video. Ten 100-video runs per model and platform compare model-accepted content in the first and last 50 items. A Simple strategy uses yes/no; ISQ combines four 1–10 ratings and two binary answers, staying when its normalized composite exceeds 60%. Changes jointly depend on the model, prompt, served content, and each platform’s recommender. Under ISQ, for example, relative change on TikTok ranges from −2.0% for Qwen-VL-Plus to 51.9% for Gemini 1.5 Pro; YouTube reaches 34.9% for Claude, and Instagram 16.4% for GPT-4o. There is no same-sequence control, uncertainty estimate, or causal test of personality adoption. Two human checks provide narrower support: three ratings for each of 1,500 screenshots, 500 per platform, judge the two-second frame representative of its video in 90.4% of cases; in a separate stratified sample of 500 screenshot-video pairs with three annotators, 90.6% of screenshot judgments and 87.6% of video judgments say the content reflects its assigned value. These rates partially validate content retrieval, but do not measure inter-rater agreement or validate model preferences. Visual review also confirms an unresolved “Figure ??” reference. The cultural analysis applies GPT-4o captions and NER/keyword rules to 2,614 images; categories may overlap, their counts total 2,797 and percentages 107%, despite the table adding a 2,614/100% total row. The linked repository contradicts the abstract’s claim that complete code and data are available: commit 6f45f1d9cc071a034dfaecfe64bc75dfb30babb6 contains only a README, license, and images, while its TODO leaves the dataset, evaluation, agent, and annotation code pending. The defensible finding is that VLMs have markedly different yes rates under one specific protocol and that persona prompts can alter a signal fed to real recommenders; the study does not establish internal values, stable personality, or causal steerability.

Pregunta de investigación

¿Producen distintos VLM patrones diferentes de aceptación ante imágenes recuperadas mediante valores de Schwartz y puede un prompt de persona cambiar, a través de decisiones de permanencia o salto, el contenido que recomiendan TikTok, YouTube e Instagram?

Método

Se recogen 50.191 vídeos cortos y una captura a los dos segundos por vídeo. CLIP indexa las capturas. Diez palabras elegidas por los autores para cada uno de diez valores recuperan cinco imágenes por palabra; ocho VLM responden sí/no y explican su respuesta, y la tasa de sí en 50 imágenes se presenta como preferencia. Para la inducción, cinco VLM reciben biografías PersonaChat y navegan diez recorridos de 100 vídeos por plataforma. Permanecen 45 segundos cuando una decisión simple o un score ISQ supera el umbral; se calcula el cambio relativo entre los primeros y últimos 50 vídeos. Hay validación humana de representatividad de captura y de alineación contenido-valor, una comparación imagen frente a descripción textual y un análisis cultural automatizado.

Muestra: El corpus contiene 50.191 vídeos, pero el benchmark de preferencia usa 50 capturas recuperadas por cada valor y modelo. El experimento de persona declara N=10 recorridos de 100 vídeos por modelo y plataforma, comparando bloques de 50. Las validaciones humanas usan 1.500 pares para representatividad de fotograma y 500 pares estratificados para alineación con valores. El número de trabajadores únicos y su demografía no se informan.

Hallazgos

  • En ocho VLM, la tasa media de sí por valor va desde perfiles globalmente bajos, como InternVL2 (26–54 %), hasta respuestas muy afirmativas de Gemini 2.0 Flash (82–94 %).
  • El promedio entre modelos es 73,3 para Universalismo y Benevolencia, 72,8 para Tradición y 55,0 para Estimulación.
  • GPT-4o puntúa 90 en Universalismo, 88 en Benevolencia y 56 en Estimulación; los valores son porcentajes de sí, no escalas psicométricas calibradas.
  • CogVLM2 alcanza 90 en Poder, mientras que BLIP-2 sólo 28; una diferencia que puede incluir capacidad de respuesta y sesgo de asentimiento.
  • En la estrategia simple, el cambio relativo de contenido aceptado varía por plataforma y modelo: GPT-4o registra 55,26 % en TikTok pero −4,0 % en YouTube y −9,82 % en Instagram.
  • Con ISQ, Gemini 1.5 Pro alcanza 51,9 % de cambio en TikTok, Claude 34,9 % en YouTube y GPT-4o 16,4 % en Instagram.
  • Qwen-VL-Plus empeora con ISQ en TikTok (−2,0 %) e Instagram (−6,0 %), lo que contradice una mejora uniforme.
  • La afirmación introductoria de que Claude logra la mayor alineación ISQ no coincide claramente con las tablas: Gemini tiene el mayor cambio medio entre plataformas y CogVLM las mayores tasas absolutas de contenido aceptado.
  • El 90,4 % de 4.500 juicios considera que la captura a los dos segundos representa el vídeo; 8,8 % la considera no representativa y el 0,8 % restante no se desglosa en el texto principal.
  • En validación de etiquetas, 90,6 % de los juicios sobre capturas y 87,6 % sobre vídeos responden sí a la alineación con el valor asignado.
  • La validación de etiquetas no publica acuerdo interanotador ni fiabilidad; una alta tasa de sí frente a una etiqueta preseleccionada no equivale a acuerdo entre jueces.
  • La comparación de modalidad usa 500 imágenes y muestra tasas más altas cuando captions de otros VLM se entregan a LLM; no presenta tests pese a calificar diferencias como significativas.
  • El análisis cultural atribuye 78,6 % de señales a Western y 13,9 % a Japanese, pero admite categorías múltiples; cuentas y porcentajes suman 2.797 y 107 %, no el total 2.614/100 % mostrado.
  • La revisión visual de las 20 páginas confirma tablas y fórmulas, y detecta una referencia no resuelta a Figure ?? en el apéndice G.
  • A 15 de julio de 2026, el repositorio oficial no contiene dataset ni código ejecutable y mantiene esos artefactos como TODO, pese a la disponibilidad completa afirmada por el abstract.

Limitaciones

  • La variable principal es una respuesta de gusto sí/no, no una medida validada de valores de Schwartz ni de personalidad.
  • Las imágenes se seleccionan a partir de palabras elegidas para representar cada valor; el contenido, la palabra y el valor quedan confundidos.
  • Sólo se usan cinco imágenes por palabra y diez palabras por valor, sin análisis de sensibilidad a otra selección de términos o capturas.
  • Una tasa de sí mezcla preferencia, asentimiento, seguridad del modelo, seguimiento de formato, política de rechazo y calidad visual.
  • No hay baseline neutral, control de tasa general de sí, imágenes negativas/positivas contrabalanceadas ni comparación con preferencias humanas.
  • No se informan versiones exactas de la mayoría de endpoints/checkpoints, temperatura, top-p, seed, fecha de consulta, retries o parser de respuestas.
  • No hay réplicas del benchmark estático, intervalos, errores estándar ni tests de hipótesis para ninguna diferencia entre valores o modelos.
  • El texto emplea repetidamente «significant» de forma descriptiva sin estadística inferencial.
  • La desviación entre diez valores se interpreta como especificidad de preferencias, aunque no es incertidumbre y depende del rango de las imágenes elegidas.
  • BLIP-2 produce respuestas cortas o inconclusas, por lo que compararlo mediante el mismo parser con modelos instruidos puede medir capacidad más que preferencia.
  • El estudio llama intrínsecas a respuestas provocadas por prompts explícitos y un conjunto de imágenes construido por los autores.
  • Los modelos usados en el benchmark estático no coinciden exactamente con los del experimento de persona: Gemini 2.0/1.5, Qwen2.5/Qwen-VL y CogVLM2/CogVLM.
  • No se justifica cómo se eligen las personas de PersonaChat, si se repiten entre modelos o si las secuencias iniciales son comparables.
  • Primeros y últimos 50 vídeos son contenidos distintos servidos adaptativamente; el cambio no aisla el efecto del prompt frente al algoritmo, orden o deriva de sesión.
  • El cambio relativo puede amplificarse cuando la tasa inicial es baja, como el 55,26 % de GPT-4o en TikTok que corresponde a pasar de 7,6 % a 11,8 %.
  • No se incluye control sin persona, persona permutada, decisión aleatoria, permanencia fija ni misma secuencia de vídeos.
  • Permanecer 45 segundos o saltar son intervenciones distintas y suficientes para entrenar al recomendador; no demuestran que el VLM haya adoptado una personalidad.
  • ISQ pregunta directamente por alineación con la persona y deseo de actuar, y suma esos sí con peso diez; mejora la señal por construcción y no valida un constructo independiente.
  • El umbral ISQ se presenta como ejemplo y no se aporta calibración, análisis de sensibilidad ni validación de sus pesos.
  • Las diez trials no se acompañan de dispersión, intervalos, resultados individuales ni tests; se publican sólo porcentajes agregados.
  • No se controla historial previo, geografía, cuenta, cookies, hora, versión del recomendador o personalización inicial de las plataformas.
  • La conclusión de que TikTok es óptimo no se sostiene causalmente sin condiciones comparables ni réplica temporal.
  • La validación de fotograma evalúa representatividad general, no si el fotograma conserva el valor específico ni la información temporal decisiva.
  • La muestra de alineación está estratificada por etiquetas ya asignadas por el pipeline, y los tres anotadores conocen Schwartz; no existe etiquetado ciego abierto.
  • Se reportan porcentajes agregados de juicios, pero no consenso por ítem, acuerdo interanotador, kappa, desacuerdo entre valores o datos por plataforma.
  • No se informa la demografía de anotadores, el número de trabajadores únicos de MTurk ni criterios de inclusión más allá de pilotos iterativos.
  • La tabla cultural combina categorías solapadas con una fila Total 100 %, sin explicar formalmente denominadores múltiples; sus porcentajes suman 107 %.
  • El análisis cultural depende de captions de GPT-4o y reglas de entidades/palabras, sin validación humana, métricas de error ni lista exhaustiva de reglas.
  • El predominio cultural no puede atribuirse a las plataformas en general porque la recolección es una caminata condicionada por cuentas y recomendadores no documentados.
  • La captura automatizada de contenido y enlaces de redes plantea privacidad, copyright, consentimiento y términos de servicio que la sección ética no analiza.
  • No se explica tratamiento de rostros, menores, nombres de cuenta, contenido eliminado, retención, acceso, anonimización o solicitudes de borrado.
  • No se documenta aprobación ética/IRB, evaluación de riesgos de scraping ni permiso de las plataformas.
  • El repositorio oficial, en su commit inspeccionado, contiene sólo README, licencia e imágenes; no permite reproducir colección, prompts, parsing, tablas o análisis.
  • El dataset no está disponible pese a que el PDF afirma lo contrario, por lo que no pueden auditarse duplicados, fechas, etiquetas, contenido sensible o enlaces rotos.
  • El documento conserva una referencia «Figure ??» y presenta afirmaciones introductorias que no encajan inequívocamente con sus tablas de ISQ.

Qué no demuestra

  • No demuestra que los VLM posean valores humanos intrínsecos o preferencias internas.
  • No valida la tasa de sí como escala psicométrica de valores de Schwartz.
  • No separa preferencias del sesgo de asentimiento, la capacidad visual o el seguimiento de instrucciones.
  • No demuestra personalidad estable, identidad, conciencia ni rasgos humanos en los modelos.
  • No demuestra que una persona inducida se mantenga fuera de la sesión, plataforma o prompt evaluados.
  • No identifica causalmente el prompt como origen de los cambios del recomendador.
  • No establece que ISQ mida mejor personalidad; incorpora explícitamente preguntas sobre alineación y acción.
  • No demuestra que TikTok sea universalmente mejor para evaluar role-playing.
  • No establece diferencias estadísticamente significativas entre modelos, valores, modalidades o plataformas.
  • No demuestra diversidad cultural equilibrada del corpus.
  • No demuestra que una sola captura represente adecuadamente todos los vídeos o todos sus valores.
  • No aporta acuerdo interanotador o validación psicométrica de las etiquetas humanas.
  • No permite reproducir los resultados con los artefactos actualmente publicados.
  • No acredita que el código y los datos completos estén disponibles en el repositorio enlazado.
  • No evalúa impacto en usuarios, persuasión, bienestar, discriminación, seguridad o manipulación de recomendadores.

Trazabilidad

Alcance: Texto completo

Versión: ACL 2025 Main Conference long paper, pages 9591–9610; DOI 10.18653/v1/2025.acl-long.472

Fuente consultada: https://aclanthology.org/2025.acl-long.472.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, construct-validity, acquiescence, retrieval-confounding, sampling, model-version, adaptive-recommender, causal-inference, repeated-measures, inferential-statistics, formula, human-annotation, cultural-analysis, artifact-availability, privacy, ethics and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o; exact snapshot and inference configuration not reported
  • Gemini 2.0 Flash; exact snapshot and inference configuration not reported
  • Claude 3.5 Sonnet; exact snapshot and inference configuration not reported
  • DeepSeek-VL2; exact checkpoint and inference configuration not reported
  • Qwen2.5-VL-Plus; exact endpoint/checkpoint and inference configuration not reported
  • InternVL2; exact checkpoint and inference configuration not reported
  • CogVLM2; exact checkpoint and inference configuration not reported
  • BLIP-2 2.7B; exact checkpoint and inference configuration not reported
  • Persona experiment: GPT-4o, Gemini 1.5 Pro, Qwen-VL-Plus, Claude 3.5 Sonnet, and CogVLM

Instrumentos y métricas

  • Schwartz ten basic human values used as retrieval categories
  • Ten author-selected keywords per value
  • CLIP vector retrieval with five images per keyword
  • One-word yes/no liking prompt plus explanation and brief description
  • Percentage of yes responses over 50 images per value
  • PersonaChat demographic persona prompts
  • Simple stay/skip strategy
  • Inductive Scoring Questionnaire composite with a 60% threshold
  • Relative change between accepted content in the first and last 50 videos
  • MTurk screenshot representativeness judgments
  • Three-annotator screenshot/video value-alignment judgments
  • GPT-4o captioning plus NER and keyword matching for cultural signals

Datos utilizados

  • Value-Spectrum: 50,191 unique short-video links, screenshots, platform and post-date metadata collected from TikTok, Instagram Reels, and YouTube Shorts
  • Static preference subset: 500 retrieved screenshots per evaluated VLM, 50 per Schwartz value
  • Persona navigation runs: ten 100-video trials per model and platform for each reported strategy
  • Single-frame validation: 1,500 screenshot-video pairs, three ratings per pair, 4,500 ratings
  • Value-label validation: 500 screenshot-video pairs, 50 per value, three annotators, 1,500 screenshot and 1,500 video judgments
  • Input-modality ablation: 500 images, 50 per value
  • Cultural-signal sample: 2,614 images

Evidencia y localización

  • Identidad, autores, publicación, páginas, DOI y abstract completo: ACL final PDF p. 1 (proceedings p. 9591) and ACL Anthology record 2025.acl-long.472
  • Contribuciones declaradas y afirmación de preferencias intrínsecas: PDF pp. 1–2 (9591–9592), Abstract and Introduction
  • Corpus de 50.191 vídeos, plataformas, fechas, una captura y recuperación CLIP: PDF pp. 3–4 (9593–9594), section 3 and Figures 3–4
  • Diez palabras por valor, cinco imágenes por palabra y prompts: PDF pp. 4–5 (9594–9595), section 4.1
  • Tasas de sí por ocho modelos: PDF pp. 5–6 (9595–9596), Figures 5–7 and Table 1
  • Cambio de familias/modelos entre experimentos: PDF p. 6 (9596), section 5.1
  • PersonaChat, permanencia/salto y fórmula de cambio: PDF pp. 6–7 (9596–9597), Simple Strategy and Equation I_avg
  • Diez recorridos, cien vídeos y bloques de cincuenta: PDF p. 7 (9597), paragraph following I_avg
  • Preguntas, pesos y umbral ISQ: PDF p. 7 (9597), Inductive Scoring Questionnaire Strategy and Equation S%
  • Resultados por plataforma y estrategia: PDF pp. 7, 16 (9597, 9606), Figure 8 and Tables 3–8
  • Comparación visual frente a descripciones de imagen: PDF pp. 8, 13, 20 (9598, 9603, 9610), Discussion, Appendix E and Table 10
  • Validación de representatividad de captura: PDF pp. 8, 13, 20 (9598, 9603, 9610), Single Frame Screenshot Representation, Appendix D and Figure 15
  • Limitaciones y consideraciones éticas declaradas: PDF p. 9 (9599), sections 8–9
  • Análisis cultural y suma no particional: PDF pp. 13–14 (9603–9604), Appendix F and Table 2
  • Validación humana de etiquetas y ausencia de acuerdo interanotador: PDF pp. 14–17 (9604–9607), Appendix G and Table 9
  • Referencia editorial sin resolver: PDF p. 15 (9605), Appendix G.1: Figure ??
  • Inspección visual: All 20 pages of the final ACL PDF rendered and visually inspected, including formulas, ten tables and fifteen figures; checked 15 Jul 2026
  • Ausencia de dataset y código pese a la afirmación del abstract: Official GitHub repository Jeremyyny/Value-Spectrum at commit 6f45f1d9cc071a034dfaecfe64bc75dfb30babb6: README TODO leaves dataset, evaluation, VLM agent and annotation code pending; repository tree contains README, MIT license and image assets only; checked 15 Jul 2026