PUB: An LLM-Enhanced Personality-Driven User Behaviour Simulator for Recommender System Evaluation

Personas, identidad y agentes2025ACMRevisión editorial aprobada

Autores: Chenglong Ma, Ziqi Xu, Yongli Ren, Danula Hettiachchi, Jeffrey Chan

Palabras clave: Information Retrieval, Recommender Systems, User Behavior Simulation, Personality Traits, Large Language Models

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
13
Hallazgos
41
Limitaciones
15
Evidencias

Resumen editorial

Español

PUB es un simulador de interacciones para evaluar sistemas de recomendación. Su arquitectura agrega el historial de cada usuario, calcula señales como frecuencia y ritmo de compra, preferencias de categoría, precios, longitud y sentimiento de reseñas, añade metadatos de productos y solicita a un LLM no identificado que devuelva cinco puntuaciones Big Five. La correspondencia se fija mediante heurísticas: apertura se vincula con entropía de categorías y densidad de metáforas; responsabilidad con regularidad, longitud de reseñas y desviación de puntuaciones; extraversión con referencias sociales; amabilidad con sentimiento positivo y cortesía; y neuroticismo con volatilidad emocional negativa. Esas puntuaciones condicionan a un agente LLM que produce elecciones o feedback sintético. El artículo llama «psychometric mapping» a este procedimiento, pero no administra un instrumento psicométrico ni valida las puntuaciones contra personalidad humana observada.

Los experimentos utilizan Amazon Reviews 2023, descrito con 571,54 millones de interacciones, 30 categorías y fechas de 1996 a 2023. Se agregan categorías, se eliminan usuarios e ítems con menos de 20 interacciones y se hace una división cronológica, pero no se informa cuántos usuarios, ítems o interacciones quedan. Para evaluar semejanza de secuencias, en cada iteración el agente recibe una lista de diez candidatos que incluye deliberadamente el siguiente ítem positivo del test y nueve negativos aleatorios. Selecciona uno y la secuencia resultante se compara con la real mediante Jaccard. PUB alcanza una media de 0,31 y supera visualmente a Random, RecSim, NEST y RecAgent; la similitud aumenta en grupos con más historial. Este diseño mide capacidad de reidentificar positivos presentados al agente, no generación libre de una trayectoria, y 0,31 representa solapamiento parcial, no equivalencia con el comportamiento real.

Una segunda evaluación entrena o prueba siete recomendadores, Pop, MF, BPR, NeuMF, LightGCN, GRU4Rec y SASRec, con datos reales y sintéticos, usando nDCG@20. La figura conserva algunas tendencias generales, pero también muestra desviaciones sistemáticas: MF, BPR, NeuMF y LightGCN rinden peor con los datos sintéticos, mientras Pop, GRU4Rec y SASRec rinden mejor. No se publican valores tabulares, múltiples ejecuciones, barras de error, correlación de rankings o pruebas de equivalencia. Por tanto, la figura sugiere que el simulador reproduce parcialmente el orden o la escala de ciertos algoritmos, pero no sustenta que sea una plataforma fiable y sustituible por evaluación real.

El análisis de personalidad describe la distribución de las cinco puntuaciones inferidas y compara usuarios del 10 % superior e inferior de nDCG@20 para GRU4Rec. Los autores asocian amabilidad y responsabilidad altas con mejores recomendaciones y apertura alta con menor precisión. Sin embargo, los rasgos proceden de las mismas conductas y reglas que alimentan el simulador, no de mediciones independientes; no hay coeficientes, controles de confusión, tests o tamaños de efecto. Además, el texto interpreta un neuroticismo más bajo como menor estabilidad emocional, cuando en el Big Five la relación es inversa. Expresiones como «rasgo más prevalente», «correlaciones significativas» o algoritmos que «favorecen» personalidades no están respaldadas por el análisis presentado y pueden convertir asociaciones inducidas por el diseño en estereotipos sobre usuarios.

El paper enlaza un repositorio como supuesto código fuente y remite a él para definiciones omitidas. La auditoría del commit actual 52651aec, de junio de 2025, encuentra solo tres archivos: .gitignore, una licencia GPL-3.0 y un README que anuncia que el código se publicará próximamente. No hay implementación, prompts, configuración, datos procesados ni resultados. Tampoco se identifica el LLM, proveedor, versión, temperatura, coste, semillas o política de privacidad. La aportación defendible es un diseño conceptual y una evaluación preliminar de cinco páginas sobre simulación condicionada por señales etiquetadas como Big Five. No demuestra validez psicométrica, causalidad entre personalidad y recomendación, fidelidad humana de alta resolución ni que PUB pueda reemplazar estudios de usuarios o evaluaciones online.

English

PUB is an interaction simulator for recommender-system evaluation. Its architecture aggregates each user's history, computes signals such as purchase frequency and rhythm, category preferences, prices, review length, and sentiment, adds product metadata, and asks an unidentified LLM to return five Big Five scores. The mapping is fixed through heuristics: openness is tied to category entropy and metaphor density; conscientiousness to regularity, review-length consistency, and rating deviation; extraversion to social references; agreeableness to positive sentiment and politeness; and neuroticism to negative-emotion volatility. These scores condition an LLM agent that generates choices or synthetic feedback. The paper calls this a psychometric mapping, but it administers no psychometric instrument and does not validate scores against observed human personality.

Experiments use Amazon Reviews 2023, described as 571.54 million interactions in 30 categories from 1996 to 2023. Categories are pooled, users and items with fewer than 20 interactions are removed, and a chronological split is made, but retained user, item, and interaction counts are not reported. To test sequence similarity, at every iteration the agent receives ten candidates deliberately containing the true next test item and nine random negatives. It selects one, and the resulting sequence is compared with the real sequence using Jaccard similarity. PUB averages 0.31 and visually outperforms Random, RecSim, NEST, and RecAgent; similarity increases for groups with longer histories. This design measures recovery of positives exposed to the agent, not free-running trajectory generation, and 0.31 is partial overlap rather than equivalence to real behavior.

A second evaluation trains or tests seven recommenders, Pop, MF, BPR, NeuMF, LightGCN, GRU4Rec, and SASRec, on real and synthetic data using nDCG@20. The figure preserves some broad tendencies but also shows systematic deviations: MF, BPR, NeuMF, and LightGCN perform worse on synthetic data, whereas Pop, GRU4Rec, and SASRec perform better. No numerical table, repeated runs, error bars, rank correlation, or equivalence test is reported. The plot therefore suggests partial reproduction of some algorithms' ordering or scale, but does not support the stronger claim that PUB is a reliable substitute for real-data evaluation.

The personality analysis describes the distribution of the five inferred scores and compares the top and bottom 10% of GRU4Rec users by nDCG@20. The authors associate high agreeableness and conscientiousness with better recommendations and high openness with lower accuracy. Yet the traits derive from the same behaviors and rules that feed the simulator, not from independent measurements; no coefficients, confound controls, tests, or effect sizes are reported. The paper also interprets lower neuroticism as lower emotional stability, reversing the conventional Big Five relationship. Phrases such as most prevalent trait, significant correlations, or algorithms favoring personalities are unsupported by the presented analysis and risk turning design-induced associations into stereotypes about users.

The paper links a repository as source code and refers readers to it for omitted definitions. Auditing current commit 52651aec from June 2025 finds only three files: .gitignore, a GPL-3.0 license, and a README saying the code will be released soon. There is no implementation, prompt, configuration, processed data, or result artifact. The LLM, provider, version, temperature, cost, seeds, and privacy policy are also unspecified. The defensible contribution is a conceptual design and preliminary five-page evaluation of simulation conditioned on signals labeled as Big Five. It does not establish psychometric validity, a causal link between personality and recommendation, high-resolution human fidelity, or that PUB can replace user studies or online evaluation.

Pregunta de investigación

¿Puede un agente LLM condicionado por rasgos Big Five inferidos de historiales y metadatos generar secuencias sintéticas que se parezcan a interacciones reales, reproduzcan resultados relativos de varios recomendadores y permitan explorar asociaciones entre puntuaciones de personalidad inferidas y rendimiento de recomendación?

Método

Propuesta y evaluación experimental preliminar de un simulador híbrido. Un agregador extrae estadísticas de historiales de Amazon; un módulo incorpora metadatos; reglas psicolingüísticas y un LLM no identificado producen puntuaciones Big Five; y un agente condicionado por esas puntuaciones selecciona interacciones sintéticas. La evaluación compara Jaccard de secuencias contra cuatro simuladores, nDCG@20 de siete recomendadores sobre datos reales y sintéticos, distribuciones de puntuaciones y perfiles del 10 % superior e inferior en GRU4Rec. La auditoría editorial leyó y renderizó las cinco páginas publicadas, verificó DOI, versión y licencia, y congeló y revisó el repositorio oficial enlazado.

Muestra: La fuente bruta se describe con 571,54 millones de interacciones en 30 categorías entre 1996 y 2023. Tras agregar categorías y filtrar usuarios e ítems con menos de 20 interacciones, el artículo no informa tamaños retenidos, distribución por dominio ni número de prompts o llamadas al LLM. Para RQ1 se forman listas de diez candidatos con un positivo real y nueve negativos; para RQ2 se iguala el tamaño del test sintético al real. RQ4 usa los percentiles superior e inferior del 10 % de nDCG@20 de GRU4Rec, sin indicar sus recuentos.

Hallazgos

  • PUB combina perfiles estadísticos, metadatos, puntuaciones Big Five inferidas y un agente LLM para generar interacciones sintéticas.
  • La inferencia de rasgos usa proxies diseñados por los autores, no un inventario administrado a usuarios.
  • En la tarea de candidatos, PUB obtiene una similitud Jaccard media de 0,31 con la secuencia observada.
  • PUB supera visualmente a Random, RecSim, NEST y RecAgent en la figura de Jaccard.
  • La semejanza aumenta en grupos con mayor frecuencia de interacción y, por tanto, más historial disponible.
  • La evaluación de secuencias incluye el siguiente ítem verdadero entre diez candidatos en cada paso.
  • Los datos sintéticos reproducen de forma aproximada parte de los patrones nDCG@20 de siete recomendadores.
  • MF, BPR, NeuMF y LightGCN rinden peor en el test sintético que en el real.
  • Pop, GRU4Rec y SASRec rinden mejor en el test sintético que en el real.
  • Las puntuaciones inferidas muestran extraversión media más alta y neuroticismo medio más bajo en la figura.
  • Para GRU4Rec, los perfiles del 10 % superior muestran amabilidad y responsabilidad mayores que los del 10 % inferior.
  • La apertura inferida aparece ligeramente mayor en el grupo de peor nDCG@20.
  • El repositorio oficial no contiene el código que el artículo anuncia, por lo que ninguno de estos resultados puede reproducirse desde el artefacto público.

Limitaciones

  • El LLM utilizado no se identifica por proveedor, familia, checkpoint, versión o fecha.
  • No se publican prompts, mensajes de sistema, esquemas de salida o tratamiento de respuestas inválidas.
  • No se informan temperatura, top-p, longitud máxima, semillas, número de muestras o estrategia de reintentos.
  • No se detallan hardware, coste, latencia, dependencias o entorno de ejecución.
  • El artículo remite al código para definiciones de características, pero el repositorio oficial no contiene implementación.
  • El repositorio actual tiene solo .gitignore, LICENSE y un README que dice que el código se publicará próximamente.
  • La licencia GPL-3.0 no aporta reproducibilidad cuando no existe programa distribuido.
  • No se publican datos procesados, splits, IDs, estadísticas retenidas ni salidas del modelo.
  • No se informa cuántos usuarios, ítems e interacciones permanecen tras el filtro de 20 interacciones.
  • No se especifican las proporciones o fechas exactas de la división cronológica.
  • No se explica cómo se evita que señales del test entren en perfiles, normalización, metadatos o prompts.
  • Los rasgos se infieren desde conductas mediante proxies y no se validan contra autoinformes, informantes o expertos.
  • La correspondencia entre rasgos y características mezcla decisiones normativas con evidencia correlacional de otros dominios.
  • El mismo historial contribuye a definir los rasgos y a evaluar conductas asociadas, creando circularidad.
  • Las asociaciones pueden reflejar reglas codificadas en los prompts en vez de diferencias psicológicas de usuarios.
  • El agente recibe el positivo verdadero del test junto a nueve negativos, por lo que la tarea no es simulación libre.
  • No se aclara si los negativos se muestrean por popularidad, categoría, tiempo o dificultad.
  • Jaccard ignora orden y tiempo, aunque el objetivo declarado son secuencias conductuales.
  • Una similitud Jaccard de 0,31 implica solapamiento parcial y no basta por sí sola para alta fidelidad.
  • No se reportan distribuciones completas por baseline, intervalos de confianza o pruebas pareadas.
  • Los diez grupos de frecuencia no tienen tamaños publicados y la figura no separa efecto de cantidad de historial.
  • RQ2 no publica valores numéricos de nDCG@20, tablas, desviaciones ni múltiples ejecuciones.
  • No se calcula correlación de rankings, error absoluto, calibración o test de equivalencia entre datos reales y sintéticos.
  • Los resultados sintéticos sobreestiman unos algoritmos y subestiman otros, lo que puede cambiar conclusiones de evaluación.
  • Pop está alineado por construcción con señales de popularidad incorporadas al perfil, favoreciendo circularidad del benchmark.
  • No se comparan recomendaciones generadas por PUB con una ablación sin personalidad.
  • No hay ablaciones de metadatos, proxies psicoloingüísticos, historial, muestreo temporal o LLM.
  • No se evalúa si un simulador sin etiquetas Big Five logra el mismo Jaccard o nDCG.
  • Las afirmaciones de correlaciones significativas carecen de coeficientes, p-valores, intervalos o corrección por comparaciones.
  • La palabra prevalencia se aplica a puntuaciones continuas inferidas, no a categorías diagnósticas o proporciones observadas.
  • El texto interpreta menor neuroticismo como menor estabilidad emocional, invirtiendo la definición habitual del constructo.
  • RQ4 usa solo GRU4Rec y extremos del 10 %, sin controlar actividad, longitud de historial, categoría, tiempo u otros confusores.
  • Las explicaciones sobre apertura, amabilidad y responsabilidad son post hoc y no demuestran mecanismos causales.
  • No se evalúan diferencias demográficas, dominios, países, idiomas o generalización fuera de Amazon.
  • El método se declara agnóstico al dataset, pero solo se prueba en una colección y una tarea de recomendación.
  • No hay estudio con usuarios, experimento online, A/B test o validación de utilidad para decisiones reales.
  • No se analiza privacidad al inferir atributos psicológicos desde reseñas e historiales de compra.
  • No se evalúan equidad, estereotipos, discriminación o consecuencias de personalizar según rasgos no consentidos.
  • No se incluye sección de limitaciones, ética o impacto social pese al perfilado psicológico automatizado.
  • Cinco páginas limitan el detalle metodológico y dejan elementos esenciales delegados a un artefacto vacío.
  • La conclusión califica la plataforma de escalable y fiable sin mediciones directas de escalabilidad o fiabilidad.

Qué no demuestra

  • No demuestra que las puntuaciones inferidas midan la personalidad real de los usuarios.
  • No valida psicométricamente el mapeo a Big Five.
  • No prueba que los rasgos causen decisiones de compra o resultados de recomendación.
  • No demuestra que PUB genere trayectorias libres sin acceso a positivos reales.
  • No establece equivalencia estadística entre secuencias sintéticas y humanas.
  • No demuestra que un Jaccard de 0,31 sea suficiente para sustituir datos reales.
  • No garantiza que el ranking de recomendadores se conserve de forma estable.
  • No demuestra que la personalidad aporte valor incremental frente a historial y metadatos.
  • No prueba generalización a otros datasets, dominios, idiomas o plataformas.
  • No demuestra estabilidad frente a otro LLM, prompt, semilla o configuración.
  • No permite interpretar las distribuciones inferidas como prevalencia psicológica en usuarios de Amazon.
  • No establece que los recomendadores favorezcan causalmente unas personalidades.
  • No valida los estereotipos explicativos sobre apertura, amabilidad, responsabilidad o neuroticismo.
  • No evalúa seguridad, privacidad, consentimiento o equidad del perfilado.
  • No ofrece actualmente un sistema reproducible pese a enlazar un repositorio de código.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2506.04551v1 (5 Jun 2025); published at SIGIR '25; DOI 10.1145/3726302.3730238; CC BY 4.0

Fuente consultada: https://arxiv.org/pdf/2506.04551v1

Revisión: Codex full-text, visual, experimental-design, psychometric and repository audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Unspecified large language model used for metadata fusion, Big Five score generation and user-agent simulation
  • Pop
  • Matrix Factorization
  • Bayesian Personalized Ranking
  • NeuMF
  • LightGCN
  • GRU4Rec
  • SASRec

Instrumentos y métricas

  • Handcrafted Big Five proxy mapping from behavioral and linguistic features
  • LIWC-22 social-reference markers
  • VADER positive sentiment ratio
  • Circular statistics for purchase rhythm
  • Shannon entropy for purchase intervals and categories
  • Jaccard similarity between synthetic and observed item sequences
  • nDCG@20 for recommender evaluation
  • Top-versus-bottom 10% GRU4Rec performance profiles

Datos utilizados

  • Amazon Reviews 2023: reported 571.54 million interactions across 30 categories from 1996 to 2023
  • Chronologically split interactions after removing users and items with fewer than 20 interactions
  • Official PUB repository at commit 52651aec47d79feb04d54fc57e8d4054e8972a3e; no source code present

Evidencia y localización

  • Problema, contribuciones y código declarado: SIGIR '25 paper, abstract, section 1 and footnote 1, pp. 1–2
  • Arquitectura de cuatro módulos: SIGIR '25 paper, Figure 1 and section 2, p. 2
  • Extracción de perfiles y muestreo temporal: SIGIR '25 paper, section 2.1 and equations 1–2, p. 2
  • Fusión de metadatos mediante prompt: SIGIR '25 paper, section 2.2, p. 3
  • Proxies de los cinco rasgos: SIGIR '25 paper, section 2.3, p. 3
  • Simulador y alcance de la tarea: SIGIR '25 paper, section 2.4, p. 3
  • Fuente Amazon, periodo, categorías y filtro: SIGIR '25 paper, section 3.1, p. 3
  • Lista con un positivo y nueve negativos y métrica Jaccard: SIGIR '25 paper, section 3.2.1, p. 3
  • Jaccard medio 0,31 y comparación de simuladores: SIGIR '25 paper, Figure 2 and section 3.2.1, p. 3
  • Siete recomendadores y nDCG@20 real frente a sintético: SIGIR '25 paper, Figure 3a and section 3.2.2, p. 4
  • Distribuciones inferidas e interpretación de neuroticismo: SIGIR '25 paper, Figure 3b and section 3.2.3, p. 4
  • Perfiles extremos de GRU4Rec: SIGIR '25 paper, Figure 3c and section 3.2.4, p. 4
  • Conclusión y único trabajo futuro declarado: SIGIR '25 paper, section 4, p. 4
  • Versión publicada, DOI y licencia: arXiv:2506.04551v1 and SIGIR '25 metadata; DOI 10.1145/3726302.3730238; CC BY 4.0
  • Repositorio sin código: Official PUB repository commit 52651aec47d79feb04d54fc57e8d4054e8972a3e; three tracked files; audited 15 Jul 2026