PersonaAgent with GraphRAG: Community-Aware Knowledge Graphs for Personalized LLM

Personas, identidad y agentes2025arXivRevisión editorial aprobada

Autores: Siqi Liang, Yudi Zhang, Yingying Guo

Palabras clave: Large Language Models, Personality Control, Prompting, Persona, Steering

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
5
Hallazgos
6
Limitaciones
5
Evidencias

Resumen editorial

Español

PersonaAgent con GraphRAG es una propuesta de personalización que combina el historial individual de un usuario con patrones recuperados de otros usuarios. El sistema representa interacciones, conceptos y categorías en un grafo heterogéneo. Para cada consulta, selecciona mediante similitud TF-IDF tanto interacciones del propio usuario como interacciones globales, añade preferencias por categoría y conceptos relacionados, y linealiza ese contexto en un prompt para el LLM. La evaluación usa tres tareas de LaMP: categorización personalizada de noticias, etiquetado de películas y predicción de valoraciones de productos. Frente a la versión previa PersonaAgent, el método obtiene en LaMP-2N 0,804 de accuracy y 0,591 de F1; en LaMP-2M, 0,653 y 0,662; y en LaMP-3 reduce MAE a 0,216 y RMSE a 0,484. Los porcentajes destacados por los autores, +11,1 % de F1 en noticias, +56,1 % en películas y −10,4 % de MAE en productos, son mejoras relativas sobre PersonaAgent. Un ejemplo cualitativo muestra que añadir noticias globalmente similares corrige una clasificación de Llama 3 8B sesgada por el historial temático del usuario. El trabajo evidencia que, en estos tres conjuntos y con esta configuración, incorporar contexto comunitario puede mejorar las métricas de personalización. Sin embargo, no incluye intervalos, pruebas de significación ni una ablación que separe la contribución del grafo, la recuperación personal, la recuperación global y el formato del prompt. Tampoco evalúa con usuarios la explicabilidad alegada, la adaptación longitudinal ni los riesgos de privacidad, homogeneización o filtración entre perfiles. Aquí «persona» significa un perfil inferido del historial de interacción, no un rasgo psicológico validado.

English

PersonaAgent with GraphRAG is a personalization framework that combines an individual user's history with patterns retrieved from other users. It represents interactions, concepts, and categories in a heterogeneous graph. For each query, TF-IDF similarity retrieves both user-specific and global interactions; category preferences and related concepts are then linearized into a prompt for the language model. The evaluation covers three LaMP tasks: personalized news categorization, movie tagging, and product-rating prediction. Relative to the earlier PersonaAgent baseline, the method reaches 0.804 accuracy and 0.591 F1 on LaMP-2N, 0.653 and 0.662 on LaMP-2M, and lowers MAE to 0.216 and RMSE to 0.484 on LaMP-3. The headline improvements, 11.1% higher news F1, 56.1% higher movie F1, and 10.4% lower product MAE, are relative changes over PersonaAgent. A qualitative example shows global neighbor articles correcting a Llama 3 8B classification that had been pulled toward an overrepresented topic in one user's history. The study therefore supports the narrower claim that community context can improve these personalization metrics on the tested datasets and setup. It does not report uncertainty estimates, significance tests, or an ablation separating the effects of graph structure, personal retrieval, global retrieval, and prompt formatting. Nor does it evaluate the claimed explainability with users, longitudinal adaptation, privacy, cross-user leakage, or homogenization risks. In this paper, “persona” denotes a profile inferred from interaction history rather than a validated psychological trait.

Pregunta de investigación

¿Mejora la personalización en tareas LaMP al construir los prompts de un agente con un grafo que combina historial individual, preferencias por categoría, conceptos y patrones de interacción recuperados de la comunidad?

Método

El sistema construye un grafo heterogéneo con nodos de interacción, concepto y categoría, y aristas interacción-categoría, interacción-concepto y concepto-concepto. Recupera Top-K del historial personal y del conjunto global mediante similitud coseno sobre TF-IDF, añade distribuciones de preferencias y clústeres conceptuales, y forma un prompt personalizado. Se evalúa frente a Non-Personalized, ReAct, MemBank y PersonaAgent en LaMP-2N, LaMP-2M y LaMP-3 usando accuracy, F1, MAE y RMSE. Los conjuntos de prueba incluyen los 100 usuarios con historiales más extensos de cada tarea, a partir de una partición temporal.

Muestra: Para las pruebas se seleccionan los 100 usuarios con mayor historial en cada tarea. Los datos de entrenamiento usados para construir el grafo contienen 274 usuarios en noticias, 829 en películas y 1.000 en valoraciones de productos.

Hallazgos

  • En LaMP-2N, PersonaAgent con GraphRAG obtiene 0,804 de accuracy y 0,591 de F1, frente a 0,796 y 0,532 de PersonaAgent.
  • En LaMP-2M alcanza 0,653 de accuracy y 0,662 de F1, frente a 0,513 y 0,424; la mejora relativa de F1 reportada es 56,1 %.
  • En LaMP-3 reduce MAE de 0,241 a 0,216 y RMSE de 0,509 a 0,484 frente a PersonaAgent.
  • En la comparación de modelos para LaMP-2N, Claude 3.5 Sonnet ofrece el mejor F1 y recall descritos, mientras Claude 4 queda por debajo; el artículo atribuye este último resultado a respuestas sobrecomplicadas, sin un análisis causal.
  • El caso presentado muestra que interacciones similares de otros usuarios pueden corregir una predicción dominada por un historial personal temáticamente estrecho.

Limitaciones

  • No se presentan desviaciones, intervalos de confianza ni pruebas de significación para las diferencias entre métodos.
  • Falta una ablación que aísle cuánto aporta cada componente: estructura del grafo, recuperación personal, recuperación global, conceptos, categorías o construcción del prompt.
  • La evaluación se limita a tres tareas LaMP y a los 100 usuarios con más actividad, lo que puede no representar usuarios con historiales escasos.
  • La explicación cualitativa se basa en un caso; no hay evaluación humana de explicabilidad, utilidad o coherencia del perfil.
  • No se analizan privacidad, filtración de información entre usuarios, sesgos comunitarios ni el riesgo de reducir preferencias minoritarias hacia patrones globales.
  • Aunque la motivación menciona preferencias cambiantes, el experimento no mide adaptación longitudinal ni consistencia a lo largo del tiempo.

Qué no demuestra

  • No demuestra que GraphRAG sea superior en cualquier dominio, modelo o población de usuarios.
  • No prueba que el agente posea una personalidad psicológica; la persona es una representación operativa de preferencias observadas.
  • No valida que el sistema sea explicable para usuarios ni que sus recomendaciones sean más justas, seguras o privadas.
  • No permite atribuir la mejora específicamente al conocimiento comunitario sin las ablaciones correspondientes.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2511.17467v2

Fuente consultada: https://arxiv.org/pdf/2511.17467

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • Mistral Small
  • LLaMA2-7B
  • LLaMA3-8B
  • Claude 3.5 Sonnet
  • Claude 4

Instrumentos y métricas

  • TF-IDF cosine similarity retrieval
  • Heterogeneous knowledge graph
  • Accuracy
  • F1
  • Mean absolute error (MAE)
  • Root mean squared error (RMSE)

Datos utilizados

  • LaMP-2N personalized news categorization
  • LaMP-2M personalized movie tagging
  • LaMP-3 personalized product rating

Evidencia y localización

  • Arquitectura del grafo, tipos de nodos y recuperación dual: Paper, pp. 2–3, Methodology, Knowledge Graph Construction and GraphRAG Retrieval Mechanism
  • Construcción del prompt personalizado: Paper, p. 3, Personalized Prompt Generation and Algorithm 1
  • Datasets, selección de usuarios y tamaños de entrenamiento: Paper, p. 3, Results, Data Description
  • Resultados cuantitativos frente a baselines: Paper, pp. 3–4, Metrics Comparison and Table 1
  • Ejemplo cualitativo y alcance de las conclusiones: Paper, p. 4, Case Study and Conclusion