Persona-DB: Efficient Large Language Model Personalization for Response Prediction with Collaborative Data Refinement

Personas, identidad y agentes2025ACL AnthologyRevisión editorial aprobada

Autores: Chenkai Sun, Ke Yang, Revanth Gangi Reddy, Yi R. Fung, Hou Pong Chan, Kevin Small, ChengXiang Zhai, Heng Ji

Palabras clave: Large Language Models, Persona, Personalization, Retrieval-Augmented Generation, User Modeling, Collaborative Filtering, Response Prediction, Privacy and Profiling

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

8
Autores
14
Hallazgos
26
Limitaciones
10
Evidencias

Resumen editorial

Español

Este trabajo de COLING 2025 propone Persona-DB, un sistema de personalización por recuperación que transforma perfiles e historiales de usuario en una jerarquía de History, Distilled Persona, Induced Persona y Cache; busca usuarios similares con embeddings, recupera información del usuario y sus vecinos y pide a GPT-3.5-turbo-0613 que prediga una respuesta. Aquí «persona» no es personalidad psicométrica: son resúmenes e inferencias generados por LLM sobre valores, ideología, intereses, roles, opiniones y patrones de conducta. El paper evalúa dos tareas. RFPN contiene 13,3 mil respuestas de 8,4 mil usuarios a 3,8 mil titulares de Twitter y predice polaridad e intensidad de sentimiento. OpinionQA predice respuestas individuales a preguntas Pew en Biomedical and Food Issues, 67 preguntas, 2.537 personas, Global Attitudes, 104/2.596, y America in 2050, 90/2.524, con 1.000 casos de test por tema. En RFPN top-40, Persona-DB declara Spearman 47,67, Pearson 47,88, Micro-F1 62,66 y Macro-F1 50,59, frente a IntSum 44,89/45,05/59,96/47,32 y History Full 42,80/43,09/59,58/48,80. Para los 100 usuarios con historiales no vacíos más escasos, 13,81 interacciones de media, obtiene Pearson 56,75 frente a 45,41 de IntSum: +11,34 puntos, que el texto presenta como 11 %. Para los 300 usuarios más frecuentes logra 49,71 frente a 46,58. Pero la evidencia de eficiencia se estrecha al reducir capacidad: con top-10, Persona-DB solo supera a IntSum por 0,13 puntos Pearson y 0,20 de accuracy. Table 3 compara métodos con los mismos top-k 40/30/10 y no demuestra por sí sola la afirmación introductoria de un tamaño máximo diez veces menor. Tampoco informa coste total: la construcción jerárquica requiere llamadas y embeddings previos. Figure 3 muestra Persona-DB por encima de baselines en OpinionQA, pero solo como barras sin valores exactos, errores o outputs. La validación humana puntúa 50 extracciones con tres estudiantes y media 3,9/5, sin acuerdo entre evaluadores, dispersión o rúbrica suficiente. La auditoría del código cambia además la interpretación principal. get_user_profile2 elimina la pregunta objetivo del historial del usuario actual, pero UserRetriever.get_user_analysis con nb_hist_only=True incluye todos los pares pregunta-respuesta de los vecinos, el propio comentario dice que incluye la query actual. join_db los concatena y recupera elementos para el prompt. En OpinionQA, donde muchas personas contestan las mismas preguntas, el contexto colaborativo puede contener la respuesta de vecinos al ítem objetivo. Sin una reevaluación que excluya post_id de todas las bases vecinas, la mejora no separa generalización de persona, filtrado colaborativo de mismo ítem y fuga de etiqueta. El baseline History Full tampoco es literalmente completo: ambos runners eliminan registros hasta quedar en 2.000-2.500 tokens. No hay tests, CI, datos Persona-DB, data.txt nombrado por README, personas derivadas, embeddings, prompts ejecutados, predicciones ni resultados; RFPN exige reconstruir tweets desde punteros con una API antigua y falta el pipeline de preparación OpinionQA. El código compila sintácticamente, pero usa un entorno legado, dependencias amplias, retries indefinidos y carece de licencia general. El paper solo ofrece point estimates de un run, aunque usa temperatura 1; no publica intervalos, tests, repeticiones o bootstrap. La conclusión defendible es limitada: abstracciones jerárquicas y recuperación colaborativa pueden mejorar predicción de respuestas en estos datasets, especialmente con más capacidad y en usuarios escasos, pero el estudio no valida personalidad, fidelidad del perfil, generalización a usuarios o preguntas nuevas ni eficiencia operacional. La fuga potencial de la pregunta objetivo impide atribuir limpiamente los resultados OpinionQA al mecanismo de persona.

English

This COLING 2025 paper proposes Persona-DB, a retrieval-based personalization system that transforms user profiles and histories into a hierarchy of History, Distilled Persona, Induced Persona, and Cache; it embeds these representations to match similar users, retrieves information from the current and neighboring users, and asks GPT-3.5-turbo-0613 to predict a response. Persona here is not psychometric personality: it consists of LLM-generated summaries and inferences about values, ideology, interests, roles, opinions, and behavioral patterns. The paper evaluates two tasks. RFPN contains 13.3k responses from 8.4k users to 3.8k Twitter headlines and predicts sentiment polarity and intensity. OpinionQA predicts individual Pew survey responses for Biomedical and Food Issues, 67 questions and 2,537 respondents, Global Attitudes, 104/2,596, and America in 2050-90/2,524, with 1,000 test cases per topic. At RFPN top-40, Persona-DB reports 47.67 Spearman, 47.88 Pearson, 62.66 Micro-F1, and 50.59 Macro-F1, versus 44.89/45.05/59.96/47.32 for IntSum and 42.80/43.09/59.58/48.80 for History Full. For the 100 sparsest nonempty-history users, 13.81 interactions on average, it obtains 56.75 Pearson versus 45.41 for IntSum, a difference of 11.34 points that the paper describes as 11%. For the 300 most frequent users it reaches 49.71 versus 46.58. Efficiency evidence narrows as capacity falls: at top-10, Persona-DB exceeds IntSum by only 0.13 Pearson points and 0.20 accuracy points. Table 3 compares methods at equal top-k values of 40, 30, and 10 and does not itself establish the introduction's ten-times-smaller maximal retrieval claim. It also does not measure total cost, because hierarchical construction requires prior LLM and embedding calls. Figure 3 places Persona-DB above baselines on OpinionQA, but provides bars without exact values, errors, or outputs. Human validation scores 50 extractions using three graduate students and reports a 3.9/5 mean, without inter-rater agreement, dispersion, or a sufficiently reported rubric. Code audit materially changes the main interpretation. get_user_profile2 excludes the target question from the current user's history, but UserRetriever.get_user_analysis with nb_hist_only=True includes every neighboring question-answer pair, the source comment explicitly says it includes the current query. join_db concatenates these records before retrieval into the prompt. In OpinionQA, where many respondents answer the same survey questions, collaborative context can therefore contain neighbors' answers to the exact target item. Without rerunning evaluation after excluding post_id from every neighboring database, the reported gain cannot distinguish persona generalization from same-item collaborative filtering and label leakage. History Full is not literally complete either: both runners remove records until histories fit 2,000-2,500 tokens. The release has no tests, CI, Persona-DB data, README-referenced data.txt, derived personas, embeddings, executed prompts, predictions, or results; RFPN requires reconstructing tweets from pointers through an old API workflow, and OpinionQA preparation code is absent. Source compiles syntactically but uses a legacy environment, broad dependencies, unbounded retries, and no repository-wide license. The paper supplies point estimates from one run at temperature 1 without intervals, tests, replications, or bootstrap. The defensible conclusion is narrow: hierarchical profile abstractions and collaborative retrieval may improve response prediction on these datasets, especially with larger retrieval capacity and sparse users, but the study does not validate personality, profile fidelity, unseen-user or unseen-question generalization, or operational efficiency. Potential target-question leakage prevents clean attribution of OpinionQA results to the persona mechanism.

Pregunta de investigación

¿Puede una base jerárquica de perfiles e historiales, enriquecida con datos recuperados de usuarios similares, mantener o mejorar la predicción de respuestas personales usando menos elementos de contexto que historiales, recencia o resúmenes convencionales?

Método

GPT-3.5-turbo-0613 destila el historial en campos de persona y luego induce creencias más generales. Un Cache de categorías de alto nivel se usa para representar y emparejar usuarios con text-embedding-ada-002. Para cada query se recuperan top-k elementos del usuario y de vecinos, se concatenan en una proporción fija y GPT-3.5 predice polaridad/intensidad RFPN o una opción OpinionQA. La auditoría reconcilia tablas, inspecciona las 16 páginas publicadas, compila 34 fuentes Python y traza exclusión de post_id, JOIN, límites de tokens, métricas, datos ausentes, dependencias y licencia en el commit oficial.

Muestra: RFPN declara 13,3 mil respuestas de 8,4 mil usuarios a 3,8 mil titulares; sus splits son 10.977/1.341/1.039 filas y 7.243/1.206/961 usuarios. OpinionQA usa tres waves/temas Pew con 2.524-2.596 encuestados y 67-104 preguntas, evaluando 1.000 ejemplos por tema. Los casos cold-start son los 100 historiales no vacíos más cortos, media 13,81, y frequent los 300 más largos. No se publican los registros necesarios para verificar solapamiento de usuarios, preguntas o fuga a escala.

Hallazgos

  • La fuente autoritativa es COLING 2025, Anthology ID 2025.coling-main.20, páginas 281-296; se renderizaron e inspeccionaron visualmente las 16 páginas.
  • RFPN top-40: Persona-DB 47,67 Spearman, 47,88 Pearson, 62,66 Micro-F1 y 50,59 Macro-F1.
  • Frente a IntSum top-40 las diferencias son +2,78 Spearman, +2,83 Pearson, +2,70 Micro-F1 y +3,27 Macro-F1.
  • Cold-start: Pearson 56,75 frente a 45,41 de IntSum, +11,34 puntos en escala 0-100; no una mejora universal relativa.
  • Frequent users: Persona-DB 49,71 Pearson frente a 46,58 de IntSum y 45,07 de History Full.
  • En top-10, la ventaja frente a IntSum cae a 0,13 Pearson y 0,20 accuracy.
  • Table 3 solo compara métodos con top-k iguales; no contiene una comparación que demuestre diez veces menos capacidad máxima.
  • OpinionQA se publica como gráfico sin cifras exactas, incertidumbre ni resultados descargables.
  • La validación de 50 extracciones obtiene media 3,9/5, pero no publica acuerdo, dispersión, muestreo o análisis de errores.
  • El código elimina post_id solo del historial del usuario evaluado y conserva la misma pregunta en historiales vecinos.
  • UserRetriever.get_user_analysis en modo nb_hist_only incluye explícitamente la query actual del vecino; JOIN entrega esos pares a recuperación.
  • History Full se trunca en código a un límite de 2.000-2.500 tokens.
  • Los tres objetos train/dev/test de OpinionQA cargan el mismo archivo test; un case path concatena las tres copias.
  • Los 34 ficheros Python compilan, pero el repositorio no contiene datos, outputs, tests, resultados ni licencia general.

Limitaciones

  • No se excluye la pregunta objetivo de todas las bases colaborativas; existe fuga potencial de respuesta en OpinionQA.
  • No se publica un ablation leakage-free que compare JOIN con vecinos sin el mismo post_id.
  • No se documenta un split held-out por usuario, pregunta o survey wave para OpinionQA.
  • No se prueba transferencia a usuarios, preguntas, plataformas, idiomas o culturas nuevas.
  • Persona significa inferencias de perfil generadas por LLM, no personalidad medida.
  • Los prompts infieren valores, ideología, moral, roles, profesión, posesiones e intereses potencialmente sensibles.
  • La validación 3,9/5 carece de acuerdo entre evaluadores, CI, distribución y auditoría por categoría.
  • No hay evaluación de exactitud factual, estabilidad temporal o consentimiento de las personas inferidas.
  • No hay fairness, subgrupos, calibración, privacidad, membership inference o sensitive-attribute leakage.
  • La composición colaborativa puede compartir respuestas y perfiles sensibles entre usuarios y amplificar estereotipos.
  • El paper reconoce riesgos de estereotipo, vigilancia, targeting, consentimiento y transparencia, pero el código no implementa mitigaciones.
  • Los resultados son point estimates de una ejecución; no hay tests, CI, repeticiones, bootstrap ni predicciones públicas.
  • Temperatura 1 y seed de API no garantizan repetibilidad ni estiman varianza.
  • El beneficio top-10 frente a IntSum es mínimo y podría estar dentro de variación no medida.
  • La eficiencia se evalúa por número de elementos, no por tokens, latencia, dólares, almacenamiento o cómputo total.
  • El coste previo de extracción jerárquica y embeddings no se cuantifica ni amortiza.
  • History Full no representa necesariamente el historial completo por truncamiento de tokens.
  • Figure 3 no proporciona valores OpinionQA exactos ni barras de error.
  • RFPN no se distribuye: reconstruir tweets desde punteros y APIs cambiadas puede ser imposible.
  • Falta preparación OpinionQA, data.txt, personas derivadas, embeddings, prompts, outputs y tablas.
  • Los modelos OpenAI usados son servicios propietarios retirados; no hay trazas request-response.
  • El entorno Python 3.7/PyTorch 1.9 y numerosas dependencias antiguas dificultan ejecución actual.
  • La API reintenta indefinidamente sin timeout, límite de retries, cost cap o logging estructurado.
  • Outputs OpinionQA mal formados caen a clase 0, mezclando error de generación con respuesta sustantiva.
  • No existe licencia top-level y el BLEU scorer vendorizado conserva un aviso restrictivo junto a una licencia MIT.
  • No hay estudio prospectivo de experiencia, utilidad o daño en usuarios reales.

Qué no demuestra

  • No demuestra que Persona-DB mida personalidad o rasgos psicométricos.
  • No valida que los perfiles generados sean verdaderos, estables o consentidos.
  • No demuestra que la mejora OpinionQA sobreviva al eliminar la pregunta objetivo de todos los vecinos.
  • No separa limpiamente persona generalizable de filtrado colaborativo por mismo ítem o fuga de etiqueta.
  • No establece generalización a usuarios o preguntas nuevas.
  • No demuestra diez veces menos tokens, coste, latencia, almacenamiento o cómputo total.
  • No demuestra significación estadística ni robustez de diferencias pequeñas.
  • No demuestra que History Full sea un baseline de historial realmente completo.
  • No establece privacidad, equidad o seguridad para profiling sensible.
  • No reproduce las tablas publicadas desde el artefacto oficial.

Trazabilidad

Alcance: Texto completo

Versión: Proceedings of COLING 2025, Anthology ID 2025.coling-main.20, pages 281-296, 16 pages

Fuente consultada: https://aclanthology.org/2025.coling-main.20/

Revisión: Codex complete bilingual full-text fidelity pass using the published COLING version, all-page visual inspection, official repository and linked RFPN artifact audit, exact Table 1-3 reconciliation, neighbor target-question leakage tracing, History Full truncation review, OpinionQA split-path audit, extraction-validation assessment, construct-boundary correction, efficiency-claim review, dependency and license inventory, and end-to-end reproducibility assessment; summaries written from paper and artifact evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • openai/gpt-3.5-turbo-0613 for persona extraction and downstream prediction
  • openai/text-embedding-ada-002 for user and item retrieval
  • microsoft/llmlingua-2-xlm-roberta-large-meetingbank comparison
  • TheBloke/Llama-2-7b-Chat-GPTQ optional legacy LLMLingua paths in released code

Instrumentos y métricas

  • LLM-generated Distilled Persona, Induced Persona, and Cache fields
  • Cosine-similarity user and item retrieval
  • Collaborative JOIN by concatenating neighbor database entries
  • RFPN sentiment polarity and ordinal intensity prediction
  • OpinionQA multiple-choice response prediction
  • Spearman and Pearson correlations
  • Micro-F1 and Macro-F1; Micro-F1 acts as accuracy for single-label classification
  • MSE and one-minus-normalized Wasserstein alignment score
  • Three-rater 50-item extraction-quality score
  • Independent target-leakage, construct-boundary, efficiency, artifact, and licensing audit

Datos utilizados

  • RFPN: reported 13.3k reactions, 8.4k users, and 3.8k Twitter news headlines
  • RFPN train 10,977; development 1,341; test 1,039
  • OpinionQA Biomedical and Food Issues: 67 questions and 2,537 respondents
  • OpinionQA Global Attitudes: 104 questions and 2,596 respondents
  • OpinionQA America in 2050: 90 questions and 2,524 respondents
  • OpinionQA reported 1,000-sample test split per topic
  • No Persona-DB dataset, derived persona, prediction, embedding, or result files released

Evidencia y localización

  • Alcance, jerarquía y mecanismo JOIN: Published pages 281-284, Abstract and Sections 1-2
  • Datasets, modelos, métricas y Table 1: Published pages 285-286, Sections 3.1-3.3 and Table 1
  • Cold-start, frequent users y capacidad de recuperación: Published page 287, Sections 3.4-3.5 and Tables 2-3
  • Composición, conclusiones, limitaciones y ética: Published pages 288-289, Sections 3.6-5, Limitations and Ethics Statements
  • Splits, validación humana, Wasserstein, LLMLingua y prompts: Published pages 292-296, Appendix A and Tables 4-6, Figures 5-13
  • Fuga potencial de target question en vecinos: Official repository commit c6bb783, utils/data_utils.py get_user_profile2/get_user_analysis/join_db and llm_predict_opinionqa.py audited 15 July 2026
  • Truncamiento de History Full y duplicación train/dev/test OpinionQA: Official repository commit c6bb783, llm_predict.py and llm_predict_opinionqa.py audited 15 July 2026
  • Reproducibilidad, dependencias, archivos ausentes y licencia: Official repository tree at commit c6bb783 and linked response_forecasting commit 808f738 audited 15 July 2026
  • Auditoría integral de fuga, constructo, eficiencia y artefacto: reports/verification/article-194-persona-db-leakage-and-artifact-audit.json
  • Inspección visual completa: All 16 published COLING PDF pages rendered and visually inspected on 15 July 2026