Este trabajo de COLING 2025 propone Persona-DB, un sistema de personalización por recuperación que transforma perfiles e historiales de usuario en una jerarquía de History, Distilled Persona, Induced Persona y Cache; busca usuarios similares con embeddings, recupera información del usuario y sus vecinos y pide a GPT-3.5-turbo-0613 que prediga una respuesta. Aquí «persona» no es personalidad psicométrica: son resúmenes e inferencias generados por LLM sobre valores, ideología, intereses, roles, opiniones y patrones de conducta. El paper evalúa dos tareas. RFPN contiene 13,3 mil respuestas de 8,4 mil usuarios a 3,8 mil titulares de Twitter y predice polaridad e intensidad de sentimiento. OpinionQA predice respuestas individuales a preguntas Pew en Biomedical and Food Issues, 67 preguntas, 2.537 personas, Global Attitudes, 104/2.596, y America in 2050, 90/2.524, con 1.000 casos de test por tema. En RFPN top-40, Persona-DB declara Spearman 47,67, Pearson 47,88, Micro-F1 62,66 y Macro-F1 50,59, frente a IntSum 44,89/45,05/59,96/47,32 y History Full 42,80/43,09/59,58/48,80. Para los 100 usuarios con historiales no vacíos más escasos, 13,81 interacciones de media, obtiene Pearson 56,75 frente a 45,41 de IntSum: +11,34 puntos, que el texto presenta como 11 %. Para los 300 usuarios más frecuentes logra 49,71 frente a 46,58. Pero la evidencia de eficiencia se estrecha al reducir capacidad: con top-10, Persona-DB solo supera a IntSum por 0,13 puntos Pearson y 0,20 de accuracy. Table 3 compara métodos con los mismos top-k 40/30/10 y no demuestra por sí sola la afirmación introductoria de un tamaño máximo diez veces menor. Tampoco informa coste total: la construcción jerárquica requiere llamadas y embeddings previos. Figure 3 muestra Persona-DB por encima de baselines en OpinionQA, pero solo como barras sin valores exactos, errores o outputs. La validación humana puntúa 50 extracciones con tres estudiantes y media 3,9/5, sin acuerdo entre evaluadores, dispersión o rúbrica suficiente. La auditoría del código cambia además la interpretación principal. get_user_profile2 elimina la pregunta objetivo del historial del usuario actual, pero UserRetriever.get_user_analysis con nb_hist_only=True incluye todos los pares pregunta-respuesta de los vecinos, el propio comentario dice que incluye la query actual. join_db los concatena y recupera elementos para el prompt. En OpinionQA, donde muchas personas contestan las mismas preguntas, el contexto colaborativo puede contener la respuesta de vecinos al ítem objetivo. Sin una reevaluación que excluya post_id de todas las bases vecinas, la mejora no separa generalización de persona, filtrado colaborativo de mismo ítem y fuga de etiqueta. El baseline History Full tampoco es literalmente completo: ambos runners eliminan registros hasta quedar en 2.000-2.500 tokens. No hay tests, CI, datos Persona-DB, data.txt nombrado por README, personas derivadas, embeddings, prompts ejecutados, predicciones ni resultados; RFPN exige reconstruir tweets desde punteros con una API antigua y falta el pipeline de preparación OpinionQA. El código compila sintácticamente, pero usa un entorno legado, dependencias amplias, retries indefinidos y carece de licencia general. El paper solo ofrece point estimates de un run, aunque usa temperatura 1; no publica intervalos, tests, repeticiones o bootstrap. La conclusión defendible es limitada: abstracciones jerárquicas y recuperación colaborativa pueden mejorar predicción de respuestas en estos datasets, especialmente con más capacidad y en usuarios escasos, pero el estudio no valida personalidad, fidelidad del perfil, generalización a usuarios o preguntas nuevas ni eficiencia operacional. La fuga potencial de la pregunta objetivo impide atribuir limpiamente los resultados OpinionQA al mecanismo de persona.
Pregunta de investigación
¿Puede una base jerárquica de perfiles e historiales, enriquecida con datos recuperados de usuarios similares, mantener o mejorar la predicción de respuestas personales usando menos elementos de contexto que historiales, recencia o resúmenes convencionales?