ES-MemEval: Benchmarking Conversational Agents on Personalized Long-Term Emotional Support

Personas, identidad y agentes2026arXivRevisión editorial aprobada

Autores: Tiantian Chen, Jiaqi Lu, Ying Shen, Lin Zhang

Palabras clave: Long-term conversational memory, Emotional support agents, Benchmark evaluation, Retrieval-augmented generation, LLM-as-judge, Synthetic data provenance

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
16
Hallazgos
21
Limitaciones
11
Evidencias

Resumen editorial

Español

ES-MemEval propone evaluar memoria conversacional longitudinal en agentes de apoyo emocional mediante cinco capacidades: extracción de información, razonamiento temporal, detección de conflictos, abstención y modelado del usuario. No estudia personalidad psicológica, identidad sintética ni eficacia terapéutica; su constructo defendible es la recuperación e integración de información personal dispersa a lo largo de conversaciones. El recurso asociado, EvoEmo, contiene 18 perfiles virtuales, 401 sesiones, 9.368 turnos, 446 eventos, 2.300 observaciones, 125 tareas de resumen y 34 escenarios de diálogo, con una historia media de 447,72 días. Los perfiles se construyen a partir de varios diálogos semilla de ESConv; GPT-4o expande dos veces las líneas temporales y genera sesiones posteriores que anotadores humanos refinan. El paper declara 1.209 preguntas QA, pero el JSON oficial contiene 1.427: 309 de extracción, 284 temporales, 267 de conflicto, 261 de abstención y 306 de modelado. El loader publicado recorre las 1.427 y no existe filtro, split ni lista de IDs que identifique las 1.209 evaluadas, por lo que las tablas QA no se pueden vincular al benchmark descargable. En los resultados declarados, Mistral-24B pasa con RAG de 15,5 a 18,8 F1, de 47,4 a 50,4 BERTScore y de 1,01 a 1,27 en el juez GPT-4o. Sin embargo, RAG no mejora todo: GPT-4o baja de 26,6 a 23,9 F1 global, mantiene 54,2 BERTScore y su puntuación de abstención cae de 1,67 a 1,30 aunque el juez global sube de 1,25 a 1,33. En resumen, RAG ayuda de forma dependiente del modelo, tarea, métrica y k; no de manera uniforme. En summarization todas las filas RAG publicadas mejoran, con GPT-4o+RAG en ROUGE-L 22,2, event F1 49,4 y juez 2,93. En generación, historia completa y RAG aumentan recuerdo de observaciones frente a no-memory, pero GPT-4o Full y RAG obtienen 5/5/5 de GPT-4o en memoria, personalización y apoyo, una circularidad de familia con techo. Las tres dimensiones están además definidas por el mismo rubric en torno a referencias al pasado y correlacionan casi perfectamente en Table 8: rho 0,984-0,987 entre pares. Esto mide concordancia con un juez y prompt concretos, no beneficio emocional o clínico independiente. La auditoría del artefacto encontró defectos que afectan directamente a los números. QA y summaries limpian la salida con strip("Answer:"), que elimina caracteres de ambos extremos, no un prefijo: `Answer: Peter` se vuelve `Pet` y `Answer: Unknown` se vuelve `Unkno`. Como 258 de 261 respuestas de abstención tienen gold `Unknown`, una salida correcta sin puntuación puede contabilizarse como error. El F1 usa conjuntos en vez de multiconjuntos y falla con strings vacíos. El NDCG descuenta la primera posición como 0,5, el muestreo puede llamar random.sample con k negativo y el vector store no registra IDs de su primera carga. Cuatro ejecutables de resumen, Mistral-8B base/RAG, Phi-3 base y Mistral-24B RAG, ejecutan en realidad QaExperiment, de modo que no generan cuatro filas de Table 6. No se liberan outputs, generaciones, logs de jueces ni CSV agregables, y el organizador apunta a rutas privadas `/home/lab509/...`; las tablas no pueden recalcularse. La calidad del JSON también exige reparación: 37 referencias de evidencia QA son inválidas, 3 preguntas repiten evidencias, 2 preguntas no-abstention no tienen evidencia y hay 7 pares de texto duplicado. La procedencia contradice una afirmación ética categórica. Ochenta y cinco sesiones conservan IDs ESConv, 58 reproducen diálogos completos tras normalización textual y 2.252 de 9.368 utterances coinciden con el corpus fuente; `esc1198` aparece en dos perfiles. ESConv es role-play de apoyo emocional escrito por crowdworkers, no expedientes clínicos ni conversaciones terapéuticas naturales, pero sí texto conversacional humano. Por eso EvoEmo es sintético/aumentado, no exclusivamente generado. Además, Zenodo marca todo el archivo CC-BY-4.0 aunque incorpora material ESConv CC-BY-NC-4.0 y descrito para investigación académica; falta aclarar procedencia y licencia, sin que esta auditoría emita una conclusión legal. La validación humana es útil pero estrecha: solo Mistral-24B Full/RAG, con 50 QA, 40 summaries y 30 diálogos. En DG RAG, kappa 0,19 y rho 0,20 conviven con 86,7 % exacto por efecto techo, lo que no valida ranking fino ni self-judging de GPT-4o. La conclusión fiel es que ES-MemEval ofrece una arquitectura de benchmark longitudinal interesante y evidencia preliminar de que memoria explícita y RAG pueden ayudar en varias condiciones. Sus cifras deben considerarse provisionales hasta publicar el split exacto de 1.209 preguntas, corregir el evaluador, liberar outputs, validar evidencias, documentar ESConv/licencias y ampliar evaluación humana independiente. No demuestra personalidad sintética, terapia segura ni preparación para producción.

English

ES-MemEval proposes evaluating longitudinal conversational memory in emotional-support agents through five capabilities: information extraction, temporal reasoning, conflict detection, abstention, and user modeling. It does not study psychological personality, synthetic identity, or therapeutic efficacy; its defensible construct is retrieval and integration of personal information dispersed across conversations. The associated EvoEmo resource contains 18 virtual profiles, 401 sessions, 9,368 turns, 446 events, 2,300 observations, 125 summarization tasks, and 34 dialogue scenarios, with a mean history span of 447.72 days. Profiles are assembled from multiple ESConv seed dialogues; GPT-4o expands the timelines twice and generates later sessions that human annotators refine. The paper reports 1,209 QA questions, but the official JSON contains 1,427: 309 information-extraction, 284 temporal, 267 conflict, 261 abstention, and 306 user-modeling items. The released loader iterates all 1,427 and no filter, split, or evaluated-ID list identifies the 1,209-item paper sample, so QA tables cannot be tied to the downloadable benchmark. In the reported results, Mistral-24B moves with RAG from 15.5 to 18.8 F1, 47.4 to 50.4 BERTScore, and 1.01 to 1.27 under the GPT-4o judge. RAG does not improve everything: GPT-4o overall F1 falls from 26.6 to 23.9, BERTScore stays at 54.2, and abstention judge score falls from 1.67 to 1.30 even as its overall judge score rises from 1.25 to 1.33. RAG therefore helps conditionally by model, task, metric, and k, not uniformly. Every published summarization RAG row improves, with GPT-4o+RAG at ROUGE-L 22.2, event F1 49.4, and judge score 2.93. In dialogue generation, full history and RAG improve observation recall over no-memory, but GPT-4o Full and RAG receive 5/5/5 from GPT-4o for memory, personalization, and emotional support, creating a same-family circularity and ceiling. The three dimensions are also defined by one rubric around past-experience references and correlate almost perfectly in Table 8: pairwise rho 0.984-0.987. This is agreement with one judge/prompt, not independent evidence of emotional or clinical benefit. The artifact audit found defects that directly affect metrics. QA and summaries clean outputs with strip("Answer:"), which removes any matching edge characters rather than a prefix: `Answer: Peter` becomes `Pet`, and `Answer: Unknown` becomes `Unkno`. Because 258 of 261 abstention gold answers are `Unknown`, a correct unpunctuated answer can be scored as wrong. F1 uses sets rather than token multisets and crashes on empty strings. NDCG discounts the first result as 0.5, candidate sampling can call random.sample with a negative k, and the vector store does not retain IDs from its first load. Four summarization executables, Mistral-8B base/RAG, Phi-3 base, and Mistral-24B RAG, actually instantiate QaExperiment, so they do not generate four Table 6 rows. No outputs, generations, judge logs, or aggregatable CSVs are released, and the result organizer points to private `/home/lab509/...` paths; the tables cannot be recomputed. The JSON also needs repair: 37 QA evidence references are invalid, 3 questions duplicate evidence, 2 non-abstention questions have no evidence, and 7 question-text pairs are duplicated. Provenance contradicts a categorical ethics statement. Eighty-five sessions retain ESConv IDs, 58 reproduce complete dialogues after text normalization, and 2,252 of 9,368 utterances match the source corpus; `esc1198` appears under two profiles. ESConv is emotional-support role-play written by crowdworkers, not clinical records or natural therapy conversations, but it is human-authored conversational text. EvoEmo is therefore synthetic/augmented, not exclusively generated. Zenodo also labels the entire archive CC-BY-4.0 although it incorporates ESConv material distributed as CC-BY-NC-4.0 and described for academic research; provenance and licensing require clarification, without this audit offering a legal conclusion. Human validation is useful but narrow: only Mistral-24B Full/RAG, with 50 QA, 40 summaries, and 30 dialogues. For DG RAG, kappa 0.19 and rho 0.20 coexist with 86.7% exact agreement because of ceiling concentration, which does not validate fine ranking or GPT-4o self-judging. The faithful conclusion is that ES-MemEval offers an interesting longitudinal benchmark architecture and preliminary evidence that explicit memory and RAG can help in several conditions. Its numbers should remain provisional until the exact 1,209-question split is released, evaluation code is repaired, raw outputs are published, evidence is validated, ESConv lineage/licenses are documented, and broader independent human evaluation is performed. It does not establish synthetic personality, safe therapy, or production readiness.

Pregunta de investigación

¿Hasta qué punto los LLM con historia completa o memoria recuperada pueden extraer, ordenar, reconciliar, abstenerse y modelar información personal implícita y cambiante a lo largo de conversaciones de apoyo emocional de varios meses?

Método

Los autores componen 18 perfiles a partir de varios diálogos semilla ESConv, expanden con GPT-4o dos veces las líneas temporales y generan/refinan sesiones longitudinales. Construyen QA, summaries y escenarios futuros de diálogo. Comparan Ministral-8B, Phi-3-Medium, Mistral-24B, GPT-3.5-turbo y GPT-4o con historia completa y RAG BGE-M3/FAISS. QA usa F1, BERTScore y juez GPT-4o; summaries usan ROUGE y extracción/juez GPT-4o; diálogo usa un seeker simulado por GPT-4o, un modelo supporter, juicios de observaciones por Mistral-24B y ratings globales por GPT-4o. La auditoría leyó y revisó visualmente las 12 páginas, verificó WWW '26/DOI, clonó el commit oficial y Zenodo, recontó todo el JSON, validó referencias, comparó con ESConv oficial, auditó licencia/procedencia, fórmulas, scripts, configuración, outputs, tests y reproducibilidad, y separó las afirmaciones del paper de lo que sostiene el artefacto.

Muestra: El paper describe 18 usuarios virtuales, 401 sesiones, 23,4 turnos y 13.291,6 tokens medios por conversación, 22,3 sesiones por usuario y 14,9 meses medios. El artefacto confirma 18 usuarios, 401 sesiones, 9.368 turnos, 2.300 observaciones, 446 eventos, 125 summaries y 34 topics. Contiene 1.427 QA, no las 1.209 de Table 2: 309 IE, 284 TR, 267 CD, 261 abstention y 306 UM. Los perfiles son 13 estadounidenses, 2 británicos, 2 singapurenses y 1 australiano; 11 mujeres y 7 hombres; edades 17-40. Ochenta y cinco sesiones señalan ESConv y 58 son matches completos normalizados. La fiabilidad humana usa únicamente outputs Mistral-24B Full/RAG y muestras de 50 QA, 40 summaries y 30 diálogos.

Hallazgos

  • Mistral-24B+RAG mejora frente a base en QA: 15,5→18,8 F1, 47,4→50,4 BERTScore y 1,01→1,27 judge.
  • GPT-4o+RAG baja 26,6→23,9 F1, mantiene 54,2 BERTScore y mejora 1,25→1,33 judge; su abstention judge cae 1,67→1,30.
  • Session top-8 logra Recall 81,7 y NDCG publicado 62,4, pero rinde peor downstream que top-2/top-4 en métricas principales.
  • En summaries, GPT-4o+RAG alcanza ROUGE-L 22,2, event F1 49,4 y judge 2,93.
  • Full/RAG mejoran métricas de observación frente a no-memory, pero GPT-4o se autoevalúa 5/5/5 en Full y RAG.
  • Las tres dimensiones de Table 8 tienen rho 0,975-0,987 entre pares bajo un rubric común ligado al pasado.
  • El JSON tiene 1.427 QA frente a 1.209 declaradas y el código público procesa las 1.427 sin filtro publicado.
  • Hay 37 evidencias QA inválidas, 3 listas con duplicados, 2 preguntas no-abstention sin evidencia y 7 pares de pregunta repetida.
  • 258/261 gold de abstention son Unknown y el limpiador convierte Answer: Unknown sin puntuación en Unkno.
  • Cuatro scripts de summarization ejecutan QaExperiment y no pueden producir sus filas de Table 6.
  • El NDCG publicado aplica descuento incorrecto, el candidate sampler puede recibir k negativo y all_documents omite la primera carga vectorial.
  • El F1 usa sets y puede lanzar ZeroDivisionError con strings vacíos.
  • No se publican outputs/resultados/logs; el agregador usa rutas privadas, así que las tablas no son reauditables.
  • 85 sesiones proceden de ESConv, 58 coinciden por completo y 2.252 utterances coinciden con texto fuente humano.
  • Zenodo marca el archivo CC-BY-4.0 pese a incorporar ESConv CC-BY-NC-4.0/academic research; la licencia requiere aclaración.
  • Los 119 Python parsean y el JSON es válido; no hay CI, suite automatizada, resultados liberados ni LICENSE en GitHub.

Limitaciones

  • El constructo es memoria conversacional, no personalidad psicológica ni identidad sintética.
  • Solo hay 18 perfiles, culturalmente estrechos, en inglés y mayoritariamente estadounidenses.
  • Un perfil tiene 17 años y el dominio contiene contenido sensible de salud emocional.
  • La mayor parte del corpus longitudinal es sintética/augmentada y puede reflejar estilo, sesgos y consistencia artificial de GPT-4o.
  • La afirmación de no contener conversaciones de usuarios reales omite 85 sesiones ESConv de role-play humano.
  • No son datos clínicos ni conversaciones terapéuticas naturales, por lo que tampoco validan desempeño clínico.
  • El benchmark evaluado de 1.209 preguntas no está identificado dentro del artefacto de 1.427.
  • Los defectos de limpieza, F1, NDCG, sampling, vector store y scripts de summary contaminan reproducibilidad y métricas.
  • Los 37 IDs de evidencia inválidos impiden rastreo perfecto de la supervisión.
  • RAG no mejora uniformemente y puede perjudicar abstención o rendimiento con k mayor.
  • GPT-4o juzga a GPT-4o en QA, summaries y diálogos; puede existir sesgo de familia y estilo.
  • Los ratings globales mezclan memoria, personalización y apoyo mediante definiciones dependientes.
  • Los 5/5 y la baja dispersión producen techo y reducen la validez de correlación/ranking.
  • La validación humana solo cubre dos condiciones de Mistral-24B y muestras pequeñas.
  • DG RAG tiene kappa 0,19 y rho 0,20; el alto acuerdo exacto no recupera discriminación fina.
  • No hay intervalos de confianza, variación por seed ni tests estadísticos para la mayoría de comparaciones.
  • No se liberan outputs, exclusiones, fallos por muestra o judge logs para reanálisis.
  • La licencia del archivo no separa claramente contenido original, generado y derivado de ESConv.
  • No hay LICENSE de repositorio, CI, tests, lockfile completo ni smoke test sin GPU/API.
  • El paper declara uso de A100 80GB; reproducir todo requiere modelos locales grandes y API comercial.
  • El recurso está marcado solo para investigación y no para counseling o clínica.

Qué no demuestra

  • No demuestra personalidad sintética, identidad persistente ni rasgos psicológicos del modelo.
  • No demuestra que los agentes evaluados sean terapeutas seguros o eficaces.
  • No demuestra mejora de salud mental, bienestar o calidad real de apoyo.
  • No identifica públicamente las 1.209 preguntas usadas en resultados.
  • No demuestra que las tablas puedan reproducirse con el commit publicado.
  • No demuestra que RAG ayude a todos los modelos, métricas, capacidades o valores de k.
  • No demuestra que el juez GPT-4o sea independiente o imparcial al evaluar GPT-4o.
  • No demuestra que 5/5 represente calidad perfecta fuera del rubric.
  • No demuestra que observation recall penalice todas las memorias inventadas.
  • No demuestra que abstention falle sin el sesgo del limpiador de respuestas.
  • No demuestra que EvoEmo carezca de diálogo humano: incorpora ESConv crowdworker role-play.
  • No demuestra que todo el archivo sea reutilizable sin restricciones bajo CC-BY-4.0.
  • No demuestra generalización cultural, multilingüe, clínica o de producción.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2602.01885v1, submitted 2 February 2026, 12 pages; WWW '26 DOI 10.1145/3774904.3792143; official repository/tag commit 692624208acc077b8867698c1d6fcd998dee641a; Zenodo 10.5281/zenodo.18338564

Fuente consultada: https://arxiv.org/abs/2602.01885v1

Revisión: Codex complete bilingual fidelity pass using the full 12-page arXiv v1 manuscript, all-page visual inspection, WWW '26/DOI metadata, official GitHub and Zenodo artifact audit, exact released-dataset recount, evidence-reference validation, official ESConv lineage comparison, license/provenance review, code/metric/reproducibility audit and independent Table 8 correlation checks; summaries written from full evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Ministral-8B-Instruct-2410
  • Phi-3-Medium-128k-Instruct
  • Mistral-Small-3.1-24B-Instruct-2503
  • GPT-3.5-turbo
  • GPT-4o
  • BGE-M3 embeddings

Instrumentos y métricas

  • ES-MemEval five-capability benchmark
  • Full-history and no-memory conditions
  • BGE-M3 plus FAISS retrieval
  • Token F1 and BERTScore
  • ROUGE-1, ROUGE-2 and ROUGE-L
  • GPT-4o LLM-as-judge
  • Mistral-24B observation relevance and usage judgments
  • Recall@k and published NDCG@k
  • Weighted Cohen kappa, Spearman correlation and MAD

Datos utilizados

  • EvoEmo released JSON
  • ES-MemEval QA benchmark
  • ES-MemEval summarization benchmark
  • ES-MemEval dialogue-generation scenarios
  • ESConv crowdworker role-play source corpus

Evidencia y localización

  • Constructo, creación de EvoEmo y tareas: arXiv v1 pages 1-4, Sections 1-4, Figures 1-2 and Table 2
  • Modelos, RAG y resultados QA/retrieval/contexto: arXiv v1 pages 4-6, Sections 5-6.1 and Tables 3-5
  • Summarization, diálogo y ratings globales: arXiv v1 pages 6-8, Sections 6.2-7 and Tables 6-8
  • Ética, limitaciones, anotadores y fiabilidad humana: arXiv v1 pages 8-12, Appendices A-D and Table 9
  • Counts reales, integridad de evidencia y demografía: Official data/evo_emo.json at commit 692624208acc077b8867698c1d6fcd998dee641a; independent full-file audit on 15 July 2026
  • Procedencia ESConv y matches de sesiones/utterances: Official EvoEmo JSON compared against thu-coai/ESConv official dataset snapshot; 85 source IDs, 58 complete normalized matches and 2,252 matching utterances
  • Licencias y metadatos del artefacto: Zenodo 10.5281/zenodo.18338564 v1.0.0 metadata, official GitHub tag v1.0.0 and thu-coai/ESConv dataset card/license
  • Defectos de Answer cleaning, F1, retrieval y scripts de summaries: src/lib/qa/qa_experiment.py, src/lib/sum/sum_experiment.py, vector_document_store.py, qa_retrieval_experiment.py and src/exe/sum at audited commit
  • Circularidad de jueces, prompts y correlación de dimensiones: All executable Config classes, dg_experiment.py, Table 8 values and independent rank-correlation calculation
  • Auditoría integral técnica, científica y de datos: reports/verification/article-202-es-memeval-data-code-and-validity-audit.json
  • Inspección visual completa: All 12 pages of arXiv:2602.01885v1 rendered and visually inspected on 15 July 2026