ES-MemEval propone evaluar memoria conversacional longitudinal en agentes de apoyo emocional mediante cinco capacidades: extracción de información, razonamiento temporal, detección de conflictos, abstención y modelado del usuario. No estudia personalidad psicológica, identidad sintética ni eficacia terapéutica; su constructo defendible es la recuperación e integración de información personal dispersa a lo largo de conversaciones. El recurso asociado, EvoEmo, contiene 18 perfiles virtuales, 401 sesiones, 9.368 turnos, 446 eventos, 2.300 observaciones, 125 tareas de resumen y 34 escenarios de diálogo, con una historia media de 447,72 días. Los perfiles se construyen a partir de varios diálogos semilla de ESConv; GPT-4o expande dos veces las líneas temporales y genera sesiones posteriores que anotadores humanos refinan. El paper declara 1.209 preguntas QA, pero el JSON oficial contiene 1.427: 309 de extracción, 284 temporales, 267 de conflicto, 261 de abstención y 306 de modelado. El loader publicado recorre las 1.427 y no existe filtro, split ni lista de IDs que identifique las 1.209 evaluadas, por lo que las tablas QA no se pueden vincular al benchmark descargable. En los resultados declarados, Mistral-24B pasa con RAG de 15,5 a 18,8 F1, de 47,4 a 50,4 BERTScore y de 1,01 a 1,27 en el juez GPT-4o. Sin embargo, RAG no mejora todo: GPT-4o baja de 26,6 a 23,9 F1 global, mantiene 54,2 BERTScore y su puntuación de abstención cae de 1,67 a 1,30 aunque el juez global sube de 1,25 a 1,33. En resumen, RAG ayuda de forma dependiente del modelo, tarea, métrica y k; no de manera uniforme. En summarization todas las filas RAG publicadas mejoran, con GPT-4o+RAG en ROUGE-L 22,2, event F1 49,4 y juez 2,93. En generación, historia completa y RAG aumentan recuerdo de observaciones frente a no-memory, pero GPT-4o Full y RAG obtienen 5/5/5 de GPT-4o en memoria, personalización y apoyo, una circularidad de familia con techo. Las tres dimensiones están además definidas por el mismo rubric en torno a referencias al pasado y correlacionan casi perfectamente en Table 8: rho 0,984-0,987 entre pares. Esto mide concordancia con un juez y prompt concretos, no beneficio emocional o clínico independiente. La auditoría del artefacto encontró defectos que afectan directamente a los números. QA y summaries limpian la salida con strip("Answer:"), que elimina caracteres de ambos extremos, no un prefijo: `Answer: Peter` se vuelve `Pet` y `Answer: Unknown` se vuelve `Unkno`. Como 258 de 261 respuestas de abstención tienen gold `Unknown`, una salida correcta sin puntuación puede contabilizarse como error. El F1 usa conjuntos en vez de multiconjuntos y falla con strings vacíos. El NDCG descuenta la primera posición como 0,5, el muestreo puede llamar random.sample con k negativo y el vector store no registra IDs de su primera carga. Cuatro ejecutables de resumen, Mistral-8B base/RAG, Phi-3 base y Mistral-24B RAG, ejecutan en realidad QaExperiment, de modo que no generan cuatro filas de Table 6. No se liberan outputs, generaciones, logs de jueces ni CSV agregables, y el organizador apunta a rutas privadas `/home/lab509/...`; las tablas no pueden recalcularse. La calidad del JSON también exige reparación: 37 referencias de evidencia QA son inválidas, 3 preguntas repiten evidencias, 2 preguntas no-abstention no tienen evidencia y hay 7 pares de texto duplicado. La procedencia contradice una afirmación ética categórica. Ochenta y cinco sesiones conservan IDs ESConv, 58 reproducen diálogos completos tras normalización textual y 2.252 de 9.368 utterances coinciden con el corpus fuente; `esc1198` aparece en dos perfiles. ESConv es role-play de apoyo emocional escrito por crowdworkers, no expedientes clínicos ni conversaciones terapéuticas naturales, pero sí texto conversacional humano. Por eso EvoEmo es sintético/aumentado, no exclusivamente generado. Además, Zenodo marca todo el archivo CC-BY-4.0 aunque incorpora material ESConv CC-BY-NC-4.0 y descrito para investigación académica; falta aclarar procedencia y licencia, sin que esta auditoría emita una conclusión legal. La validación humana es útil pero estrecha: solo Mistral-24B Full/RAG, con 50 QA, 40 summaries y 30 diálogos. En DG RAG, kappa 0,19 y rho 0,20 conviven con 86,7 % exacto por efecto techo, lo que no valida ranking fino ni self-judging de GPT-4o. La conclusión fiel es que ES-MemEval ofrece una arquitectura de benchmark longitudinal interesante y evidencia preliminar de que memoria explícita y RAG pueden ayudar en varias condiciones. Sus cifras deben considerarse provisionales hasta publicar el split exacto de 1.209 preguntas, corregir el evaluador, liberar outputs, validar evidencias, documentar ESConv/licencias y ampliar evaluación humana independiente. No demuestra personalidad sintética, terapia segura ni preparación para producción.
Pregunta de investigación
¿Hasta qué punto los LLM con historia completa o memoria recuperada pueden extraer, ordenar, reconciliar, abstenerse y modelar información personal implícita y cambiante a lo largo de conversaciones de apoyo emocional de varios meses?