A-MEM: Agentic Memory for LLM Agents

Personas, identidad y agentes2025arXivRevisión editorial aprobada

Autores: Wujiang Xu, Zujie Liang, Kai Mei, Hang Gao, Juntao Tan, Yongfeng Zhang

Palabras clave: Computation and Language, Human-Computer Interaction

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
7
Hallazgos
18
Limitaciones
11
Evidencias

Resumen editorial

Español

A-MEM es un sistema de memoria para agentes LLM inspirado en Zettelkasten; no es un estudio de personalidad sintética. Cada intervención conversacional se transforma mediante un LLM en una nota con contenido, contexto, palabras clave, etiquetas y marcas temporales. Un embedding recupera recuerdos candidatos, otro paso LLM decide si crear enlaces o actualizar el contexto y las etiquetas de recuerdos vecinos, y la respuesta final usa los k recuerdos recuperados. El artículo evalúa preguntas sobre conversaciones largas de LoCoMo y DialSim. En LoCoMo compara A-MEM con introducir todo el contexto, ReadAgent, MemoryBank y MemGPT sobre GPT-4o-mini, GPT-4o, Qwen2.5-1.5B/3B y Llama-3.2-1B/3B; el apéndice añade DeepSeek-R1-32B y Claude 3 Haiku/3.5 Haiku. Publica F1, BLEU-1, ROUGE-2/L, METEOR y similitud SBERT. A-MEM mejora especialmente Multi-Hop y Temporal, y en DialSim alcanza F1 3,45 frente a 2,55 de contexto completo y 1,18 de MemGPT. Sin embargo, no domina todas las celdas de LoCoMo: el contexto completo o MemGPT obtienen mejores resultados en varias combinaciones Single-Hop, Open Domain o Adversarial. Por tanto, la afirmación general de superioridad frente a todos los baselines excede sus propias tablas. La ablación con GPT-4o-mini apoya que Link Generation y Memory Evolution aportan rendimiento, pero no hay repeticiones, intervalos, tests de significación ni evaluación humana. El checklist confirma expresamente esa ausencia por coste de API. El k se ajusta por modelo y categoría hasta 50 sin documentar un conjunto de validación separado, lo que introduce riesgo de selección sobre el benchmark. Las figuras t-SNE son visualizaciones sin semilla, parámetros ni medida cuantitativa de estructura, y no prueban que la memoria sea semánticamente mejor. Las cifras de eficiencia tampoco equivalen a liderazgo absoluto: A-MEM usa unos 1.200–2.500 tokens frente a unos 16.900 de contexto completo/MemGPT, pero ReadAgent y MemoryBank usan aún menos en la Tabla 1; a un millón de entradas A-MEM reporta 3,70 µs de recuperación frente a 1,91 µs de MemoryBank. El coste inferior a 0,0003 dólares por operación carece de modelo tarifario, fecha y cálculo reproducible. El código oficial de evaluación auditado en el commit 0c8039f28fdcc08189a23c07a3437d9d2482f9c2 es posterior al paper y no contiene resultados publicados, DialSim, lockfile ni CI. Incluye solo diez conversaciones LoCoMo con 1.986 QA, mientras el artículo describe 7.512 pares; ordena aleatoriamente las opciones adversariales sin semilla, usa temperaturas no nulas y scripts completos con rutas absolutas del servidor de los autores. El repositorio de sistema auditado en f303dfc71e07bdc787f4bc135d4cea328ae30e99 aporta licencia MIT, empaquetado y tests, pero depende de modelos/APIs externos, no congela versiones y no reproduce las tablas. Su inicialización reinicia una colección ChromaDB llamada “memories” y varios backends convierten errores de LLM en JSON vacío, decisiones delicadas para un uso de producción. A-MEM es relevante para la continuidad contextual que podría sostener una persona de agente, pero el paper no induce, mide, valida ni demuestra rasgos de personalidad, identidad persistente o coherencia conductual.

English

A-MEM is a Zettelkasten-inspired memory system for LLM agents; it is not a synthetic-personality study. Each conversational turn is transformed by an LLM into a note with content, context, keywords, tags, and timestamps. Embedding retrieval identifies candidate memories, another LLM step decides whether to create links or update neighboring memories' context and tags, and final answers use the top-k retrieved memories. The paper evaluates long-conversation question answering on LoCoMo and DialSim. On LoCoMo it compares A-MEM with full-context prompting, ReadAgent, MemoryBank, and MemGPT across GPT-4o-mini, GPT-4o, Qwen2.5-1.5B/3B, and Llama-3.2-1B/3B; the appendix adds DeepSeek-R1-32B and Claude 3 Haiku/3.5 Haiku. It reports F1, BLEU-1, ROUGE-2/L, METEOR, and SBERT similarity. A-MEM improves especially on Multi-Hop and Temporal questions, and on DialSim reaches F1 3.45 versus 2.55 for full context and 1.18 for MemGPT. It does not, however, lead every LoCoMo cell: full context or MemGPT score better in several Single-Hop, Open-Domain, or Adversarial model/category combinations. The broad claim of superiority over all baselines therefore exceeds the paper's own tables. A GPT-4o-mini ablation supports contributions from Link Generation and Memory Evolution, but there are no repeated runs, intervals, significance tests, or human evaluation; the checklist explicitly confirms that statistical significance was omitted because repeated API calls would be costly. Retrieval k is tuned by model and category up to 50 without a documented held-out validation set, creating benchmark-selection risk. The t-SNE figures provide no seed, configuration, or quantitative structure metric and do not establish superior semantic organization. Efficiency results do not show absolute leadership either: A-MEM uses about 1,200–2,500 tokens versus roughly 16,900 for full context/MemGPT, but ReadAgent and MemoryBank use fewer tokens in Table 1; at one million entries A-MEM reports 3.70 µs retrieval versus MemoryBank's 1.91 µs. The claimed sub-$0.0003 operation cost lacks a dated pricing model and reproducible calculation. The official evaluation repository audited at commit 0c8039f28fdcc08189a23c07a3437d9d2482f9c2 postdates the paper and contains no published result files, DialSim implementation, lockfile, or CI. It includes only ten LoCoMo conversations with 1,986 QA items while the paper describes 7,512 pairs, randomizes adversarial option order without a seed, uses nonzero decoding temperatures, and provides full-run scripts with author-specific absolute server paths. The system repository audited at f303dfc71e07bdc787f4bc135d4cea328ae30e99 adds an MIT license, packaging, and tests, but relies on external models/APIs, does not lock versions, and does not reproduce the paper's tables. Its initialization resets a ChromaDB collection named “memories,” and several backends turn LLM failures into empty JSON, both consequential production choices. A-MEM is contextually relevant to the continuity that could support an agent persona, but the paper does not induce, measure, validate, or demonstrate personality traits, persistent identity, or behavioral consistency.

Pregunta de investigación

¿Puede un sistema de memoria agéntica inspirado en Zettelkasten organizar, enlazar y actualizar recuerdos de forma dinámica para mejorar la respuesta a preguntas sobre conversaciones largas frente a sistemas de contexto y memoria existentes?

Método

Cada turno se convierte mediante un LLM en una nota atómica con contexto, palabras clave, etiquetas y tiempo. Embeddings all-MiniLM-L6-v2 recuperan vecinos; prompts LLM deciden enlaces y actualizaciones de contexto/etiquetas, y top-k suministra la memoria usada para responder. Se evalúa QA de larga duración en LoCoMo y DialSim frente a LoCoMo/full context, ReadAgent, MemoryBank y MemGPT. Se prueban seis modelos principales, k entre 10 y 50 según modelo/categoría, dos ablaciones de módulos, escalado hasta un millón de entradas y visualizaciones t-SNE.

Muestra: El artículo describe LoCoMo con 7.512 pares pregunta-respuesta, conversaciones de unas 9.000 palabras de media y hasta 35 sesiones, y DialSim con más de 1.300 sesiones que simulan cinco años de conversaciones a partir de Friends, The Big Bang Theory y The Office. No publica el número exacto de preguntas realmente puntuadas por tabla ni listas de exclusión. El repositorio de evaluación actual contiene locomo10.json con 10 conversaciones y 1.986 elementos QA al cargarlo con su propio parser, no los 7.512 descritos; no contiene DialSim.

Hallazgos

  • En DialSim, A-MEM informa F1 3,45, BLEU-1 3,37, ROUGE-L 3,54, ROUGE-2 3,60, METEOR 2,05 y similitud SBERT 19,51, por encima de LoCoMo/full context y MemGPT en las seis columnas de la Tabla 2.
  • En LoCoMo, A-MEM suele mejorar Multi-Hop y Temporal, pero no gana todas las combinaciones: por ejemplo, con GPT-4o-mini LoCoMo/full context obtiene F1 adversarial 69,23 frente a 50,03 de A-MEM; con GPT-4o obtiene Single-Hop 61,56 frente a 48,43 y Adversarial 52,61 frente a 36,35.
  • La ablación con GPT-4o-mini informa que retirar Link Generation y Memory Evolution reduce F1 Multi-Hop de 27,02 a 9,65 y F1 Temporal de 45,85 a 24,55; retirar solo Memory Evolution deja resultados intermedios.
  • El k óptimo publicado varía entre 10 y 50 por modelo y categoría. La Figura 3 muestra mesetas y descensos a k alto, pero no se documenta validación separada para seleccionar esos valores.
  • La Tabla 1 muestra unos 1.126–2.600 tokens para A-MEM según modelo frente a unos 16.900 para contexto completo y MemGPT, aunque ReadAgent y MemoryBank pueden usar menos tokens que A-MEM.
  • En la prueba de un millón de memorias, A-MEM informa 1.464,84 MB y 3,70 ± 0,74 µs de recuperación; MemoryBank informa la misma memoria y 1,91 ± 0,31 µs, por lo que A-MEM no es el más rápido de los tres.
  • Las diez visualizaciones t-SNE muestran distribuciones aparentemente más agrupadas para A-MEM, pero el trabajo no aporta una métrica de agrupamiento, semillas, hiperparámetros o prueba de estabilidad.

Limitaciones

  • El trabajo no estudia personalidad. La única mención sustantiva a personalidad en el cuerpo describe el user portrait del baseline MemoryBank; A-MEM se evalúa solo como memoria para QA conversacional.
  • La afirmación de superioridad general no coincide con las tablas de LoCoMo, donde baselines superan A-MEM en varias combinaciones de modelo, categoría y métrica.
  • No hay repeticiones independientes, barras de error sobre las métricas de QA, intervalos de confianza, tests estadísticos ni corrección por comparaciones. El checklist responde No por el coste de repetir llamadas API.
  • Las temperaturas de generación no se fijan en el paper, no se publican semillas y se mezclan APIs cerradas y modelos locales sin snapshots reproducibles.
  • El k se ajusta por modelo y categoría usando valores de 10 a 50, pero no se define un split de validación o protocolo anidado; el resultado puede beneficiarse de selección sobre el test.
  • No se informa cuántas preguntas efectivas componen cada tabla, qué errores de API o parseo se excluyen, cuántas respuestas son inválidas o cómo se trataron reintentos y fallos.
  • F1, BLEU, ROUGE, METEOR y similitud embedding son proxies automáticos de solapamiento o semejanza. No hay evaluación humana de corrección, atribución al recuerdo recuperado, contradicciones, alucinaciones o calidad de enlaces.
  • La ablación solo usa GPT-4o-mini y no separa el efecto de más llamadas LLM, más texto almacenado, enlaces, actualización de vecinos y selección de k.
  • Las figuras t-SNE son descriptivas: no publican semilla, perplejidad, tasa de aprendizaje, normalización, criterio de selección ni una métrica cuantitativa de cluster. Una apariencia agrupada no valida calidad semántica o causalidad.
  • El coste inferior a 0,0003 dólares por operación no especifica proveedor/modelo, precios vigentes, tokens de entrada/salida, llamadas por nota, reintentos ni fecha de cálculo.
  • La reducción de tokens se compara con contexto completo y MemGPT, no con todos los baselines; ReadAgent y MemoryBank usan menos tokens en la Tabla 1. La prueba de escalado tampoco documenta hardware, construcción del índice, calentamiento, número de repeticiones o naturaleza del millón de recuerdos.
  • DialSim deriva de series de televisión y preguntas de sitios de fans; LoCoMo es un benchmark sintético/curado. No se evalúan conversaciones reales longitudinales, memoria multimodal, privacidad, borrado, consentimiento o datos sensibles.
  • La sección de limitaciones del paper solo reconoce dependencia de las capacidades del LLM y restricción a texto; no trata selección de hiperparámetros, incertidumbre, privacidad, coste, evaluación automática o reproducibilidad.
  • El repositorio de evaluación actual es posterior a la versión del paper, no etiqueta una release experimental y no incluye resultados, DialSim, lockfile o CI. Su corpus locomo10 contiene 1.986 QA, mientras el paper describe 7.512.
  • Los scripts robustos sortean sin semilla el orden de las dos opciones adversariales y generan con temperaturas 0,5/0,7; ratio toma las primeras conversaciones, no una muestra aleatoria. El F1 del código usa conjuntos de tokens y no cuenta repeticiones.
  • run_all_experiments.sh y run_k_sweep.sh contienen rutas /common/users/wx139, entornos y asignaciones de GPU propios de los autores; además, el primero ejecuta siete modelos y no coincide exactamente con los seis de la tabla principal.
  • El repositorio de sistema usa dependencias con cotas mínimas, sin lockfile ni CI; parte de los tests requiere OpenAI y descargas de embeddings, por lo que no es hermético. La compilación sintáctica pasa, pero no se pudo ejecutar la suite sin instalar servicios y dependencias externas.
  • AgenticMemorySystem reinicia al construirse una colección ChromaDB global llamada memories, lo que puede borrar estado compartido. Los controladores Ollama, SGLang y OpenRouter convierten excepciones en respuestas JSON vacías, ocultando fallos como si fueran metadatos válidos.

Qué no demuestra

  • No demuestra que A-MEM cree, induzca, mida o mantenga una personalidad sintética; solo evalúa recuperación y respuesta a preguntas sobre memoria conversacional.
  • No establece identidad persistente, coherencia conductual, rasgos, valores, preferencias, emociones o una persona de agente a lo largo del tiempo.
  • No demuestra superioridad universal frente a todos los baselines, modelos, categorías y métricas; sus propias tablas contienen excepciones importantes.
  • No prueba que los enlaces o actualizaciones generados por el LLM sean verdaderos, estables, explicables o mejores que alternativas no agénticas bajo igual presupuesto.
  • No valida generalización a conversaciones humanas reales, agentes con herramientas, memoria multimodal, otros idiomas, despliegues multiusuario o información sensible.
  • No permite reproducir de extremo a extremo todas las tablas del paper a partir de una release congelada y los artefactos oficiales actuales.
  • No justifica por sí solo incluir A-MEM como evidencia central sobre personalidad; su valor en esta revisión es contextual, como infraestructura de continuidad para agentes.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2502.12110v11, submitted 17 February 2025, revised 8 October 2025, 28 pages; NeurIPS 2025

Fuente consultada: https://arxiv.org/pdf/2502.12110v11

Revisión: Codex full-text, bilingual-fidelity, 28-page visual, arXiv-v11, NeurIPS-2025, dual-official-repository, scope-fit, baseline-exception, hyperparameter-selection, statistical, metric-validity, t-SNE, cost, scaling, privacy, production-safety and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o-mini
  • GPT-4o
  • Qwen2.5-1.5B
  • Qwen2.5-3B
  • Llama-3.2-1B
  • Llama-3.2-3B
  • DeepSeek-R1-32B appendix experiment
  • Claude 3 Haiku appendix experiment
  • Claude 3.5 Haiku appendix experiment
  • all-MiniLM-L6-v2 sentence embeddings

Instrumentos y métricas

  • Zettelkasten-style structured memory notes
  • LLM-based note construction, link generation and memory evolution prompts
  • Top-k embedding retrieval
  • F1 and BLEU-1
  • ROUGE-2 and ROUGE-L
  • METEOR
  • SBERT cosine similarity
  • Module ablation
  • Retrieval-k sweep
  • Token, memory-use and retrieval-time comparison
  • t-SNE visualization

Datos utilizados

  • LoCoMo long-term conversational memory benchmark
  • DialSim long-term multi-party dialogue benchmark
  • locomo10.json code snapshot, 10 conversations and 1,986 QA items

Evidencia y localización

  • Alcance, arquitectura y contribuciones: Paper, pp. 1–5, Abstract, Introduction, Figure 1 and Sections 3.1–3.4
  • Datasets, modelos, métricas e implementación: Paper, pp. 5–6, Sections 4.1–4.2
  • Resultados LoCoMo y excepciones a la superioridad: Paper, pp. 6 and 16–17, Tables 1, 5, 6 and 7
  • DialSim, ablación y coste: Paper, p. 7, Tables 2–3 and Cost-Efficiency Analysis
  • Selección de k y escalado: Paper, pp. 7–8 and 18, Figure 3 and Tables 4 and 8
  • t-SNE y conclusiones: Paper, pp. 9 and 18, Figures 4–5 and Section 5
  • Limitaciones reconocidas: Paper, p. 9, Section 6 Limitations
  • Ausencia declarada de significación estadística: Paper, p. 25, NeurIPS checklist item 7
  • Código de evaluación y deriva respecto al paper: Official AgenticMemory repository commit 0c8039f28fdcc08189a23c07a3437d9d2482f9c2, README, requirements, locomo10, evaluation and shell scripts
  • Código del sistema y riesgos operativos: Official A-mem-sys repository commit f303dfc71e07bdc787f4bc135d4cea328ae30e99, pyproject, llm_controller, memory_system and tests
  • Inspección visual integral: Paper, all 28 rendered pages, including all tables, figures, prompt templates, examples and NeurIPS checklist