---
title: ""
title_zh: "Memori：面向高效上下文感知 LLM 代理的持久化记忆层"
arxiv_id: "2603.19935"
paper_type: "system"
source_kind: "raw"
raw_path: "raw/papers/2026/03/2603.19935.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Memori：面向高效上下文感知 LLM 代理的持久化记忆层

## 一句话定位

提出 Memori，一个与 LLM 无关的持久化记忆层，通过 Advanced Augmentation 管道将非结构化对话转化为语义三元组和会话摘要，实现高精度记忆检索与显著降低 token 成本。

## 小学生也能听懂

这篇论文发明了一个叫Memori的记忆小盒子，它能帮AI记住对话重点，把聊天变成简单的三元组和摘要，这样AI找记忆又快又省流量，准确率还更高。

## 为什么值得记录

- 解决了现有 LLM 记忆系统依赖原始对话注入导致的高 token 成本和上下文退化问题
- 在 LoCoMo 基准测试中以 81.95% 准确率超越主流记忆系统（Zep、LangMem、Mem0）
- 平均每次查询仅使用 1,294 个 token（约为完整上下文的 5%），实现 67% 的 token 节省和超过 20 倍的成本优化
- 证明了结构化记忆表示比扩大上下文窗口更有效，为生产级 LLM 代理提供可扩展基础

## 核心方法

- 设计为解耦的记忆层，通过轻量级 SDK 集成到现有 LLM 客户端中
- Advanced Augmentation 管道包含两个核心组件：语义三元组提取和会话摘要生成
- 语义三元组（subject-predicate-object）从对话中提取原子事实，并关联原始会话时间戳
- 会话摘要提供高层意图、时间演进和隐含上下文，与对应三元组建立双向链接
- 采用混合检索策略（余弦相似度 + BM25）从 FAISS 索引中检索相关记忆
- 使用 GPT-4.1-mini 作为生成模型，输入为检索到的三元组及其关联摘要
- 评估采用 LLM-as-a-Judge 方法（GPT-4.1-mini 作为评判器）进行答案正确性判断

## 关键结果

- 在 LoCoMo 基准测试中整体准确率达 81.95%，优于 Zep（79.09%）、LangMem（78.05%）和 Mem0（62.47%）
- 单跳推理表现最佳（87.87%），显著高于 LangMem（74.47%）和 Zep（79.43%）
- 时间推理（80.37%）和多跳推理（72.70%）表现良好，但略逊于部分基线
- 开放域推理（63.54%）仍是挑战，因缺乏明确检索锚点
- 平均每次查询仅注入 1,294 个 token，占完整上下文（26,031 tokens）的 4.97%
- 相比 Zep 减少 67% token 使用，相比完整上下文方法节省超过 20 倍成本

## 局限与风险

- 时间推理能力仍有提升空间，孤立三元组难以完全捕捉用户状态跨会话的变化
- 开放域问题表现相对较弱，因其依赖广泛综合而非精确事实提取
- 未在更多真实世界长对话场景中验证，LoCoMo 虽严谨但为合成数据集
- 依赖外部 LLM（如 GPT-4.1-mini）进行三元组提取和摘要生成，可能引入偏差或错误传播

## 适合沉淀的概念

`persistent-memory-layer`, `semantic-triples-representation`, `advanced-augmentation-pipeline`, `context-efficient-retrieval`, `llm-as-a-judge-evaluation`, `memory-compression`, `conversation-summarization`, `hybrid-retrieval-strategy`

## 阅读注意

- 关注 Advanced Augmentation 如何将非结构化对话转化为结构化记忆资产
- 注意三元组与摘要之间的双向链接机制及其对上下文连贯性的作用
- 分析表 1 和表 2 中准确率与 token 成本的权衡关系
- 理解为何 Memori 在单跳推理上表现突出而在开放域推理上受限
- 查看附录 A 和 B 中的提示模板，了解生成与评估的具体指令设计

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/03/2603.19935.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的系统架构、实验设计、基线对比和量化结果，包含具体数字和开源链接，材料充分可信。
