---
title: "M+: Extending MemoryLLM with Scalable Long-Term Memory"
title_zh: "M+：基于 MemoryLLM 的可扩展长期记忆扩展"
arxiv_id: "2502.00592"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2025/02/2502.00592.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# M+：基于 MemoryLLM 的可扩展长期记忆扩展

## 一句话定位

提出 M+ 模型，在 MemoryLLM 基础上引入长期记忆机制与协同训练的检索器，显著提升模型在超过 160k token 的上下文中的知识保持能力，同时维持较低的 GPU 内存开销。

## 小学生也能听懂

这篇论文像给AI大脑加了“长期记事本”，把短期记忆里丢掉的重要信息存到CPU里，再用一个聪明的小助手快速找到它们，让AI能记住超过16万字的超长内容，而且不占太多显卡内存。

## 为什么值得记录

- 解决了现有隐空间记忆模型（如 MemoryLLM）在超过 20k token 后知识保留能力急剧下降的问题
- 通过协同训练的检索器实现高效记忆检索，相比逐头检索方法（如 SnapKV）大幅降低延迟
- 采用 CPU 卸载策略，在几乎不增加 GPU 内存占用的情况下实现超长上下文建模
- 在 LongBook-QA 和事件推理等长文本任务上显著优于 Llama-3.1-8B-16k、SnapKV 和 BM25 检索增强基线

## 核心方法

- 构建于 MemoryLLM 架构之上，保留其每层 10,240 个短期记忆 token 的设计
- 引入长期记忆池 Θ，将更新过程中被丢弃的 K=256 个记忆 token 存入 CPU 端的长期记忆，最大容量设为 150k
- 设计双 LoRA 结构：更新过程与生成过程分别使用独立的 LoRA 权重，分别模拟“写入”与“读取”机制
- 提出协同训练的检索器：使用两层 MLP 作为 query/key 投影器（维度 d/20=256），通过对比学习优化检索目标
- 三阶段训练课程：(1) 在 fineweb-edu 上持续训练 MemoryLLM；(2) 使用 SlimPajama 中长文档（4k–64k）增强长上下文建模；(3) 引入长期记忆并联合训练检索器
- 推理时每层仅执行一次检索（共 32 次），远少于 SnapKV 的 1024 次（32 层×32 头），显著提升效率

## 关键结果

- 在 LongBook-QA（平均 192k token）上 QA-F1 显著优于所有基线，包括 Llama-3.1-3B-128k 和 Llama-3.1-8B-SnapKV
- 在自建 LongBook Event QA 基准上准确率最高，体现其对时序事件推理的优越能力
- 知识保留实验显示：在 SQuAD 和 NaturalQA 上，M+ 在插入干扰上下文后仍能保持高准确率，有效记忆跨度从 <20k 提升至 >160k tokens
- GPU 内存消耗最低（M+ offload 模式仅 17,973 MB），低于 SnapKV（32,574 MB）和 Llama-3.1-3B-128k（30,423 MB）
- 在 LongBench 短文档任务上性能与 Llama-3.1-8B 相当，表明长期记忆未损害短上下文表现

## 局限与风险

- 最大上下文长度受限于实验资源（14,848 token），未充分利用 Llama-3.1-8B 的 128k 原生窗口
- 长期记忆存储于 CPU，虽节省 GPU 内存但引入 I/O 延迟，尽管整体仍优于高内存方案
- 检索器训练依赖文档分块与相关性标注，构造过程较复杂
- 未在更大规模模型（如 70B）上验证扩展性，理论分析表明延迟随模型尺寸线性增长

## 适合沉淀的概念

`latent-space-memory`, `long-term-memory-mechanism`, `co-trained-retriever`, `memory-augmented-llm`, `cpu-offloading`, `multi-lora-design`, `knowledge-retention-benchmark`, `long-context-modeling`

## 阅读注意

- 关注图 1 中 MemoryLLM 与 M+ 的更新/生成流程对比，理解长期记忆 Θ 的集成方式
- 注意三阶段训练课程的设计逻辑，尤其是 Stage 3 如何专门适配长期记忆
- 检索器训练目标函数（公式）体现对比学习思想：拉近相关记忆，推远无关记忆
- 附录 E.3 提供了可扩展性分析，说明延迟与模型大小呈线性关系而非平方
- 表 1 的 GPU 内存对比是关键优势，M+ (offload) 实现最低开销

## 质量说明

- 采用来源：`clean`，`papers/2025/02/2502.00592.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、消融分析与附录讨论，数据充分支持结论。
