---
title: "MemoryLLM : Towards Self-Updatable Large Language Models"
title_zh: "MemoryLLM：迈向自更新大语言模型"
arxiv_id: "2402.04624"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2024/02/2402.04624.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# MemoryLLM：迈向自更新大语言模型

## 一句话定位

提出 MemoryLLM，通过在 Transformer 隐空间嵌入固定大小的记忆池，实现高效知识注入与缓慢遗忘，支持近百万次更新而不退化。

## 小学生也能听懂

这篇论文发明了一个叫MemoryLLM的“聪明大脑”，它像一个小书包，能不断装进新知识又不容易忘掉旧知识，即使更新上百万次也不会变笨，比别的方法记得更牢、学得更快。

## 为什么值得记录

- 解决了部署后 LLM 难以动态更新知识的根本问题
- 记忆池设计兼顾知识整合效率与长期保留能力
- 在模型编辑和长上下文任务上显著优于现有方法
- 无需外部检索或全参数微调即可实现知识更新

## 核心方法

- 将记忆池建模为每层 Transformer 中的 N×d 维隐藏向量（memory tokens），总参数量达 1.066B
- 自更新机制：每次仅用最后 K 个记忆 token 与新知识拼接输入 Transformer，输出新记忆并左移覆盖最旧 K 个 token
- 训练策略包含三部分：(1) 新知识注入时混合梯度/无梯度路径；(2) 多段上下文连续压缩训练；(3) 跨文档记忆召回任务缓解遗忘
- 采用随机丢弃策略维持记忆池大小恒定，理论证明其遗忘速率呈指数衰减
- 使用 Llama2-7B 作为主干模型 φ，记忆池 θ 作为可更新参数

## 关键结果

- 在 ZsRE 和 CounterFactual 模型编辑基准上，MemoryLLM（w/ EF）综合得分分别为 79.2 和 75.3，优于 FT、FT-L、ROME 和 IKE
- 在 LongBench 长上下文评估中，在 4/6 数据集上优于 Llama2-7B 及其他长上下文模型（如 LongLora）
- 经过近 100 万次记忆更新后，模型性能无显著退化，验证其鲁棒性
- N/K 比值越大（记忆容量越大或压缩率越低），知识保留能力越强，符合理论预期

## 局限与风险

- 未进行指令微调，影响在特定领域（如科学问答 Qasper）的表现
- 记忆池注意力计算复杂度随 N 线性增长，限制进一步扩展
- 随机丢弃策略可能导致早期知识丢失，尽管速率可控
- 当前仅支持文本知识注入，未验证多模态扩展效果

## 适合沉淀的概念

`self-updatable-llm`, `memory-pool`, `exponential-forgetting`, `model-editing`, `long-context-modeling`, `knowledge-retention`, `transformer-memory-tokens`, `parameter-efficient-update`

## 阅读注意

- 关注记忆池结构设计如何平衡容量与计算开销（N vs K 的选择）
- 注意训练策略中梯度路径的混合设计对知识压缩的影响
- 对比不同基线时需区分‘有编辑’与‘无编辑’状态的性能差异
- 附录中的理想训练流程（图9）揭示了实际实现的工程折衷

## 质量说明

- 采用来源：`clean`，`papers/2024/02/2402.04624.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，实验充分，包含消融研究、鲁棒性测试和理论分析，代码已开源，信息可信度高。
