---
title: "MemoryBank: Enhancing Large Language Models with Long-Term Memory"
title_zh: "MemoryBank：为大型语言模型赋予长期记忆能力"
arxiv_id: "2305.10250"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2023/05/2305.10250.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# MemoryBank：为大型语言模型赋予长期记忆能力

## 一句话定位

提出一种名为 MemoryBank 的新型记忆机制，通过模拟艾宾浩斯遗忘曲线实现长期记忆存储、检索与动态更新，提升 LLM 在持续交互场景中的个性化与共情能力。

## 小学生也能听懂

这篇论文给AI大脑加了个“记忆本”，像人一样记住和忘记事情：它把聊天内容整理成摘要和性格画像，用科学方法决定哪些该记住、哪些该淡忘，让AI在长期聊天中更懂你、更贴心。

## 为什么值得记录

- 解决了当前 LLM 缺乏长期记忆的核心瓶颈，使其适用于心理陪伴、秘书助理等需持续交互的场景
- 引入基于心理学理论的记忆更新机制，使 AI 具备类人的记忆衰减与强化行为，提升交互自然度
- 支持闭源（如 ChatGPT）与开源模型（如 ChatGLM、BELLE），并实现中英双语能力，具备强通用性
- 通过 SiliconFriend 实例验证了 MemoryBank 在真实对话中提升共情响应、记忆召回和用户画像理解的有效性

## 核心方法

- MemoryBank 架构包含三大组件：记忆存储（记录对话、事件摘要、用户画像）、记忆检索（基于双塔稠密检索模型 + FAISS 索引）、记忆更新（受艾宾浩斯遗忘曲线启发）
- 记忆存储采用分层结构：原始对话 → 每日事件摘要 → 全局事件摘要；同时生成每日与全局用户性格画像
- 记忆更新机制建模为指数衰减函数 R = e^(-t/S)，其中 S 为记忆强度，随回忆次数增加而增强，t 为时间间隔
- SiliconFriend 实现分为两阶段：先用 38k 条心理对话数据对开源模型进行 LoRA 微调（r=16，3 轮训练），再集成 MemoryBank 系统
- 检索时使用 LangChain 框架，英文用 MiniLM 编码，中文用 Text2vec 编码，支持灵活替换多语言嵌入模型
- 系统兼容 ChatGPT、ChatGLM 和 BELLE 三种后端模型，展示跨模型泛化能力

## 关键结果

- 在定量评估中，构建包含 15 个虚拟用户、10 天对话历史的记忆库，设计 194 个探测问题（中英各 97 个）
- SiliconFriend ChatGPT 在英文任务中综合表现最佳：检索准确率 76.3%，回答正确率 71.6%，连贯性 91.2%，排名得分 0.818
- SiliconFriend BELLE 在中文任务中表现最优：检索准确率 85.6%，正确率 60.3%，优于 ChatGLM 和 ChatGPT 中文版
- 所有变体均实现高检索准确率（>70%），证明 MemoryBank 机制在不同模型上的有效性
- 定性分析显示 SiliconFriend 能准确回忆过往建议（如减压方法、书籍推荐），并根据用户性格定制回应

## 局限与风险

- 记忆更新模型高度简化，未考虑情绪强度、信息重要性等现实记忆影响因素，仅为艾宾浩斯曲线的初步模拟
- 依赖外部检索系统（如 FAISS）和嵌入模型，可能引入误差传播，且未与 LLM 内部表示深度融合
- 心理对话数据来自网络爬取，可能存在噪声或偏见，影响共情能力的泛化性
- 实验中虚拟用户由 ChatGPT 扮演，虽多样但非真实人类行为，外部效度有待真实用户长期测试验证

## 适合沉淀的概念

`long-term-memory-mechanism`, `ebbinghaus-forgetting-curve`, `memory-retrieval-system`, `user-personality-modeling`, `ai-companion`, `parameter-efficient-fine-tuning`, `dense-passage-retrieval`, `bilingual-chatbot`

## 阅读注意

- 重点关注 MemoryBank 如何将心理学理论转化为可计算的遗忘机制，特别是 S（记忆强度）的动态更新规则
- 注意 SiliconFriend 的双阶段设计：心理数据微调 vs. 记忆系统集成，二者缺一不可
- 实验部分区分了定性（真实用户对话示例）与定量（模拟对话+探测问题）两种评估方式，需结合理解
- Table 2 显示不同模型在语言间的性能差异，反映基础模型能力对最终效果的影响
- 开源实现已发布，可复现记忆存储构建与检索流程

## 质量说明

- 采用来源：`clean`，`papers/2023/05/2305.10250.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设计、结果数据与代码链接，逻辑清晰，数据可信，具备可复现性。
