---
title: "D-Mem: A Dual-Process Memory System for LLM Agents"
title_zh: "D-Mem：面向 LLM 代理的双过程记忆系统"
arxiv_id: "2603.18631"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/03/2603.18631.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# D-Mem：面向 LLM 代理的双过程记忆系统

## 一句话定位

提出 D-Mem 双过程记忆架构，通过轻量级向量检索（System 1）与全量审慎推理（System 2）的动态路由，在保持计算效率的同时显著提升长对话场景下的推理准确率。

## 小学生也能听懂

这篇论文像给AI大脑装了两个“记忆开关”：一个快但简单，一个慢但仔细，AI会根据问题难度自动选择，既省力气又答得准，特别适合长对话。

## 为什么值得记录

- 解决了现有增量式记忆系统因‘有损抽象’（lossy abstraction）导致的关键上下文信息丢失问题，尤其在时序推理和多跳推理任务中表现突出；
- 首次将人类认知双过程理论（System 1/2）形式化为可操作的 LLM 记忆架构，实现了‘认知经济性’与‘推理保真度’的平衡；
- 在 LoCoMo 和 RealTalk 基准测试中，其核心组件 Quality Gating 在 GPT-4o-mini 上达到 53.5 F1 分数，恢复 96.7% 全量推理性能的同时仅消耗 35.8% 的 token 成本；
- 为未来长时记忆系统设计提供了新方向：从单纯提取显式事实转向捕捉隐式逻辑链。

## 核心方法

- 构建 Mem0* 作为 System 1 基础：在 Mem0 框架基础上增强，使用 top-10 相似记忆与近期消息联合提取新记忆，并引入余弦相似度 >0.8 的严格过滤机制；
- 设计 Full Deliberation 作为 System 2 回退路径：将对话历史按 60 条消息分块，逐块提取与查询相关的事实并打分（0–10），经初步阈值（>6）和 LLM 二次筛选后生成答案；
- 提出 Multi-dimensional Quality Gating 策略：基于相关性、忠实一致性、完整性三个维度评估 System 1 输出，仅当任一维度不达标时触发 System 2；
- 对比三种门控策略：多数投票（Majority Voting）、共识（Consensus）与本文的 Quality Gating，验证后者在效率与性能间的最优权衡；
- 采用 LLM-as-a-Judge（GPT-4o-mini）进行语义等价评估，提升指标与人类判断的相关性。

## 关键结果

- 在 LoCoMo 数据集上，Quality Gating（ours）F1 达 53.5，优于 Mem0*（51.2）和 Nemori（49.5），接近 Full Deliberation（55.3）；
- 在 RealTalk 数据集上，Quality Gating 的 F1 为 39.4，LLM 分数为 62.5，均优于其他门控策略；
- Quality Gating 在 LoCoMo 上仅用 12,681 tokens 即恢复 Full Deliberation 96.7% 的 F1 性能，而后者需 35,435 tokens；
- Per-category 分析显示，Quality Gating 在时序和开放域问题上提升最大（+2.7~+4.1 F1），印证其对复杂推理的有效性；
- Fallback 分析表明，Quality Gating 能自适应调整回退率（LoCoMo: 24.1%, RealTalk: 24.7%），且回退样本确实更难（F1 更低）。

## 局限与风险

- Full Deliberation 模块计算开销仍高，单次推理平均消耗超 3.5 万 tokens，难以直接用于实时高频场景；
- Quality Gating 的效果依赖底层 LLM 的判别能力，在 Qwen3-235B-Instruct 上虽 LLM 分数更高，但 F1 略低于 Consensus，反映模型对齐风格影响；
- 当前实现未考虑记忆污染（poisoned memory）问题，若历史对话含错误或偏见信息，可能被长期保留并传播；
- 实验仅在英文数据集 LoCoMo 和 RealTalk 上验证，跨语言泛化能力待进一步测试。

## 适合沉淀的概念

`dual-process-memory`, `lossy-abstraction`, `quality-gating`, `full-deliberation`, `cognitive-economy`, `long-context-reasoning`, `memory-compression`, `llm-as-a-judge`

## 阅读注意

- 重点关注 3.2 节中三种门控策略的设计差异及其对 fallback 频率的影响；
- 图 2 展示了 Quality Gating 在不同问题类型上的增益趋势，是理解其机制的关键；
- 表 2 提供了 fallback 机制的详细分解，有助于分析系统行为偏差；
- 附录 A 包含所有 prompt 模板，对复现和调优具有重要参考价值；
- 伦理声明（附录 E）指出隐私、环境影响和记忆偏见三大风险，值得部署时警惕。

## 质量说明

- 采用来源：`clean`，`papers/2026/03/2603.18631.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、完整结果表格及伦理讨论，数据充分支持结论，无明显信息缺失。
