---
title: ""
title_zh: "个性化持久代理的分层记忆编排"
arxiv_id: "2604.01670"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.01670.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 个性化持久代理的分层记忆编排

## 一句话定位

提出分层记忆编排（HMO）框架，通过三层记忆结构和动态用户画像实现高效、个性化的长期记忆管理，提升代理推理效率与用户体验。

## 小学生也能听懂

这篇论文像给AI大脑造了个“三层记忆柜”：最近的事放最上层（Tier 1），重要旧事放中层（Tier 2），所有历史存底层（Tier 3）。它会根据你的喜好自动给记忆打分，优先记住你关心的内容，找东西时先查上层，找不到再往下翻，又快又准，还能在手机上跑。

## 为什么值得记录

- 解决了传统扁平化记忆系统在扩展时检索噪声大、延迟高的问题
- 首次将动态演化的用户画像作为记忆生命周期（优先级、存储、检索）的核心驱动因素
- 在LoCoMo和LongMemEval等基准测试中达到SOTA性能，并在OpenClaw平台验证了实际部署效果
- 通过分层架构显著降低推理延迟（如比全局搜索快77%），适用于资源受限的本地设备

## 核心方法

- 构建三层记忆结构：Tier 1（主缓存，固定大小，含最近会话和关键记忆）、Tier 2（次级缓冲，高优先级历史）、Tier 3（全局存档，完整历史）
- 引入自主记忆摄取机制，支持原始对话保留或MLLM压缩表示，平衡保真度与存储效率
- 设计自适应优先级评分函数 S_m，融合初始重要性 I_m、用户画像相似度 Sim(m,P)、访问频次 C_m 和时间衰减因子，实现非线性持久化
- 采用增量式用户画像演化策略，通过Drift Gate机制（阈值τ=0.10）控制全局重评分频率，避免频繁计算开销
- 实现惰性更新策略：仅对活跃层（Tier 1/2）常规更新评分，Tier 3记录仅在访问时评分并触发升降级
- 检索流程采用顺序查询+自反思触发机制：先在Tier 1推理，失败则递归搜索Tier 2和Tier 3

## 关键结果

- 在LongMemEval-S上达到81.1% Rec@5、85.6% NDCG@5和86.4% Acc，优于基于Llama-3.1-70B的QRRetriever（80.4% Rec@5）
- 在LoCoMo基准上Overall F1达45.65，超越MemVerse（43.44）等现有方法
- 完整HMO配置（含Tier 1/2）比无分层结构减少77%推理时间（12.88 min vs 56.05 min），仅损失2.4%准确率
- 在LongMemEval-M大规模数据集上，搜索时间从1453.21s降至195.75s（减少86.5%），召回率保持63.0%

## 局限与风险

- 当前评估基准（如LoCoMo、LongMemEval）采用静态解耦范式，无法充分验证HMO在连续交互中的实时记忆协同演化优势
- 用户画像更新依赖MLLM初始化，虽通过相似度更新缓解，但长期漂移可能影响初始重要性 I_m 的合理性
- Tier 1容量固定（S=5, K=50），在极端长上下文场景下可能限制活跃记忆覆盖范围
- 未开源代码，复现依赖自行实现分层调度与评分逻辑

## 适合沉淀的概念

`hierarchical-memory-orchestration`, `user-persona-evolution`, `adaptive-priority-scoring`, `three-tiered-memory-architecture`, `memory-tier-promotion`, `drift-gate-mechanism`, `lazy-update-strategy`, `self-reflective-retrieval`

## 阅读注意

- 关注附录A中的Initial Importance Scoring Prompt设计，理解如何通过行为对齐、推理效用和上下文持久性三个维度初始化记忆重要性
- 注意附录C对现有基准局限性的讨论：当前评估未考虑记忆与对话流的共演化特性，可能低估HMO真实性能
- 查看表3和表4的消融实验，理解Tier 1/2对效率的关键作用以及混合评分策略（MLLM+相似度）的平衡设计
- 留意系统部署细节：使用text-embedding-small向量化、GPT-4o-mini生成响应，体现轻量化设计思想

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.01670.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、消融分析和实际部署验证，数据充分且逻辑自洽。
