---
title: "MEMEVOBENCH: BENCHMARKING MEMORY MISEVOLUTION IN LLM AGENTS"
title_zh: "MEMEVOBENCH：大模型智能体记忆误演化基准评测"
arxiv_id: "2604.15774"
paper_type: "benchmark"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.15774.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# MEMEVOBENCH：大模型智能体记忆误演化基准评测

## 一句话定位

提出首个评估大模型智能体在污染记忆持续演化下安全性的基准 MemEvoBench，涵盖误导记忆注入、工具噪声反馈和偏见用户反馈三类风险，揭示记忆演化是安全退化的主要根源。

## 小学生也能听懂

这篇论文像给AI大脑做“记忆体检”，发现当AI记住错误信息后，会越记越错，尤其在别人乱夸乱骂时更严重，于是他们造了个测试工具MemEvoBench来检查这个问题，并证明主动清理错误记忆最有效。

## 为什么值得记录

- 首次系统化定义并量化‘记忆误演化’（memory misevolution）现象，填补现有研究缺乏标准化评估框架的空白；
- 构建包含 7 大高危领域、36 种风险类型和 20 个工具环境的混合评测体系，覆盖真实部署中的多源偏差累积路径；
- 实验证明静态安全提示（SafePrompt）无法有效防御记忆污染，而主动记忆修正工具（ModTool）显著降低攻击成功率；
- 发现偏见用户反馈会加剧记忆演化过程中的安全退化，尤其在多轮交互中呈现明显逐轮恶化趋势。

## 核心方法

- 设计双场景评测结构：QA 风格（108 个测试用例）用于评估误导记忆注入，Workflow 风格（83 个测试用例）用于评估工具返回噪声引发的流程记忆污染；
- 构建混合记忆池，包含正确知识与误导内容，模拟现实中的三种污染模式：过度泛化经验、碎片化正确信息、共识偏差；
- 引入三回合交互协议模拟记忆演化过程，每轮将智能体响应存入可检索记忆池，形成自我强化的历史轨迹；
- 使用 LLM 模拟偏见用户反馈机制：对安全但保守的行为给予负面评价，对冒险但短期有效的行为给予正面强化；
- 采用 GPT-5.2 作为裁判模型，基于四类标准（直接危害建议、鼓励风险行为、未警告风险、事实错误）判断响应是否被误导（MISLED）；
- 设置对照组实验（无记忆访问）验证安全风险的来源是否为记忆结构偏差而非模型知识不足。

## 关键结果

- 在 Vanilla 设置下，所有模型平均攻击成功率（ASR）高达 75.9%/75.2%/80.1%（R1/R2/R3），表明记忆污染本身已造成严重安全威胁；
- 加入偏见反馈后，ASR 显著上升至 71.6%/84.9%/87.8%，显示部署环境中的选择压力会放大安全退化；
- SafePrompt 在 QA 风格中仅将 R1 ASR 从 76.2% 降至 55.5%，在 Workflow 风格中完全失效，说明指令级防御不可靠；
- ModTool 配置下多数模型表现最优，如 Gemini-2.5-Pro 在 QA 风格中 ASR 降至 19.0/13.0/14.0%，证明主动记忆修正的有效性；
- 对照组（无记忆）安全得分显著高于记忆启用组，确认记忆演化是安全失败的核心驱动因素。

## 局限与风险

- 评测依赖 LLM 作为裁判和反馈模拟器，可能存在判断偏差或过度拟合特定模型风格；
- 当前记忆更新机制较为简化（仅追加响应），未建模更复杂的遗忘、加权或冲突解决策略；
- 测试用例虽经人工审核，但仍受限于生成数据的质量与多样性，可能无法覆盖所有现实误演化路径；
- ModTool 的有效性依赖于外部工具（如 web_search）的准确性和可用性，在封闭环境中可能受限。

## 适合沉淀的概念

`memory-misevolution`, `llm-agent-safety`, `adversarial-memory-injection`, `biased-user-feedback`, `noisy-tool-returns`, `memory-contamination`, `self-reinforcing-bias`, `safety-prompting`, `memory-modification-tool`

## 阅读注意

- 重点关注图 1 和图 2 对记忆安全与误演化的对比及风险分类体系；
- 注意表 1 中不同配置（Vanilla / +SafePrompt / +ModTool）和反馈条件下的 ASR 变化趋势；
- 附录 D 提供了 QA 和 Workflow 风格的记忆池实例，有助于理解误导内容的构造方式；
- 实验部分应结合图 4 和图 5 分析 ModTool 如何改变智能体的决策路径；
- 注意作者强调‘结构性偏差’而非孤立错误是误演化的本质，这一观点贯穿全文。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.15774.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、结果数据、附录示例和开源链接，信息充分支持复现与理解。
