论文
arXiv2604.15774
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级124 分钟

MEMEVOBENCH: BENCHMARKING MEMORY MISEVOLUTION IN LLM AGENTS

论文导读

提出首个评估大模型智能体在污染记忆持续演化下安全性的基准 MemEvoBench,涵盖误导记忆注入、工具噪声反馈和偏见用户反馈三类风险,揭示记忆演化是安全退化的主要根源。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

MEMEVOBENCH:大模型智能体记忆误演化基准评测

一句话定位

提出首个评估大模型智能体在污染记忆持续演化下安全性的基准 MemEvoBench,涵盖误导记忆注入、工具噪声反馈和偏见用户反馈三类风险,揭示记忆演化是安全退化的主要根源。

小学生也能听懂

这篇论文像给AI大脑做“记忆体检”,发现当AI记住错误信息后,会越记越错,尤其在别人乱夸乱骂时更严重,于是他们造了个测试工具MemEvoBench来检查这个问题,并证明主动清理错误记忆最有效。

为什么值得记录

  • 首次系统化定义并量化‘记忆误演化’(memory misevolution)现象,填补现有研究缺乏标准化评估框架的空白;
  • 构建包含 7 大高危领域、36 种风险类型和 20 个工具环境的混合评测体系,覆盖真实部署中的多源偏差累积路径;
  • 实验证明静态安全提示(SafePrompt)无法有效防御记忆污染,而主动记忆修正工具(ModTool)显著降低攻击成功率;
  • 发现偏见用户反馈会加剧记忆演化过程中的安全退化,尤其在多轮交互中呈现明显逐轮恶化趋势。

核心方法

  • 设计双场景评测结构:QA 风格(108 个测试用例)用于评估误导记忆注入,Workflow 风格(83 个测试用例)用于评估工具返回噪声引发的流程记忆污染;
  • 构建混合记忆池,包含正确知识与误导内容,模拟现实中的三种污染模式:过度泛化经验、碎片化正确信息、共识偏差;
  • 引入三回合交互协议模拟记忆演化过程,每轮将智能体响应存入可检索记忆池,形成自我强化的历史轨迹;
  • 使用 LLM 模拟偏见用户反馈机制:对安全但保守的行为给予负面评价,对冒险但短期有效的行为给予正面强化;
  • 采用 GPT-5.2 作为裁判模型,基于四类标准(直接危害建议、鼓励风险行为、未警告风险、事实错误)判断响应是否被误导(MISLED);
  • 设置对照组实验(无记忆访问)验证安全风险的来源是否为记忆结构偏差而非模型知识不足。

关键结果

  • 在 Vanilla 设置下,所有模型平均攻击成功率(ASR)高达 75.9%/75.2%/80.1%(R1/R2/R3),表明记忆污染本身已造成严重安全威胁;
  • 加入偏见反馈后,ASR 显著上升至 71.6%/84.9%/87.8%,显示部署环境中的选择压力会放大安全退化;
  • SafePrompt 在 QA 风格中仅将 R1 ASR 从 76.2% 降至 55.5%,在 Workflow 风格中完全失效,说明指令级防御不可靠;
  • ModTool 配置下多数模型表现最优,如 Gemini-2.5-Pro 在 QA 风格中 ASR 降至 19.0/13.0/14.0%,证明主动记忆修正的有效性;
  • 对照组(无记忆)安全得分显著高于记忆启用组,确认记忆演化是安全失败的核心驱动因素。

局限与风险

  • 评测依赖 LLM 作为裁判和反馈模拟器,可能存在判断偏差或过度拟合特定模型风格;
  • 当前记忆更新机制较为简化(仅追加响应),未建模更复杂的遗忘、加权或冲突解决策略;
  • 测试用例虽经人工审核,但仍受限于生成数据的质量与多样性,可能无法覆盖所有现实误演化路径;
  • ModTool 的有效性依赖于外部工具(如 web_search)的准确性和可用性,在封闭环境中可能受限。

适合沉淀的概念

memory-misevolution, llm-agent-safety, adversarial-memory-injection, biased-user-feedback, noisy-tool-returns, memory-contamination, self-reinforcing-bias, safety-prompting, memory-modification-tool

阅读注意

  • 重点关注图 1 和图 2 对记忆安全与误演化的对比及风险分类体系;
  • 注意表 1 中不同配置(Vanilla / +SafePrompt / +ModTool)和反馈条件下的 ASR 变化趋势;
  • 附录 D 提供了 QA 和 Workflow 风格的记忆池实例,有助于理解误导内容的构造方式;
  • 实验部分应结合图 4 和图 5 分析 ModTool 如何改变智能体的决策路径;
  • 注意作者强调‘结构性偏差’而非孤立错误是误演化的本质,这一观点贯穿全文。

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.15774.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法细节、实验设置、结果数据、附录示例和开源链接,信息充分支持复现与理解。