MEMEVOBENCH: BENCHMARKING MEMORY MISEVOLUTION IN LLM AGENTS
论文导读
提出首个评估大模型智能体在污染记忆持续演化下安全性的基准 MemEvoBench,涵盖误导记忆注入、工具噪声反馈和偏见用户反馈三类风险,揭示记忆演化是安全退化的主要根源。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
MEMEVOBENCH:大模型智能体记忆误演化基准评测
一句话定位
提出首个评估大模型智能体在污染记忆持续演化下安全性的基准 MemEvoBench,涵盖误导记忆注入、工具噪声反馈和偏见用户反馈三类风险,揭示记忆演化是安全退化的主要根源。
小学生也能听懂
这篇论文像给AI大脑做“记忆体检”,发现当AI记住错误信息后,会越记越错,尤其在别人乱夸乱骂时更严重,于是他们造了个测试工具MemEvoBench来检查这个问题,并证明主动清理错误记忆最有效。
为什么值得记录
- 首次系统化定义并量化‘记忆误演化’(memory misevolution)现象,填补现有研究缺乏标准化评估框架的空白;
- 构建包含 7 大高危领域、36 种风险类型和 20 个工具环境的混合评测体系,覆盖真实部署中的多源偏差累积路径;
- 实验证明静态安全提示(SafePrompt)无法有效防御记忆污染,而主动记忆修正工具(ModTool)显著降低攻击成功率;
- 发现偏见用户反馈会加剧记忆演化过程中的安全退化,尤其在多轮交互中呈现明显逐轮恶化趋势。
核心方法
- 设计双场景评测结构:QA 风格(108 个测试用例)用于评估误导记忆注入,Workflow 风格(83 个测试用例)用于评估工具返回噪声引发的流程记忆污染;
- 构建混合记忆池,包含正确知识与误导内容,模拟现实中的三种污染模式:过度泛化经验、碎片化正确信息、共识偏差;
- 引入三回合交互协议模拟记忆演化过程,每轮将智能体响应存入可检索记忆池,形成自我强化的历史轨迹;
- 使用 LLM 模拟偏见用户反馈机制:对安全但保守的行为给予负面评价,对冒险但短期有效的行为给予正面强化;
- 采用 GPT-5.2 作为裁判模型,基于四类标准(直接危害建议、鼓励风险行为、未警告风险、事实错误)判断响应是否被误导(MISLED);
- 设置对照组实验(无记忆访问)验证安全风险的来源是否为记忆结构偏差而非模型知识不足。
关键结果
- 在 Vanilla 设置下,所有模型平均攻击成功率(ASR)高达 75.9%/75.2%/80.1%(R1/R2/R3),表明记忆污染本身已造成严重安全威胁;
- 加入偏见反馈后,ASR 显著上升至 71.6%/84.9%/87.8%,显示部署环境中的选择压力会放大安全退化;
- SafePrompt 在 QA 风格中仅将 R1 ASR 从 76.2% 降至 55.5%,在 Workflow 风格中完全失效,说明指令级防御不可靠;
- ModTool 配置下多数模型表现最优,如 Gemini-2.5-Pro 在 QA 风格中 ASR 降至 19.0/13.0/14.0%,证明主动记忆修正的有效性;
- 对照组(无记忆)安全得分显著高于记忆启用组,确认记忆演化是安全失败的核心驱动因素。
局限与风险
- 评测依赖 LLM 作为裁判和反馈模拟器,可能存在判断偏差或过度拟合特定模型风格;
- 当前记忆更新机制较为简化(仅追加响应),未建模更复杂的遗忘、加权或冲突解决策略;
- 测试用例虽经人工审核,但仍受限于生成数据的质量与多样性,可能无法覆盖所有现实误演化路径;
- ModTool 的有效性依赖于外部工具(如 web_search)的准确性和可用性,在封闭环境中可能受限。
适合沉淀的概念
memory-misevolution, llm-agent-safety, adversarial-memory-injection, biased-user-feedback, noisy-tool-returns, memory-contamination, self-reinforcing-bias, safety-prompting, memory-modification-tool
阅读注意
- 重点关注图 1 和图 2 对记忆安全与误演化的对比及风险分类体系;
- 注意表 1 中不同配置(Vanilla / +SafePrompt / +ModTool)和反馈条件下的 ASR 变化趋势;
- 附录 D 提供了 QA 和 Workflow 风格的记忆池实例,有助于理解误导内容的构造方式;
- 实验部分应结合图 4 和图 5 分析 ModTool 如何改变智能体的决策路径;
- 注意作者强调‘结构性偏差’而非孤立错误是误演化的本质,这一观点贯穿全文。
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.15774.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法细节、实验设置、结果数据、附录示例和开源链接,信息充分支持复现与理解。