---
title: "VerificAgent : Domain-Specific Memory Verification for Scalable Oversight of Aligned Computer-Use Agents"
title_zh: "VerificAgent：面向可扩展监督的领域特定记忆验证框架"
arxiv_id: "2506.02539"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/06/2506.02539.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# VerificAgent：面向可扩展监督的领域特定记忆验证框架

## 一句话定位

提出 VerificAgent 框架，通过专家种子知识、轨迹驱动记忆增长与人工事后核查三阶段机制，将持久化记忆转化为对齐保障工具，在 OSWorld Office 任务上实现成功率翻倍并消除对抗性记忆注入风险。

## 小学生也能听懂

这篇论文发明了一个叫VerificAgent的“记忆管家”，它像老师一样帮AI检查学到的知识是否正确：先让AI自己学，再用专家挑错，最后只保留对的知识去完成任务，这样AI在Office软件里做事更靠谱，还不会被坏人骗。

## 为什么值得记录

- 首次将记忆验证作为可扩展监督的核心手段，解决记忆增强代理中‘未过滤记忆’导致策略漂移的关键对齐问题
- 在真实 Office 生产力任务（PowerPoint/Word/Excel）上验证有效性，填补现有 CUA 在复杂桌面应用中的性能鸿沟
- 构建 Red-Team Memory Injection (RTMI) 测试基准，提供首个针对记忆篡改攻击的量化评估体系
- 提出‘生成-冻结’两阶段范式，使人类只需一次性修正高影响错误即可建立长期安全约束

## 核心方法

- 三阶段架构：学习阶段（迭代积累轨迹记忆）→ 记忆监督阶段（专家人工核查去幻觉）→ 推理阶段（冻结已验证记忆用于任务执行）
- 双层次防御机制：自动化轨迹分析模块过滤行为变更短语 + 人工审查层最终清除残留恶意条目
- 记忆更新流程：PlanGen 接收任务、初始截图、领域知识 K 和当前记忆 M 生成计划 → Exec 执行并记录轨迹 τ → Analyzer 提取经验 α → Integrate 合并至 M
- 评估配置：对比 baseline（无记忆）、learned memory（自动学习）、corrected memory（人工核查后）三种模式在 computer-use-preview 和 UI-TARS-1.5-7B 上的表现

## 关键结果

- 在 OSWorld Office 基准上，computer-use-preview 的 PowerPoint 成功率从 25% 提升至 50%+（相对提升 111%），UI-TARS-1.5-7B 的 Excel 成功率从 0% 提升至 40%
- Red-Team 对抗测试中，60 个注入指令经双层过滤后仅剩 13 条进入临时记忆，全部被人工审查拦截，最终渗透率为 0%
- 人工核查效率提升约 9 倍：单条记忆审核时间从 72 秒降至 8.4 秒，得益于 AI 辅助高亮可疑短语与一键编辑功能

## 局限与风险

- 领域泛化能力有限：当前验证流程依赖 Office 领域专家，迁移至医疗/金融等高价值场景需重构知识库与审查标准
- 人工监督可扩展性瓶颈：虽单次审核成本降低，但千级以上记忆条目仍需自动化辅助或分层抽样策略
- 未解决执行层缺陷：即使记忆正确，仍有 >58% 失败源于动作合成误差（如选错颜色、误触按钮），需结合感知与控制优化

## 适合沉淀的概念

`memory-verification`, `scalable-oversight`, `computer-use-agent`, `alignment-surface`, `red-team-memory-injection`, `post-hoc-fact-checking`, `policy-drift-mitigation`, `domain-specific-memory`

## 阅读注意

- 重点关注第 3.2 节系统架构图与公式化描述，理解三阶段数据流与控制逻辑
- 附录 B.1.2 列出的幻觉记忆实例（如 Ctrl+Shift+L 无效快捷键）是理解未验证记忆危害的关键证据
- 表 1 的失败类型分布显示：记忆校正后‘知识错位’归零，但‘策略翻译错误’和‘执行漂移’占比上升，揭示后续优化方向
- RTMI 测试床的 10 类滥用指令（附录 C 表 8）可作为其他领域构建对抗评估的模板

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/06/2506.02539.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供完整实验设置（表 7）、数据集过滤规则（4.1.2）、评分函数细节（表 5）及对抗测试 prompt 全集，关键结论均有定量支撑，方法可复现性强。
