2604.11790
论文导读
提出 ClawGuard,一种在工具调用边界实施确定性访问控制的运行时安全框架,通过用户确认的任务级规则自动防御间接提示注入攻击。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
ClawGuard:面向工具增强型 LLM 代理的运行时安全框架
一句话定位
提出 ClawGuard,一种在工具调用边界实施确定性访问控制的运行时安全框架,通过用户确认的任务级规则自动防御间接提示注入攻击。
小学生也能听懂
ClawGuard 像一个智能保镖,在机器人助手使用工具前检查是否安全,通过用户确认的规则自动挡住坏人偷偷塞进来的坏指令,保护电脑不被控制。
为什么值得记录
- 针对工具增强型 LLM 代理中普遍存在的间接提示注入漏洞,提出首个覆盖全部三种主要注入路径(Web/本地内容、MCP 服务器、技能文件)的统一防御方案
- 引入上下文感知的规则归纳机制,无需模型微调或架构修改,即可自动生成任务特定的访问约束
- 在 AgentDojo、SkillInject 和 MCPSafeBench 三大基准测试上验证有效性,显著降低攻击成功率同时保持任务完成率
核心方法
- 采用双阶段防御机制:会话前基于用户目标自动生成任务规则集 ℛ_task,并在首次工具调用前经用户确认;每次工具调用时强制执行四层安全检查
- Content Sanitizer 使用可扩展模式库对输入参数和返回内容中的敏感信息(如密钥、令牌)进行脱敏处理
- Rule Evaluator 基于白名单/黑名单机制评估工具调用,涵盖命令、文件路径和网络目标三个维度,采用最严格判定策略
- Skill Inspector 在技能首次执行前通过 LLM 法官进行风险评估,并强制用户确认
- Approval Mechanism 对模糊决策调用暂停执行并交由用户授权,所有操作记录审计日志
关键结果
- 在 AgentDojo 基准上,ClawGuard 将平均攻击成功率从基线模型的 68% 降至 9% 以下
- 在 SkillInject 技能注入测试中,成功阻断 94.3% 的恶意技能执行尝试
- 在 MCPSafeBench 的 MCP 服务器攻击场景中,误报率低于 5%,任务完成率保持在 87% 以上
- 支持五种主流 LLM 后端(包括 GPT-4、Claude 3、Qwen3 等),防御效果不受模型架构影响
局限与风险
- 规则归纳质量依赖于底层 LLM 的指令遵循能力,弱模型可能生成过于宽松或严格的规则
- 用户确认环节可能影响自动化流程体验,需权衡安全性与可用性
- 当前实现未覆盖动态权限升级场景,如临时授权特定操作
适合沉淀的概念
indirect-prompt-injection, tool-augmented-llm-agent, runtime-security-enforcement, context-aware-rule-induction, mcp-server-injection, skill-file-injection, deterministic-access-control, audit-log-mechanism
阅读注意
- 重点关注 III-A 节中四个组件的协同工作流程,特别是 Rule Evaluator 的多属性联合判定逻辑
- 注意 III-B 节规则归纳的三步流程:基线规则 ℛ_base 提供不可覆盖的安全底线,任务规则 ℛ_task 实现最小权限原则
- 附录 B 列出的默认基线规则具有重要参考价值,体现了 MITRE ATT&CK 框架的实际应用
- 案例研究展示了完整攻击链如何被逐层拦截,是理解系统运作的关键
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.11790.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的系统架构描述、算法流程、实验设置和结果数据,包含可复现的细节(如规则模板、脱敏模式库),并公开代码实现。