---
title: "2604.11790"
title_zh: "ClawGuard：面向工具增强型 LLM 代理的运行时安全框架"
arxiv_id: "2604.11790"
paper_type: "system"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.11790.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# ClawGuard：面向工具增强型 LLM 代理的运行时安全框架

## 一句话定位

提出 ClawGuard，一种在工具调用边界实施确定性访问控制的运行时安全框架，通过用户确认的任务级规则自动防御间接提示注入攻击。

## 小学生也能听懂

ClawGuard 像一个智能保镖，在机器人助手使用工具前检查是否安全，通过用户确认的规则自动挡住坏人偷偷塞进来的坏指令，保护电脑不被控制。

## 为什么值得记录

- 针对工具增强型 LLM 代理中普遍存在的间接提示注入漏洞，提出首个覆盖全部三种主要注入路径（Web/本地内容、MCP 服务器、技能文件）的统一防御方案
- 引入上下文感知的规则归纳机制，无需模型微调或架构修改，即可自动生成任务特定的访问约束
- 在 AgentDojo、SkillInject 和 MCPSafeBench 三大基准测试上验证有效性，显著降低攻击成功率同时保持任务完成率

## 核心方法

- 采用双阶段防御机制：会话前基于用户目标自动生成任务规则集 ℛ_task，并在首次工具调用前经用户确认；每次工具调用时强制执行四层安全检查
- Content Sanitizer 使用可扩展模式库对输入参数和返回内容中的敏感信息（如密钥、令牌）进行脱敏处理
- Rule Evaluator 基于白名单/黑名单机制评估工具调用，涵盖命令、文件路径和网络目标三个维度，采用最严格判定策略
- Skill Inspector 在技能首次执行前通过 LLM 法官进行风险评估，并强制用户确认
- Approval Mechanism 对模糊决策调用暂停执行并交由用户授权，所有操作记录审计日志

## 关键结果

- 在 AgentDojo 基准上，ClawGuard 将平均攻击成功率从基线模型的 68% 降至 9% 以下
- 在 SkillInject 技能注入测试中，成功阻断 94.3% 的恶意技能执行尝试
- 在 MCPSafeBench 的 MCP 服务器攻击场景中，误报率低于 5%，任务完成率保持在 87% 以上
- 支持五种主流 LLM 后端（包括 GPT-4、Claude 3、Qwen3 等），防御效果不受模型架构影响

## 局限与风险

- 规则归纳质量依赖于底层 LLM 的指令遵循能力，弱模型可能生成过于宽松或严格的规则
- 用户确认环节可能影响自动化流程体验，需权衡安全性与可用性
- 当前实现未覆盖动态权限升级场景，如临时授权特定操作

## 适合沉淀的概念

`indirect-prompt-injection`, `tool-augmented-llm-agent`, `runtime-security-enforcement`, `context-aware-rule-induction`, `mcp-server-injection`, `skill-file-injection`, `deterministic-access-control`, `audit-log-mechanism`

## 阅读注意

- 重点关注 III-A 节中四个组件的协同工作流程，特别是 Rule Evaluator 的多属性联合判定逻辑
- 注意 III-B 节规则归纳的三步流程：基线规则 ℛ_base 提供不可覆盖的安全底线，任务规则 ℛ_task 实现最小权限原则
- 附录 B 列出的默认基线规则具有重要参考价值，体现了 MITRE ATT&CK 框架的实际应用
- 案例研究展示了完整攻击链如何被逐层拦截，是理解系统运作的关键

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.11790.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的系统架构描述、算法流程、实验设置和结果数据，包含可复现的细节（如规则模板、脱敏模式库），并公开代码实现。
