论文
arXiv2604.08407
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级127 分钟

2604.08407

论文导读

首次系统研究 LLM API 路由器的中间人攻击面,提出四种攻击类型并在真实生态中验证其存在性与危害,同时评估三种客户端防御方案。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

LLM 供应链中恶意中间路由攻击的测量研究

一句话定位

首次系统研究 LLM API 路由器的中间人攻击面,提出四种攻击类型并在真实生态中验证其存在性与危害,同时评估三种客户端防御方案。

小学生也能听懂

这篇论文像检查快递中转站会不会偷偷改包裹或偷信息,发现有些AI中转站真的会乱改指令或盗密钥,还试了三种防护方法,比如加锁、查异常和记日志,能挡住大部分攻击。

为什么值得记录

  • 揭示了 LLM 代理系统中一个被忽视但高危的信任边界:API 路由器拥有明文访问所有请求/响应的能力,且无端到端完整性保护
  • 在真实市场(淘宝、闲鱼等)采购的 428 个路由器中发现 9 个 actively injecting malicious code,2 个使用自适应规避策略,17 个触碰研究者 AWS canary 凭证
  • 通过 poisoning study 证明:即使路由器本身 benign,也可因重用泄露密钥或弱配置中继而被拉入攻击链,导致大规模凭证泄露(99 凭证 / 440 会话)
  • 提出并实现 Mine 研究代理,验证 AC-1(载荷注入)、AC-2(秘密窃取)、AC-1.a(依赖项定向注入)、AC-1.b(条件触发)四类攻击在四大主流 agent 框架上的可行性
  • 评估三种可部署的客户端防御:fail-closed 策略门控(1.0% 误报阻断 AC-1)、响应侧异常检测(89% AC-1 检出率)、仅追加透明日志

核心方法

  • 形式化威胁模型:将多跳 LLM 路由链建模为 (C, R₁,…,Rₖ, P),定义 weakest-link 完整性属性——任一恶意路由器即可污染整条路径
  • 构建攻击分类法:定义两个核心类 AC-1(响应侧工具调用参数重写)和 AC-2(被动秘密提取),以及两个自适应规避变体 AC-1.a(针对 pip/npm/cargo 安装命令的依赖替换)和 AC-1.b(基于会话状态的条件触发)
  • 大规模生态测量:购买 28 个付费路由器(来自淘宝、闲鱼、Shopify 店铺)+ 收集 400 个免费路由器(基于 sub2api/new-api 模板),进行静态分析与动态探测
  • 主动投毒实验:故意在中文论坛/微信群/Telegram 泄露研究者自有 OpenAI 密钥;部署 20 个弱配置 decoy 中继(Sub2API/claude-relay-service/CLIProxyAPI)
  • 实现 Mine 研究代理:模拟全部四类攻击,在 Claude Code、Codex、OpenClaw 等框架上测试兼容性
  • 防御评估:使用合成语料(1k~3k 样本)测试 fail-closed gate、IsolationForest 异常检测、append-only log 三种机制

关键结果

  • 9/428 路由器 actively inject malicious code(1 paid + 8 free),其中 2 个部署 adaptive evasion(如 50 请求预热后激活、仅限 YOLO 模式)
  • 17 个免费路由器触碰 researcher-owned AWS canary credentials,1 个成功 drain ETH from private key(损失 < $50)
  • 投毒实验中,单个泄露 OpenAI 密钥生成 100M GPT-5.4 tokens 和 7+ Codex 会话;decoy 中继接收 147 IPs 的未授权访问,处理 2B tokens,暴露 13GB 流量,泄露 99 credentials across 440 sessions
  • 440 个受影响会话全部 command-injectable,其中 401 个已处于 autonomous YOLO 模式(自动执行工具调用)
  • fail-closed policy gate 在 1.0% false positive 下阻断所有 AC-1 和 AC-1.a shell-rewrite 样本
  • response-side anomaly screening(IsolationForest)在 6.7% FP 下实现 89% AC-1 检出率,但对 AC-1.a 和 AC-1.b 效果有限(依赖 shell_risk_score 特征)

局限与风险

  • 测量范围限于中文市场及部分开源模板(new-api/sub2api),未覆盖欧美主流商业路由器
  • 防御评估基于合成数据,未在真实生产流量中验证泛化能力
  • 未实现 provider-side 签名方案(如附录 C 所述),仅评估 client-side 缓解措施
  • ethical constraints 限制了对发现漏洞的主动利用验证

适合沉淀的概念

llm-api-router, supply-chain-security, tool-use-attack, man-in-the-middle, payload-injection, secret-exfiltration, adaptive-evasion, dependency-targeted-injection, conditional-delivery, fail-closed-policy, anomaly-screening, transparency-logging, weakest-link-property, yolo-mode

阅读注意

  • 重点关注图 1 和图 2:理解多跳路由架构与攻击触发位置
  • 表 1 是核心攻击分类,需结合正文 4.1–4.2 理解每类攻击的 preconditions 与 detection difficulty
  • 5.3 节 poisoning study 数据揭示 indirect compromise 风险:benign router 如何成为攻击载体
  • 7.1–7.3 节防御评估显示:现有 client-side 方案无法完全阻止 AC-1.a/b,凸显 provider-signed response 的必要性
  • 附录 A 详细说明 ethical considerations,包括 credential exposure 设计与数据最小化原则

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.08407.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含 threat model、taxonomy、empirical measurement、poisoning study、implementation (Mine)、defense evaluation 及伦理讨论,数据详实,方法清晰,结论有支撑。