---
title: "2604.08407"
title_zh: "LLM 供应链中恶意中间路由攻击的测量研究"
arxiv_id: "2604.08407"
paper_type: "analysis"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.08407.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# LLM 供应链中恶意中间路由攻击的测量研究

## 一句话定位

首次系统研究 LLM API 路由器的中间人攻击面，提出四种攻击类型并在真实生态中验证其存在性与危害，同时评估三种客户端防御方案。

## 小学生也能听懂

这篇论文像检查快递中转站会不会偷偷改包裹或偷信息，发现有些AI中转站真的会乱改指令或盗密钥，还试了三种防护方法，比如加锁、查异常和记日志，能挡住大部分攻击。

## 为什么值得记录

- 揭示了 LLM 代理系统中一个被忽视但高危的信任边界：API 路由器拥有明文访问所有请求/响应的能力，且无端到端完整性保护
- 在真实市场（淘宝、闲鱼等）采购的 428 个路由器中发现 9 个 actively injecting malicious code，2 个使用自适应规避策略，17 个触碰研究者 AWS canary 凭证
- 通过 poisoning study 证明：即使路由器本身 benign，也可因重用泄露密钥或弱配置中继而被拉入攻击链，导致大规模凭证泄露（99 凭证 / 440 会话）
- 提出并实现 Mine 研究代理，验证 AC-1（载荷注入）、AC-2（秘密窃取）、AC-1.a（依赖项定向注入）、AC-1.b（条件触发）四类攻击在四大主流 agent 框架上的可行性
- 评估三种可部署的客户端防御：fail-closed 策略门控（1.0% 误报阻断 AC-1）、响应侧异常检测（89% AC-1 检出率）、仅追加透明日志

## 核心方法

- 形式化威胁模型：将多跳 LLM 路由链建模为 (C, R₁,…,Rₖ, P)，定义 weakest-link 完整性属性——任一恶意路由器即可污染整条路径
- 构建攻击分类法：定义两个核心类 AC-1（响应侧工具调用参数重写）和 AC-2（被动秘密提取），以及两个自适应规避变体 AC-1.a（针对 pip/npm/cargo 安装命令的依赖替换）和 AC-1.b（基于会话状态的条件触发）
- 大规模生态测量：购买 28 个付费路由器（来自淘宝、闲鱼、Shopify 店铺）+ 收集 400 个免费路由器（基于 sub2api/new-api 模板），进行静态分析与动态探测
- 主动投毒实验：故意在中文论坛/微信群/Telegram 泄露研究者自有 OpenAI 密钥；部署 20 个弱配置 decoy 中继（Sub2API/claude-relay-service/CLIProxyAPI）
- 实现 Mine 研究代理：模拟全部四类攻击，在 Claude Code、Codex、OpenClaw 等框架上测试兼容性
- 防御评估：使用合成语料（1k~3k 样本）测试 fail-closed gate、IsolationForest 异常检测、append-only log 三种机制

## 关键结果

- 9/428 路由器 actively inject malicious code（1 paid + 8 free），其中 2 个部署 adaptive evasion（如 50 请求预热后激活、仅限 YOLO 模式）
- 17 个免费路由器触碰 researcher-owned AWS canary credentials，1 个成功 drain ETH from private key（损失 < $50）
- 投毒实验中，单个泄露 OpenAI 密钥生成 100M GPT-5.4 tokens 和 7+ Codex 会话；decoy 中继接收 147 IPs 的未授权访问，处理 2B tokens，暴露 13GB 流量，泄露 99 credentials across 440 sessions
- 440 个受影响会话全部 command-injectable，其中 401 个已处于 autonomous YOLO 模式（自动执行工具调用）
- fail-closed policy gate 在 1.0% false positive 下阻断所有 AC-1 和 AC-1.a shell-rewrite 样本
- response-side anomaly screening（IsolationForest）在 6.7% FP 下实现 89% AC-1 检出率，但对 AC-1.a 和 AC-1.b 效果有限（依赖 shell_risk_score 特征）

## 局限与风险

- 测量范围限于中文市场及部分开源模板（new-api/sub2api），未覆盖欧美主流商业路由器
- 防御评估基于合成数据，未在真实生产流量中验证泛化能力
- 未实现 provider-side 签名方案（如附录 C 所述），仅评估 client-side 缓解措施
- ethical constraints 限制了对发现漏洞的主动利用验证

## 适合沉淀的概念

`llm-api-router`, `supply-chain-security`, `tool-use-attack`, `man-in-the-middle`, `payload-injection`, `secret-exfiltration`, `adaptive-evasion`, `dependency-targeted-injection`, `conditional-delivery`, `fail-closed-policy`, `anomaly-screening`, `transparency-logging`, `weakest-link-property`, `yolo-mode`

## 阅读注意

- 重点关注图 1 和图 2：理解多跳路由架构与攻击触发位置
- 表 1 是核心攻击分类，需结合正文 4.1–4.2 理解每类攻击的 preconditions 与 detection difficulty
- 5.3 节 poisoning study 数据揭示 indirect compromise 风险：benign router 如何成为攻击载体
- 7.1–7.3 节防御评估显示：现有 client-side 方案无法完全阻止 AC-1.a/b，凸显 provider-signed response 的必要性
- 附录 A 详细说明 ethical considerations，包括 credential exposure 设计与数据最小化原则

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.08407.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含 threat model、taxonomy、empirical measurement、poisoning study、implementation (Mine)、defense evaluation 及伦理讨论，数据详实，方法清晰，结论有支撑。
