---
title: "Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing"
title_zh: "随机 KV 路由：实现自适应深度级缓存共享"
arxiv_id: "2604.22782"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.22782.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 随机 KV 路由：实现自适应深度级缓存共享

## 一句话定位

提出随机跨层注意力（R-CLA）训练策略，使模型在推理时能灵活适应不同深度级 KV 缓存共享方案，显著降低内存占用同时保持或提升性能。

## 小学生也能听懂

这篇论文教大模型像搭积木一样，训练时随机借用前面层的记忆，让它在运行时能灵活选择保留哪些记忆，从而节省大量内存，还能变得更聪明。

## 为什么值得记录

- KV 缓存内存占用随模型深度线性增长，成为部署瓶颈；
- 现有方法多聚焦时间轴上的 token 压缩/淘汰，而深度维度优化潜力未被充分挖掘；
- R-CLA 允许单一模型适配多种硬件约束下的缓存策略，无需为每种配置重新训练；
- 在数据受限微调场景下表现出类正则化效应，常优于标准全缓存基线。

## 核心方法

- 定义跨层注意力（CLA）：层 l 可查询任意前驱层 l′<l 的 K/V 状态；
- 引入随机跨层注意力（R-CLA）：训练时每层以概率 p 使用自身 KV，否则随机选择前驱层 KV；
- 构建缓存共享策略 S：仅保留部分层的 KV 缓存，其余层复用最近缓存层的状态；
- 通过 Bernoulli 采样实现训练时随机性，增强模型对缺失缓存的鲁棒性；
- 支持预训练和微调阶段应用，兼容 GQA 等现有架构改进。

## 关键结果

- 预训练稳定：Qwen3-1.7B 在 p=0.75 时 eval loss 仅上升 <2%；
- 微调性能优势：Llama-3.1-8B 在 25% 缓存保留下 F1 提升高达 +826.6%（HotpotQA）；
- 效率增益：Qwen3-8B 在 8K 上下文、g=4 分组共享时，KV 缓存减少 75%（1170MB→293MB），吞吐量提升 +22%；
- 批处理扩展性：batch=16 时基线 OOM，而 g=4 成功运行；
- 正则化效果：多个模型在 100% 缓存下性能持平或提升（如 Llama-3.1-8B 在 SQuAD v2 上 +30%）。

## 局限与风险

- 需访问训练资源，暂不支持纯推理后处理；
- 未在 MoE 架构上验证；
- 评估集中于 QA 任务，泛化性待进一步检验；
- 未与时间轴淘汰或量化方法联合优化。

## 适合沉淀的概念

`kv-cache`, `cross-layer-attention`, `cache-sharing`, `depth-wise-compression`, `randomized-training`, `inference-efficiency`, `regularization-effect`, `transformer-inference`

## 阅读注意

- 关注 R-CLA 与结构化 dropout 的区别：前者保留所有层计算，仅随机化 KV 来源；
- 注意缓存共享策略 μ(l) 的定义方式：非缓存层复用最近前驱缓存；
- 图 2 和表 2 显示低缓存率时基线模型性能崩溃，而 R-CLA 保持稳定；
- 附录 B 显示 R-CLA 减缓训练收敛，暗示正则化机制；
- 表 3 表明无结构随机性（R-CLA）优于固定模式共享（CLA@k）。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.22782.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供完整实验设置、多模型对比、消融研究及效率 benchmark，数据充分，结论可信。
