论文
arXiv2604.22782
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级64 分钟

Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing

论文导读

提出随机跨层注意力(R-CLA)训练策略,使模型在推理时能灵活适应不同深度级 KV 缓存共享方案,显著降低内存占用同时保持或提升性能。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

随机 KV 路由:实现自适应深度级缓存共享

一句话定位

提出随机跨层注意力(R-CLA)训练策略,使模型在推理时能灵活适应不同深度级 KV 缓存共享方案,显著降低内存占用同时保持或提升性能。

小学生也能听懂

这篇论文教大模型像搭积木一样,训练时随机借用前面层的记忆,让它在运行时能灵活选择保留哪些记忆,从而节省大量内存,还能变得更聪明。

为什么值得记录

  • KV 缓存内存占用随模型深度线性增长,成为部署瓶颈;
  • 现有方法多聚焦时间轴上的 token 压缩/淘汰,而深度维度优化潜力未被充分挖掘;
  • R-CLA 允许单一模型适配多种硬件约束下的缓存策略,无需为每种配置重新训练;
  • 在数据受限微调场景下表现出类正则化效应,常优于标准全缓存基线。

核心方法

  • 定义跨层注意力(CLA):层 l 可查询任意前驱层 l′<l 的 K/V 状态;
  • 引入随机跨层注意力(R-CLA):训练时每层以概率 p 使用自身 KV,否则随机选择前驱层 KV;
  • 构建缓存共享策略 S:仅保留部分层的 KV 缓存,其余层复用最近缓存层的状态;
  • 通过 Bernoulli 采样实现训练时随机性,增强模型对缺失缓存的鲁棒性;
  • 支持预训练和微调阶段应用,兼容 GQA 等现有架构改进。

关键结果

  • 预训练稳定:Qwen3-1.7B 在 p=0.75 时 eval loss 仅上升 <2%;
  • 微调性能优势:Llama-3.1-8B 在 25% 缓存保留下 F1 提升高达 +826.6%(HotpotQA);
  • 效率增益:Qwen3-8B 在 8K 上下文、g=4 分组共享时,KV 缓存减少 75%(1170MB→293MB),吞吐量提升 +22%;
  • 批处理扩展性:batch=16 时基线 OOM,而 g=4 成功运行;
  • 正则化效果:多个模型在 100% 缓存下性能持平或提升(如 Llama-3.1-8B 在 SQuAD v2 上 +30%)。

局限与风险

  • 需访问训练资源,暂不支持纯推理后处理;
  • 未在 MoE 架构上验证;
  • 评估集中于 QA 任务,泛化性待进一步检验;
  • 未与时间轴淘汰或量化方法联合优化。

适合沉淀的概念

kv-cache, cross-layer-attention, cache-sharing, depth-wise-compression, randomized-training, inference-efficiency, regularization-effect, transformer-inference

阅读注意

  • 关注 R-CLA 与结构化 dropout 的区别:前者保留所有层计算,仅随机化 KV 来源;
  • 注意缓存共享策略 μ(l) 的定义方式:非缓存层复用最近前驱缓存;
  • 图 2 和表 2 显示低缓存率时基线模型性能崩溃,而 R-CLA 保持稳定;
  • 附录 B 显示 R-CLA 减缓训练收敛,暗示正则化机制;
  • 表 3 表明无结构随机性(R-CLA)优于固定模式共享(CLA@k)。

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.22782.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供完整实验设置、多模型对比、消融研究及效率 benchmark,数据充分,结论可信。