Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing
论文导读
提出随机跨层注意力(R-CLA)训练策略,使模型在推理时能灵活适应不同深度级 KV 缓存共享方案,显著降低内存占用同时保持或提升性能。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
随机 KV 路由:实现自适应深度级缓存共享
一句话定位
提出随机跨层注意力(R-CLA)训练策略,使模型在推理时能灵活适应不同深度级 KV 缓存共享方案,显著降低内存占用同时保持或提升性能。
小学生也能听懂
这篇论文教大模型像搭积木一样,训练时随机借用前面层的记忆,让它在运行时能灵活选择保留哪些记忆,从而节省大量内存,还能变得更聪明。
为什么值得记录
- KV 缓存内存占用随模型深度线性增长,成为部署瓶颈;
- 现有方法多聚焦时间轴上的 token 压缩/淘汰,而深度维度优化潜力未被充分挖掘;
- R-CLA 允许单一模型适配多种硬件约束下的缓存策略,无需为每种配置重新训练;
- 在数据受限微调场景下表现出类正则化效应,常优于标准全缓存基线。
核心方法
- 定义跨层注意力(CLA):层 l 可查询任意前驱层 l′<l 的 K/V 状态;
- 引入随机跨层注意力(R-CLA):训练时每层以概率 p 使用自身 KV,否则随机选择前驱层 KV;
- 构建缓存共享策略 S:仅保留部分层的 KV 缓存,其余层复用最近缓存层的状态;
- 通过 Bernoulli 采样实现训练时随机性,增强模型对缺失缓存的鲁棒性;
- 支持预训练和微调阶段应用,兼容 GQA 等现有架构改进。
关键结果
- 预训练稳定:Qwen3-1.7B 在 p=0.75 时 eval loss 仅上升 <2%;
- 微调性能优势:Llama-3.1-8B 在 25% 缓存保留下 F1 提升高达 +826.6%(HotpotQA);
- 效率增益:Qwen3-8B 在 8K 上下文、g=4 分组共享时,KV 缓存减少 75%(1170MB→293MB),吞吐量提升 +22%;
- 批处理扩展性:batch=16 时基线 OOM,而 g=4 成功运行;
- 正则化效果:多个模型在 100% 缓存下性能持平或提升(如 Llama-3.1-8B 在 SQuAD v2 上 +30%)。
局限与风险
- 需访问训练资源,暂不支持纯推理后处理;
- 未在 MoE 架构上验证;
- 评估集中于 QA 任务,泛化性待进一步检验;
- 未与时间轴淘汰或量化方法联合优化。
适合沉淀的概念
kv-cache, cross-layer-attention, cache-sharing, depth-wise-compression, randomized-training, inference-efficiency, regularization-effect, transformer-inference
阅读注意
- 关注 R-CLA 与结构化 dropout 的区别:前者保留所有层计算,仅随机化 KV 来源;
- 注意缓存共享策略 μ(l) 的定义方式:非缓存层复用最近前驱缓存;
- 图 2 和表 2 显示低缓存率时基线模型性能崩溃,而 R-CLA 保持稳定;
- 附录 B 显示 R-CLA 减缓训练收敛,暗示正则化机制;
- 表 3 表明无结构随机性(R-CLA)优于固定模式共享(CLA@k)。
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.22782.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供完整实验设置、多模型对比、消融研究及效率 benchmark,数据充分,结论可信。