---
title: "DFlash: Block Diffusion for Flash Speculative Decoding"
title_zh: "DFlash：基于块扩散的推测性解码加速框架"
arxiv_id: "2602.06036"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/02/2602.06036.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# DFlash：基于块扩散的推测性解码加速框架

## 一句话定位

提出 DFlash，一种基于轻量级块扩散模型的推测性解码框架，通过并行生成和目标模型隐层特征注入，实现高达 6.1× 的推理加速。

## 小学生也能听懂

这篇论文发明了一种叫DFlash的新方法，就像让AI写作业时不再一个字一个字慢慢猜，而是整段整段快速写出草稿，再让老师（大模型）快速检查，这样速度能快6倍多，还特别省力气。

## 为什么值得记录

- 解决了传统自回归推测性解码中串行 drafting 导致的效率瓶颈，突破现有方法约 2–3× 的速度上限
- 首次将扩散模型成功应用于高效推测性 drafting，在保持无损输出的同时显著提升并行度
- 在多个模型（Qwen3、LLaMA-3.1）和任务（数学、代码、对话）上验证了实用性，最高达 6.1× 加速
- 在 SGLang 生产级部署中表现优异，适用于高并发场景，降低服务成本

## 核心方法

- 采用块级扩散模型作为 draft model，所有 token 在单个前向传播中并行生成，大幅降低 drafting 延迟
- 从目标模型提取多层隐层特征，经投影后注入 draft model 每一层的 KV cache，实现强上下文条件化
- 训练时随机采样 anchor token 构建 masked block，匹配推理时以目标模型输出为起点的行为
- 使用稀疏注意力机制联合训练多个 draft block，提升训练效率
- 引入指数衰减损失加权，强调 draft block 中早期 token 的预测准确性
- 共享目标模型的词嵌入和 LM head，仅训练 Transformer 层，减少参数量并增强对齐

## 关键结果

- 在 Qwen3-8B 上实现最高 6.1× 的端到端加速，平均接受长度 τ 达 7.87
- 相比 EAGLE-3（tree size=16），DFlash 平均提速 2.4×；即使对比 tree size=60 的 EAGLE-3 仍具优势
- 在 SGLang 上，Qwen3-8B 数学任务最高实现 5.1× 吞吐量提升
- 支持动态 block size 推理：训练于大 block size 的模型可泛化至小 block size，便于部署优化

## 局限与风险

- 依赖目标模型的隐层特征提取，增加训练复杂度和存储开销（尤其离线训练时）
- 当前未实现自适应 block size 调度，需手动选择以平衡验证开销与接受长度
- 扩散 draft model 仍需数层深度（如 5 层）才能发挥优势，可能在小设备上受限

## 适合沉淀的概念

`speculative-decoding`, `diffusion-language-models`, `block-diffusion`, `kv-injection`, `acceptance-length`, `draft-model`, `target-model-features`, `loss-decay-weighting`

## 阅读注意

- 重点关注第 4.1 节中 KV 注入机制如何缓解深层 draft model 中上下文稀释问题
- 注意训练时 anchor token 随机采样策略对数据效率和泛化能力的影响（见 4.2 节）
- 图 3 展示了 DFlash 与 EAGLE-3 在 drafting cost 上的根本差异，是理解其效率优势的关键
- 表 7 揭示了 block size 训练-推理不匹配时的非对称泛化行为，对部署有指导意义

## 质量说明

- 采用来源：`clean`，`papers/2026/02/2602.06036.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、消融分析和生产环境验证，方法描述清晰，结果可复现性强。
