---
title: "Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs"
title_zh: "Draft-Thinking：长思维链大模型中的高效推理学习"
arxiv_id: "2603.00578"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/03/2603.00578.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Draft-Thinking：长思维链大模型中的高效推理学习

## 一句话定位

提出 Draft-Thinking 方法，通过渐进式课程学习让大模型内化简洁推理模式，在保持推理性能的同时显著降低 token 消耗。

## 小学生也能听懂

这篇论文教大模型像聪明学生一样“打草稿”，先学写简短推理步骤，再慢慢练难题，让它自己学会该快就快、该细就细，做题又快又准，还省力气。

## 为什么值得记录

- 解决了长思维链（CoT）推理中普遍存在的过度思考（overthinking）问题，避免不必要的计算开销；
- 将高效推理从依赖提示词或后处理压缩，转变为模型内生能力，提升泛化性与可控性；
- 引入自适应推理机制，使模型能根据题目难度动态选择推理深度，实现效率与精度的平衡；
- 在 MATH500 上实现 82.6% 的 token 减少，仅损失 2.6% 准确率，显著优于现有剪枝、压缩和长度惩罚方法。

## 核心方法

- 定义 Draft-Thinking 范式：引导模型生成仅保留关键推理步骤的‘草稿式’思维链（draft-style CoT）；
- 采用三阶段渐进式课程学习：先通过 SFT 从 DeepSeek-V3-685B 蒸馏草稿推理能力，再分两阶段 RL 训练（GRPO）逐步扩展最大生成长度（3k → 6k）和问题难度；
- 设计三种推理模式：draft（高效）、step（高精度）、adaptive（自适应），支持灵活推理调度；
- 使用 LIMO 数据集构建训练样本，结合 AIME2024 提升难题处理能力；
- 不依赖外部压缩器或长度惩罚项，而是通过优化过程让模型自主掌握简洁推理结构。

## 关键结果

- 在 Qwen3-8B 上，Draft-Thinking 的 draft 模式在 MATH500 上达到 90.6% 准确率，平均 token 数从 5668 降至 986，token 效率（EFF = ACC/LEN×100）提升至 9.18，为同类方法最高；
- long CoT 模式在 AIME2025 上准确率提升至 64.79（+0.41），token 消耗减少 21.7%；
- adaptive 模式在 OlympiadBench 和 MATH500 上同时实现比原始 long CoT 更高的准确率和效率；
- 在 GPQA-D 非数学任务上，draft 模式 token 减少 76.7%，准确率仅下降 1.83%，显示良好泛化能力；
- ablation 表明：省略 SFT 阶段会导致 long CoT 性能显著下降（如 AIME2025 上 -14%），证明草稿结构对维持推理质量至关重要。

## 局限与风险

- 依赖高质量教师模型（DeepSeek-V3-685B）进行蒸馏，可能限制其在资源受限场景的应用；
- 当前实验集中于数学推理领域，其他类型推理（如逻辑、常识）的有效性需进一步验证；
- adaptive 模式依赖模型自身判断难度，可能存在误判风险，未引入外部难度评估机制。

## 适合沉淀的概念

`draft-thinking`, `progressive-curriculum-learning`, `chain-of-draft`, `reasoning-efficiency`, `overthinking-in-llms`, `adaptive-reasoning`, `token-efficiency`, `reinforcement-learning-for-reasoning`

## 阅读注意

- 重点关注 3.2 节中的蒸馏策略：如何利用 Chunked Symbolism 提示从大模型生成高质量草稿数据；
- 注意 3.3 节中‘增量长度扩展策略’的设计动机：避免 RL 初期因过长 budget 导致模型退化回原始长 CoT 行为；
- 图 4 和表 4 揭示了 draft 模式高效的核心原因：大幅减少推理步骤数（111→22），而非单纯缩短每步长度；
- 附录 A.5 提供了 Chunked Symbolism 的具体 prompt，是复现的关键；
- 对比实验中 ThinkPrune 和 DR.SAF 等方法虽也提升效率，但 EFF 仍显著低于 Draft-Thinking，说明内生结构学习优于外部约束。

## 质量说明

- 采用来源：`clean`，`papers/2026/03/2603.00578.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、对比基线、消融分析和行为研究，数据充分，可复现性强。
