论文
arXiv2603.00578
时间2026-03
来源Markdown
页面质量中文卡片
阅读量级66 分钟

2603.00578

论文导读

提出 Draft-Thinking 方法,通过渐进式课程学习让大模型内化简洁推理模式,在保持推理性能的同时显著降低 token 消耗。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Draft-Thinking:长思维链大模型中的高效推理学习

一句话定位

提出 Draft-Thinking 方法,通过渐进式课程学习让大模型内化简洁推理模式,在保持推理性能的同时显著降低 token 消耗。

小学生也能听懂

这篇论文教大模型像聪明学生一样“打草稿”,先学写简短推理步骤,再慢慢练难题,让它自己学会该快就快、该细就细,做题又快又准,还省力气。

为什么值得记录

  • 解决了长思维链(CoT)推理中普遍存在的过度思考(overthinking)问题,避免不必要的计算开销;
  • 将高效推理从依赖提示词或后处理压缩,转变为模型内生能力,提升泛化性与可控性;
  • 引入自适应推理机制,使模型能根据题目难度动态选择推理深度,实现效率与精度的平衡;
  • 在 MATH500 上实现 82.6% 的 token 减少,仅损失 2.6% 准确率,显著优于现有剪枝、压缩和长度惩罚方法。

核心方法

  • 定义 Draft-Thinking 范式:引导模型生成仅保留关键推理步骤的‘草稿式’思维链(draft-style CoT);
  • 采用三阶段渐进式课程学习:先通过 SFT 从 DeepSeek-V3-685B 蒸馏草稿推理能力,再分两阶段 RL 训练(GRPO)逐步扩展最大生成长度(3k → 6k)和问题难度;
  • 设计三种推理模式:draft(高效)、step(高精度)、adaptive(自适应),支持灵活推理调度;
  • 使用 LIMO 数据集构建训练样本,结合 AIME2024 提升难题处理能力;
  • 不依赖外部压缩器或长度惩罚项,而是通过优化过程让模型自主掌握简洁推理结构。

关键结果

  • 在 Qwen3-8B 上,Draft-Thinking 的 draft 模式在 MATH500 上达到 90.6% 准确率,平均 token 数从 5668 降至 986,token 效率(EFF = ACC/LEN×100)提升至 9.18,为同类方法最高;
  • long CoT 模式在 AIME2025 上准确率提升至 64.79(+0.41),token 消耗减少 21.7%;
  • adaptive 模式在 OlympiadBench 和 MATH500 上同时实现比原始 long CoT 更高的准确率和效率;
  • 在 GPQA-D 非数学任务上,draft 模式 token 减少 76.7%,准确率仅下降 1.83%,显示良好泛化能力;
  • ablation 表明:省略 SFT 阶段会导致 long CoT 性能显著下降(如 AIME2025 上 -14%),证明草稿结构对维持推理质量至关重要。

局限与风险

  • 依赖高质量教师模型(DeepSeek-V3-685B)进行蒸馏,可能限制其在资源受限场景的应用;
  • 当前实验集中于数学推理领域,其他类型推理(如逻辑、常识)的有效性需进一步验证;
  • adaptive 模式依赖模型自身判断难度,可能存在误判风险,未引入外部难度评估机制。

适合沉淀的概念

draft-thinking, progressive-curriculum-learning, chain-of-draft, reasoning-efficiency, overthinking-in-llms, adaptive-reasoning, token-efficiency, reinforcement-learning-for-reasoning

阅读注意

  • 重点关注 3.2 节中的蒸馏策略:如何利用 Chunked Symbolism 提示从大模型生成高质量草稿数据;
  • 注意 3.3 节中‘增量长度扩展策略’的设计动机:避免 RL 初期因过长 budget 导致模型退化回原始长 CoT 行为;
  • 图 4 和表 4 揭示了 draft 模式高效的核心原因:大幅减少推理步骤数(111→22),而非单纯缩短每步长度;
  • 附录 A.5 提供了 Chunked Symbolism 的具体 prompt,是复现的关键;
  • 对比实验中 ThinkPrune 和 DR.SAF 等方法虽也提升效率,但 EFF 仍显著低于 Draft-Thinking,说明内生结构学习优于外部约束。

质量说明

  • 采用来源:cleanpapers/2026/03/2603.00578.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法细节、实验设置、对比基线、消融分析和行为研究,数据充分,可复现性强。