---
title: "DAST: Difficulty-Adaptive Slow Thinking for Large Reasoning Models"
title_zh: "DAST：面向大推理模型的难度自适应慢思考框架"
arxiv_id: "2503.04472"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2025/03/2503.04472.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# DAST：面向大推理模型的难度自适应慢思考框架

## 一句话定位

提出一种难度自适应的慢思考框架 DAST，通过 Token Length Budget 量化问题难度，并结合预算感知奖励机制与偏好优化，使模型能根据问题复杂度动态调整推理长度，在减少冗余思考的同时保持复杂任务上的推理性能。

## 小学生也能听懂

这篇论文教AI做题时别总写一大串，简单题就短答，难题才多想想，像聪明学生一样省时间又考高分，新方法让AI在数学和科学题上答得更准、写得更少。

## 为什么值得记录

- 解决了当前慢思考模型（如 o1、DeepSeek-R1）普遍存在的‘过度思考’问题，即在简单问题上生成冗长推理链，导致计算资源浪费；
- 提出了一种新颖的问题难度量化指标 Token Length Budget (TLB)，融合了采样准确率和响应长度分布，适用于多种下游任务；
- 在多个基准测试（MATH-500、AIME 2024、GPQA）和不同规模模型（7B/32B）上验证了方法的有效性，平均 token 使用量减少超 30%，同时在困难任务上保持或提升准确率；
- 相比现有统一压缩策略（如 SimPOShortest），DAST 展现出更强的难度自适应能力，在简单题上大幅压缩，在难题上保留充分推理空间。

## 核心方法

- 定义 Token Length Budget (TLB) 指标：$ L_{budget} = p \cdot L_{\overline{r}} + (1-p) \cdot L_{max} $，其中 $ p $ 为采样准确率，$ L_{\overline{r}} $ 为正确答案平均长度，$ L_{max} $ 为最大生成长度；
- 设计预算感知奖励函数：对正确但超长的回答施加惩罚，对错误但推理不足的回答鼓励延长思考，奖励值基于实际长度与 TLB 的偏差进行校准；
- 构建两类对比训练对：Dual-Correct Pair (DCP) 鼓励简洁正确回答，Dual-InCorrect Pair (DICP) 激励未解出时深入推理；
- 采用 SimPO 进行偏好优化训练，目标函数引入长度归一化项以增强对输出长度的控制敏感性；
- 通过截断阈值 $ \delta $ 过滤低区分度样本，每题最多保留一对 DCP 和一对 DICP，确保训练稳定性。

## 关键结果

- 在 DS-7B 上，DAST 相比原始模型在 MATH-500 上实现 18.1% 的 token 压缩（CR），C-LEN 减少 22.8%，准确率从 93.2% 提升至 93.6%；
- 在 DS-32B 上，DAST 在 AIME 2024 上准确率从 73.3% 提升至 76.7%，同时实现 35.9% 的 token 压缩；
- 细粒度分析显示，DAST 在 MATH-500 Level 1 上压缩率达 58.5%，而在最难的 Level 5 上仅为 40.8%，体现其难度自适应特性；
- 消融实验表明，DCP 和 DICP 组件互补：移除 DCP 导致长度增加 17.8%，移除 DICP 导致准确率下降 3.2%；
- 尽管仅在数学数据上训练，DAST 在 GPQA（博士级科学题）上仍取得 3.53% 的准确率提升，显示一定领域泛化能力。

## 局限与风险

- 当前评估局限于 STEM 领域（数学、物理、化学），未涵盖代码生成或通用任务，需进一步扩展 benchmark；
- 方法对截断阈值 $ \delta $ 敏感，需通过网格搜索调优，带来额外调参成本；
- 采用离线构造偏好数据的方式，可能限制性能潜力，未来可探索基于在线强化学习的变体以提升效果。

## 适合沉淀的概念

`difficulty-adaptive-reasoning`, `token-length-budget`, `overthinking-in-reasoning-models`, `budget-aware-reward-shaping`, `dual-correct-pair`, `dual-incorrect-pair`, `simpo-preference-optimization`, `reasoning-efficiency-compression`

## 阅读注意

- 重点关注 Token Length Budget 如何结合采样准确率与长度信息来反映问题难度；
- 注意 DCP 和 DICP 两种对比对在训练中的作用机制及其互补性；
- 观察 DAST 在不同难度级别上的压缩率变化趋势，这是验证其自适应能力的关键证据；
- 留意 SimPO 目标函数中长度归一化项的设计意图；
- 思考为何 CICP（正确-错误对）未带来性能增益，可能涉及奖励信号冲突问题。

## 质量说明

- 采用来源：`clean`，`papers/2025/03/2503.04472.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、消融研究、细粒度分析和实现细节，结果可复现性强，方法描述清晰，贡献明确。
