---
title: "2505.15400"
title_zh: "何时继续思考：面向高效推理的自适应思维模式切换"
arxiv_id: "2505.15400"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/05/2505.15400.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 何时继续思考：面向高效推理的自适应思维模式切换

## 一句话定位

提出自适应自恢复推理框架（ASRR），通过抑制不必要推理并激活模型内部自恢复机制，实现根据问题难度动态分配推理预算，在保持性能的同时显著降低计算开销。

## 小学生也能听懂

这篇论文教AI像聪明学生一样做题：简单题直接答，难题才多想想。它发明了一个“自动切换开关”，让AI少做无用思考，既省时间又几乎不降低正确率，还变得更安全。

## 为什么值得记录

- 大型推理模型（LRMs）常因冗余推理链导致计算开销过大，尤其在简单任务上存在‘过度思考’问题；
- ASRR 利用模型固有的‘内部自恢复机制’，在 No-Thinking 模式下仍可通过隐式推理补全缺失步骤；
- 引入基于组级准确率的动态长度惩罚机制，避免过早压缩输出损害正确性，实现效率与精度的平衡；
- 实验表明 ASRR 在 1.5B 和 7B 模型上分别减少 32.5% 和 25.7% 的推理 token，性能损失小于 1.2%；
- 该方法还显著提升安全对齐能力，有害响应率下降最多达 21.7%。

## 核心方法

- 系统分析 LRMs 在 Long-Thinking 和 No-Thinking 模式下的性能上限，发现两者 pass@256 接近（86.4% vs 84.98%），归因于 No-Thinking 模式下出现的 Continue-Thinking 行为；
- 定义‘内部自恢复机制’：模型在显式推理被抑制时，仍能对难题隐式补充推理步骤；
- 提出 Adaptive Self-Recovery Reasoning (ASRR) 框架，包含两个核心组件：(1) 显式推理抑制 + 隐式自恢复模块，使用 No-Thinking 前缀引导模型跳过简单问题的冗余推理；(2) 动态长度惩罚（DLP）模块，根据组级准确率条件化施加长度惩罚；
- DLP 机制中，仅当组准确率 ≥ 阈值 τ 时才启用长度惩罚，且惩罚强度随准确率提升而动态增强，防止低准确率阶段过早优化长度；
- 训练采用强化学习（RL），奖励函数为：ℛ_i = 𝕀(y_i = ŷ_i) − α⋅𝒪_i，其中 𝒪_i 为超长比率，α 为动态惩罚系数；
- 推理时模型可自适应感知问题难度，在简单任务上直接作答，在复杂任务上触发 Continue-Thinking 行为以维持高准确率。

## 关键结果

- 在 DeepSeek-R1-Distill-Qwen-1.5B 上，相比 GRPO 基线，ASRR 平均生成长度减少 32.5%（从 5,087 到 3,434 tokens），pass@1 仅下降 1.2%（68.7% → 67.5%）；
- 在 DeepSeek-R1-Distill-Qwen-7B 上，生成长度减少 25.7%（从 6,853 到 5,142 tokens），pass@1 下降仅 0.6%（77.0% → 76.7%）；
- Continue-Thinking 行为频率与问题难度强相关：在 AIME 上达 80.6%（1.5B）和 81.5%（7B），而在 GSM8K 上仅为 2.6% 和 0.3%，体现良好难度感知能力；
- 在安全基准 BeaverTails 和 HarmfulQA 上，ASRR 显著提升无害率，如 1.5B 模型在 HarmfulQA 上从 61.7% 提升至 83.4%（+21.7%）；
- 与其他长度控制方法（如 S1、L1、ThinkPrune）相比，ASRR 在相同 token 预算下实现更高 pass@1 准确率，展现更优的权衡曲线。

## 局限与风险

- ASRR 依赖预训练模型已具备一定的难度感知和自恢复能力，对基础模型能力有要求；
- 动态长度惩罚中的阈值 τ 需手动设定，虽支持灵活调节，但最优值可能因任务而异；
- 实验主要集中在数学推理任务，其他领域（如代码、科学推理）的泛化性有待验证；
- Continue-Thinking 行为依赖模型在 No-Thinking 前缀下仍能生成推理内容，若模型完全停止思考则机制失效。

## 适合沉淀的概念

`internal-self-recovery-mechanism`, `adaptive-self-recovery-reasoning-asrr`, `dynamic-length-penalty-dlp`, `no-thinking-mode`, `continue-thinking-behavior`, `reasoning-budget-allocation`, `accuracy-aware-reward-regulation`, `overthinking-in-lrms`

## 阅读注意

- 重点关注图 2 和图 3(a) 中 pass@256 与 pass@1 的对比，揭示模型在单轮推理中自恢复能力不足的问题；
- 注意表 1 中 No-thinking prompt 虽大幅缩短输出，但准确率下降明显，说明单纯抑制推理不可行；
- 图 6 展示了 ASRR 如何增强 Continue-Thinking 与问题难度的相关性，是验证难度感知的关键证据；
- 附录 B 中的案例分析（表 7 和表 8）揭示了模型当前难度感知的不成熟性，为 ASRR 的必要性提供支撑；
- 安全评估部分（表 2 和表 11）表明减少不必要推理有助于提升模型安全性，是一个重要副产品。

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/05/2505.15400.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设计、定量结果、消融分析和案例研究，方法描述清晰，数据充分，结论有支撑。
