---
title: "2506.18237"
title_zh: "AdapThink：推理语言模型的适应性思维偏好"
arxiv_id: "2506.18237"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/06/2506.18237.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# AdapThink：推理语言模型的适应性思维偏好

## 一句话定位

提出一种基于强化学习的后训练框架 AdapThink，通过组相对奖励函数和多样性感知采样机制，动态调节推理模型在不同置信度下的反思深度偏好，以缓解“过度思考”与“思考不足”问题。

## 小学生也能听懂

这篇论文教AI做题时学会“聪明地思考”：简单题少想几步，难题多花时间，像人一样灵活调整思考深度，避免啰嗦或半途而废，用奖励机制让AI自己找到最佳思考节奏。

## 为什么值得记录

- 解决了当前推理模型在简单问题上过度消耗 token、在复杂问题上过早终止推理的效率问题
- 首次引入基于组内响应特征的自适应奖励机制，避免依赖固定长度预算或外部强模型判断
- 在仅 2K 上下文长度下训练的模型，在 8K token 限制内表现优于多种长度控制基线
- 通过熵引导的多样性采样，同时优化推理准确性和过程多样性，提升训练稳定性

## 核心方法

- 提出组相对奖励函数（GRPR），根据模型对当前问题的置信度 φ 动态调整对“分支扩展”类过渡词（如 alternatively, another）的偏好
- GRPR 包含三个组件：token 消耗奖励 λ_l、输出完成奖励 λ_o 和分支扩展词奖励 λ_b，均基于组内均值归一化偏差计算
- 使用余弦插值函数 ω(φ) 在低/高置信区间平滑切换奖励策略：低置信时鼓励完成并控长，高置信时抑制无效探索
- 设计两阶段多样性感知采样：先过采样 K 倍，再用熵度量 H_l、H_p、H_b 分别评估长度、暂停验证词和分支扩展词的分布均匀性
- 结合总多样性得分 H_tot 进行置信度约束的下采样，优先保留高多样性样本，确保训练组内推理路径丰富
- 采用 GRPO 算法进行 RL 后训练，奖励为 GRPR 与准确率奖励的加和，KL 系数设为 0.15
- 在 DeepSeek-R1-Distill-Qwen-1.5B 上训练，最大生成长度 2048，batch size 8，学习率 2e-6

## 关键结果

- 在 MATH-500 上，AdapThink 相比基线模型显著减少正确回答中的“分支扩展”词使用（从 46 降至 19），同时保持高准确率
- 在 AIME 2025 基准上，AdapThink 的 PASS@1 持续优于 TLB、LCPO 等长度控制方法，尤其在长 token 限制下优势更明显
- 消融实验显示，移除动态权重机制（AdapThink-No weight）虽初期缩短长度，但最终准确率下降，验证了自适应策略的必要性
- 控制顺序词（如 first, then）的变体 AdapThink(Sequential) 效果不显著，说明仅调控结构词无法解决过思考问题

## 局限与风险

- 依赖预定义的反思词表（如 wait, alternatively），可能遗漏其他重要推理行为信号
- 实验仅在数学推理数据集上验证，未测试其他领域（如代码、常识推理）的泛化能力
- 多样性采样计算开销较大，需权衡训练效率与收益
- 未与更先进的 test-time scaling 方法（如 s1）直接对比

## 适合沉淀的概念

`adaptive-reasoning`, `group-relative-reward`, `diversity-aware-sampling`, `overthinking-underthinking`, `chain-of-thought-efficiency`, `reflection-words-control`, `confidence-guided-training`, `entropy-based-diversity`

## 阅读注意

- 重点关注图 1 和图 6 中正确/错误回答在 token 长度和反思词分布上的差异，这是 AdapThink 设计动机的重要依据
- 注意公式 (3) 中 ω(φ) 的符号如何决定是否启用 λ_b 惩罚项，体现置信度驱动的自适应逻辑
- 附录 E.2 的消融实验揭示了简单缩短长度可能损害性能，强调动态调节的重要性
- 算法 1 提供了完整训练流程，适合复现时参考超参数设置（如 T_min=3, F_min=1）

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/06/2506.18237.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的动机分析、方法设计、实验设置和消融研究，包含关键公式、算法伪代码和可视化结果，信息充分且自洽。
