2506.18237
论文导读
提出一种基于强化学习的后训练框架 AdapThink,通过组相对奖励函数和多样性感知采样机制,动态调节推理模型在不同置信度下的反思深度偏好,以缓解“过度思考”与“思考不足”问题。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
AdapThink:推理语言模型的适应性思维偏好
一句话定位
提出一种基于强化学习的后训练框架 AdapThink,通过组相对奖励函数和多样性感知采样机制,动态调节推理模型在不同置信度下的反思深度偏好,以缓解“过度思考”与“思考不足”问题。
小学生也能听懂
这篇论文教AI做题时学会“聪明地思考”:简单题少想几步,难题多花时间,像人一样灵活调整思考深度,避免啰嗦或半途而废,用奖励机制让AI自己找到最佳思考节奏。
为什么值得记录
- 解决了当前推理模型在简单问题上过度消耗 token、在复杂问题上过早终止推理的效率问题
- 首次引入基于组内响应特征的自适应奖励机制,避免依赖固定长度预算或外部强模型判断
- 在仅 2K 上下文长度下训练的模型,在 8K token 限制内表现优于多种长度控制基线
- 通过熵引导的多样性采样,同时优化推理准确性和过程多样性,提升训练稳定性
核心方法
- 提出组相对奖励函数(GRPR),根据模型对当前问题的置信度 φ 动态调整对“分支扩展”类过渡词(如 alternatively, another)的偏好
- GRPR 包含三个组件:token 消耗奖励 λ_l、输出完成奖励 λ_o 和分支扩展词奖励 λ_b,均基于组内均值归一化偏差计算
- 使用余弦插值函数 ω(φ) 在低/高置信区间平滑切换奖励策略:低置信时鼓励完成并控长,高置信时抑制无效探索
- 设计两阶段多样性感知采样:先过采样 K 倍,再用熵度量 H_l、H_p、H_b 分别评估长度、暂停验证词和分支扩展词的分布均匀性
- 结合总多样性得分 H_tot 进行置信度约束的下采样,优先保留高多样性样本,确保训练组内推理路径丰富
- 采用 GRPO 算法进行 RL 后训练,奖励为 GRPR 与准确率奖励的加和,KL 系数设为 0.15
- 在 DeepSeek-R1-Distill-Qwen-1.5B 上训练,最大生成长度 2048,batch size 8,学习率 2e-6
关键结果
- 在 MATH-500 上,AdapThink 相比基线模型显著减少正确回答中的“分支扩展”词使用(从 46 降至 19),同时保持高准确率
- 在 AIME 2025 基准上,AdapThink 的 PASS@1 持续优于 TLB、LCPO 等长度控制方法,尤其在长 token 限制下优势更明显
- 消融实验显示,移除动态权重机制(AdapThink-No weight)虽初期缩短长度,但最终准确率下降,验证了自适应策略的必要性
- 控制顺序词(如 first, then)的变体 AdapThink(Sequential) 效果不显著,说明仅调控结构词无法解决过思考问题
局限与风险
- 依赖预定义的反思词表(如 wait, alternatively),可能遗漏其他重要推理行为信号
- 实验仅在数学推理数据集上验证,未测试其他领域(如代码、常识推理)的泛化能力
- 多样性采样计算开销较大,需权衡训练效率与收益
- 未与更先进的 test-time scaling 方法(如 s1)直接对比
适合沉淀的概念
adaptive-reasoning, group-relative-reward, diversity-aware-sampling, overthinking-underthinking, chain-of-thought-efficiency, reflection-words-control, confidence-guided-training, entropy-based-diversity
阅读注意
- 重点关注图 1 和图 6 中正确/错误回答在 token 长度和反思词分布上的差异,这是 AdapThink 设计动机的重要依据
- 注意公式 (3) 中 ω(φ) 的符号如何决定是否启用 λ_b 惩罚项,体现置信度驱动的自适应逻辑
- 附录 E.2 的消融实验揭示了简单缩短长度可能损害性能,强调动态调节的重要性
- 算法 1 提供了完整训练流程,适合复现时参考超参数设置(如 T_min=3, F_min=1)
质量说明
- 采用来源:
raw,raw/papers/2025/06/2506.18237.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的动机分析、方法设计、实验设置和消融研究,包含关键公式、算法伪代码和可视化结果,信息充分且自洽。