论文
arXiv2506.18237
时间2025-06
来源Markdown
页面质量中文卡片
阅读量级118 分钟

2506.18237

论文导读

提出一种基于强化学习的后训练框架 AdapThink,通过组相对奖励函数和多样性感知采样机制,动态调节推理模型在不同置信度下的反思深度偏好,以缓解“过度思考”与“思考不足”问题。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

AdapThink:推理语言模型的适应性思维偏好

一句话定位

提出一种基于强化学习的后训练框架 AdapThink,通过组相对奖励函数和多样性感知采样机制,动态调节推理模型在不同置信度下的反思深度偏好,以缓解“过度思考”与“思考不足”问题。

小学生也能听懂

这篇论文教AI做题时学会“聪明地思考”:简单题少想几步,难题多花时间,像人一样灵活调整思考深度,避免啰嗦或半途而废,用奖励机制让AI自己找到最佳思考节奏。

为什么值得记录

  • 解决了当前推理模型在简单问题上过度消耗 token、在复杂问题上过早终止推理的效率问题
  • 首次引入基于组内响应特征的自适应奖励机制,避免依赖固定长度预算或外部强模型判断
  • 在仅 2K 上下文长度下训练的模型,在 8K token 限制内表现优于多种长度控制基线
  • 通过熵引导的多样性采样,同时优化推理准确性和过程多样性,提升训练稳定性

核心方法

  • 提出组相对奖励函数(GRPR),根据模型对当前问题的置信度 φ 动态调整对“分支扩展”类过渡词(如 alternatively, another)的偏好
  • GRPR 包含三个组件:token 消耗奖励 λ_l、输出完成奖励 λ_o 和分支扩展词奖励 λ_b,均基于组内均值归一化偏差计算
  • 使用余弦插值函数 ω(φ) 在低/高置信区间平滑切换奖励策略:低置信时鼓励完成并控长,高置信时抑制无效探索
  • 设计两阶段多样性感知采样:先过采样 K 倍,再用熵度量 H_l、H_p、H_b 分别评估长度、暂停验证词和分支扩展词的分布均匀性
  • 结合总多样性得分 H_tot 进行置信度约束的下采样,优先保留高多样性样本,确保训练组内推理路径丰富
  • 采用 GRPO 算法进行 RL 后训练,奖励为 GRPR 与准确率奖励的加和,KL 系数设为 0.15
  • 在 DeepSeek-R1-Distill-Qwen-1.5B 上训练,最大生成长度 2048,batch size 8,学习率 2e-6

关键结果

  • 在 MATH-500 上,AdapThink 相比基线模型显著减少正确回答中的“分支扩展”词使用(从 46 降至 19),同时保持高准确率
  • 在 AIME 2025 基准上,AdapThink 的 PASS@1 持续优于 TLB、LCPO 等长度控制方法,尤其在长 token 限制下优势更明显
  • 消融实验显示,移除动态权重机制(AdapThink-No weight)虽初期缩短长度,但最终准确率下降,验证了自适应策略的必要性
  • 控制顺序词(如 first, then)的变体 AdapThink(Sequential) 效果不显著,说明仅调控结构词无法解决过思考问题

局限与风险

  • 依赖预定义的反思词表(如 wait, alternatively),可能遗漏其他重要推理行为信号
  • 实验仅在数学推理数据集上验证,未测试其他领域(如代码、常识推理)的泛化能力
  • 多样性采样计算开销较大,需权衡训练效率与收益
  • 未与更先进的 test-time scaling 方法(如 s1)直接对比

适合沉淀的概念

adaptive-reasoning, group-relative-reward, diversity-aware-sampling, overthinking-underthinking, chain-of-thought-efficiency, reflection-words-control, confidence-guided-training, entropy-based-diversity

阅读注意

  • 重点关注图 1 和图 6 中正确/错误回答在 token 长度和反思词分布上的差异,这是 AdapThink 设计动机的重要依据
  • 注意公式 (3) 中 ω(φ) 的符号如何决定是否启用 λ_b 惩罚项,体现置信度驱动的自适应逻辑
  • 附录 E.2 的消融实验揭示了简单缩短长度可能损害性能,强调动态调节的重要性
  • 算法 1 提供了完整训练流程,适合复现时参考超参数设置(如 T_min=3, F_min=1)

质量说明

  • 采用来源:rawraw/papers/2025/06/2506.18237.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的动机分析、方法设计、实验设置和消融研究,包含关键公式、算法伪代码和可视化结果,信息充分且自洽。