论文
arXiv2502.18080
时间2025-02
来源Markdown
页面质量中文卡片
阅读量级89 分钟

2502.18080

论文导读

提出 Thinking-Optimal Scaling (TOPS) 策略,通过让模型自主选择最短正确推理路径,避免过度思考带来的性能下降,在数学推理任务上实现更优的测试时计算缩放效果。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

面向推理最优的测试时计算缩放策略

一句话定位

提出 Thinking-Optimal Scaling (TOPS) 策略,通过让模型自主选择最短正确推理路径,避免过度思考带来的性能下降,在数学推理任务上实现更优的测试时计算缩放效果。

小学生也能听懂

这篇论文教AI做数学题时别“想太多”,像聪明学生一样挑最短又对的解法,避免绕远路出错,结果又快又好,还能越练越强。

为什么值得记录

  • 揭示了现有 o1-like 模型中过度扩展思维链(CoT)长度可能导致推理性能下降的问题,挑战了‘越长越好’的假设
  • 提出了一种自适应推理努力机制,使模型能根据问题难度动态调整推理深度,兼顾效率与效果
  • 在 Qwen2.5-32B-Instruct 上实现的 TOPS 模型在多个数学基准测试中优于其他蒸馏类 o1-like 模型,并与教师模型 QwQ-32B-Preview 性能相当
  • 提供了可复用的三阶段框架:格式模仿、条件推理生成、自我改进,支持迭代优化

核心方法

  • 构建‘标签模型’(tag model):使用少量包含不同推理长度(低/中/高努力)的种子数据对基础模型进行微调,使其学会按不同推理努力生成响应
  • 推理努力条件化生成:用标签模型对大规模问题集分别生成三种推理努力下的解答
  • 思维最优数据集构建:对每个问题,从所有正确回答中选择 token 数最少的作为‘思维最优’响应
  • 自我改进训练:在构建的思维最优数据集上对基础模型进行监督微调(SFT),得到 TOPS 模型
  • 支持迭代自我改进:将 TOPS 模型作为新标签模型重复上述过程,进一步提升性能
  • 引入损失掩码实验验证:训练时屏蔽错误推理步骤的损失,证明错误步骤会损害学习效果

关键结果

  • 在 MATH500 上,Qwen2.5-32B-TOPS 准确率达 91.48%,优于 STILL-2-32B (91.40%) 和 Sky-T1-32B-Preview (89.48%)
  • 在 AIME2024 上,Qwen2.5-32B-TOPS 准确率为 43.33%,接近 QwQ-32B-Preview 的 45.33%,但生成 token 数更少(7260 vs 7636)
  • 在 GSM8K 上,TOPS 模型保持高准确率(95.82%)的同时显著减少 token 使用(412 vs 基础模型 295),体现效率优势
  • 迭代 DPO 改进后模型 Qwen2.5-32B-TOPS-Iter-DPO 在 AIME2024 上达到 46.00% 准确率,超越教师模型
  • 分析显示:最优推理努力因任务难度而异——简单题适合低努力,难题需要中高努力;过度推理会增加错误步骤比例

局限与风险

  • 依赖外部 o1-like 模型(如 QwQ-32B-Preview)生成种子数据,未完全实现从零开始的自主优化
  • 当前方法仅在数学和通用推理任务上验证,尚未拓展到代码、科学等其他复杂推理领域
  • 最短正确响应的选择假设‘短即优’,但未考虑某些需多路径验证的问题可能受益于更长推理
  • 标签模型训练需人工设计三种推理努力提示,自动化程度有待提高

适合沉淀的概念

test-time-compute-scaling, chain-of-thought-length-optimization, overthinking-in-llms, self-improvement-with-optimal-responses, reasoning-effort-conditioning, thinking-optimal-scaling-tops, error-step-impact-on-training, iterative-self-improvement

阅读注意

  • 重点关注第 3 节中对 CoT 长度与性能关系的实证分析,尤其是图 1 和表 2 揭示的‘最优推理努力’现象
  • 注意附录 I 中关于过滤含错误步骤样本的实验,说明并非所有长推理都有益,关键在错误控制与反思机制
  • 比较表 3 中 TOPS 与 Random 策略的差异,理解‘选择最短正确响应’为何更有效
  • 查看附录 F 按难度分层的 MATH500 结果,验证‘低难度题不宜过度推理’的结论
  • 关注方法部分公式 (1)-(3),理解三阶段训练目标的数学表达

质量说明

  • 采用来源:cleanpapers/2025/02/2502.18080.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含主文、附录、实验设置、标准差数据及代码链接,方法描述清晰,实验充分,结论有数据支撑。