2502.18080
论文导读
提出 Thinking-Optimal Scaling (TOPS) 策略,通过让模型自主选择最短正确推理路径,避免过度思考带来的性能下降,在数学推理任务上实现更优的测试时计算缩放效果。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
面向推理最优的测试时计算缩放策略
一句话定位
提出 Thinking-Optimal Scaling (TOPS) 策略,通过让模型自主选择最短正确推理路径,避免过度思考带来的性能下降,在数学推理任务上实现更优的测试时计算缩放效果。
小学生也能听懂
这篇论文教AI做数学题时别“想太多”,像聪明学生一样挑最短又对的解法,避免绕远路出错,结果又快又好,还能越练越强。
为什么值得记录
- 揭示了现有 o1-like 模型中过度扩展思维链(CoT)长度可能导致推理性能下降的问题,挑战了‘越长越好’的假设
- 提出了一种自适应推理努力机制,使模型能根据问题难度动态调整推理深度,兼顾效率与效果
- 在 Qwen2.5-32B-Instruct 上实现的 TOPS 模型在多个数学基准测试中优于其他蒸馏类 o1-like 模型,并与教师模型 QwQ-32B-Preview 性能相当
- 提供了可复用的三阶段框架:格式模仿、条件推理生成、自我改进,支持迭代优化
核心方法
- 构建‘标签模型’(tag model):使用少量包含不同推理长度(低/中/高努力)的种子数据对基础模型进行微调,使其学会按不同推理努力生成响应
- 推理努力条件化生成:用标签模型对大规模问题集分别生成三种推理努力下的解答
- 思维最优数据集构建:对每个问题,从所有正确回答中选择 token 数最少的作为‘思维最优’响应
- 自我改进训练:在构建的思维最优数据集上对基础模型进行监督微调(SFT),得到 TOPS 模型
- 支持迭代自我改进:将 TOPS 模型作为新标签模型重复上述过程,进一步提升性能
- 引入损失掩码实验验证:训练时屏蔽错误推理步骤的损失,证明错误步骤会损害学习效果
关键结果
- 在 MATH500 上,Qwen2.5-32B-TOPS 准确率达 91.48%,优于 STILL-2-32B (91.40%) 和 Sky-T1-32B-Preview (89.48%)
- 在 AIME2024 上,Qwen2.5-32B-TOPS 准确率为 43.33%,接近 QwQ-32B-Preview 的 45.33%,但生成 token 数更少(7260 vs 7636)
- 在 GSM8K 上,TOPS 模型保持高准确率(95.82%)的同时显著减少 token 使用(412 vs 基础模型 295),体现效率优势
- 迭代 DPO 改进后模型 Qwen2.5-32B-TOPS-Iter-DPO 在 AIME2024 上达到 46.00% 准确率,超越教师模型
- 分析显示:最优推理努力因任务难度而异——简单题适合低努力,难题需要中高努力;过度推理会增加错误步骤比例
局限与风险
- 依赖外部 o1-like 模型(如 QwQ-32B-Preview)生成种子数据,未完全实现从零开始的自主优化
- 当前方法仅在数学和通用推理任务上验证,尚未拓展到代码、科学等其他复杂推理领域
- 最短正确响应的选择假设‘短即优’,但未考虑某些需多路径验证的问题可能受益于更长推理
- 标签模型训练需人工设计三种推理努力提示,自动化程度有待提高
适合沉淀的概念
test-time-compute-scaling, chain-of-thought-length-optimization, overthinking-in-llms, self-improvement-with-optimal-responses, reasoning-effort-conditioning, thinking-optimal-scaling-tops, error-step-impact-on-training, iterative-self-improvement
阅读注意
- 重点关注第 3 节中对 CoT 长度与性能关系的实证分析,尤其是图 1 和表 2 揭示的‘最优推理努力’现象
- 注意附录 I 中关于过滤含错误步骤样本的实验,说明并非所有长推理都有益,关键在错误控制与反思机制
- 比较表 3 中 TOPS 与 Random 策略的差异,理解‘选择最短正确响应’为何更有效
- 查看附录 F 按难度分层的 MATH500 结果,验证‘低难度题不宜过度推理’的结论
- 关注方法部分公式 (1)-(3),理解三阶段训练目标的数学表达
质量说明
- 采用来源:
clean,papers/2025/02/2502.18080.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含主文、附录、实验设置、标准差数据及代码链接,方法描述清晰,实验充分,结论有数据支撑。