---
title: "Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning"
title_zh: "面向推理最优的测试时计算缩放策略"
arxiv_id: "2502.18080"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2025/02/2502.18080.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 面向推理最优的测试时计算缩放策略

## 一句话定位

提出 Thinking-Optimal Scaling (TOPS) 策略，通过让模型自主选择最短正确推理路径，避免过度思考带来的性能下降，在数学推理任务上实现更优的测试时计算缩放效果。

## 小学生也能听懂

这篇论文教AI做数学题时别“想太多”，像聪明学生一样挑最短又对的解法，避免绕远路出错，结果又快又好，还能越练越强。

## 为什么值得记录

- 揭示了现有 o1-like 模型中过度扩展思维链（CoT）长度可能导致推理性能下降的问题，挑战了‘越长越好’的假设
- 提出了一种自适应推理努力机制，使模型能根据问题难度动态调整推理深度，兼顾效率与效果
- 在 Qwen2.5-32B-Instruct 上实现的 TOPS 模型在多个数学基准测试中优于其他蒸馏类 o1-like 模型，并与教师模型 QwQ-32B-Preview 性能相当
- 提供了可复用的三阶段框架：格式模仿、条件推理生成、自我改进，支持迭代优化

## 核心方法

- 构建‘标签模型’（tag model）：使用少量包含不同推理长度（低/中/高努力）的种子数据对基础模型进行微调，使其学会按不同推理努力生成响应
- 推理努力条件化生成：用标签模型对大规模问题集分别生成三种推理努力下的解答
- 思维最优数据集构建：对每个问题，从所有正确回答中选择 token 数最少的作为‘思维最优’响应
- 自我改进训练：在构建的思维最优数据集上对基础模型进行监督微调（SFT），得到 TOPS 模型
- 支持迭代自我改进：将 TOPS 模型作为新标签模型重复上述过程，进一步提升性能
- 引入损失掩码实验验证：训练时屏蔽错误推理步骤的损失，证明错误步骤会损害学习效果

## 关键结果

- 在 MATH500 上，Qwen2.5-32B-TOPS 准确率达 91.48%，优于 STILL-2-32B (91.40%) 和 Sky-T1-32B-Preview (89.48%)
- 在 AIME2024 上，Qwen2.5-32B-TOPS 准确率为 43.33%，接近 QwQ-32B-Preview 的 45.33%，但生成 token 数更少（7260 vs 7636）
- 在 GSM8K 上，TOPS 模型保持高准确率（95.82%）的同时显著减少 token 使用（412 vs 基础模型 295），体现效率优势
- 迭代 DPO 改进后模型 Qwen2.5-32B-TOPS-Iter-DPO 在 AIME2024 上达到 46.00% 准确率，超越教师模型
- 分析显示：最优推理努力因任务难度而异——简单题适合低努力，难题需要中高努力；过度推理会增加错误步骤比例

## 局限与风险

- 依赖外部 o1-like 模型（如 QwQ-32B-Preview）生成种子数据，未完全实现从零开始的自主优化
- 当前方法仅在数学和通用推理任务上验证，尚未拓展到代码、科学等其他复杂推理领域
- 最短正确响应的选择假设‘短即优’，但未考虑某些需多路径验证的问题可能受益于更长推理
- 标签模型训练需人工设计三种推理努力提示，自动化程度有待提高

## 适合沉淀的概念

`test-time-compute-scaling`, `chain-of-thought-length-optimization`, `overthinking-in-llms`, `self-improvement-with-optimal-responses`, `reasoning-effort-conditioning`, `thinking-optimal-scaling-tops`, `error-step-impact-on-training`, `iterative-self-improvement`

## 阅读注意

- 重点关注第 3 节中对 CoT 长度与性能关系的实证分析，尤其是图 1 和表 2 揭示的‘最优推理努力’现象
- 注意附录 I 中关于过滤含错误步骤样本的实验，说明并非所有长推理都有益，关键在错误控制与反思机制
- 比较表 3 中 TOPS 与 Random 策略的差异，理解‘选择最短正确响应’为何更有效
- 查看附录 F 按难度分层的 MATH500 结果，验证‘低难度题不宜过度推理’的结论
- 关注方法部分公式 (1)-(3)，理解三阶段训练目标的数学表达

## 质量说明

- 采用来源：`clean`，`papers/2025/02/2502.18080.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含主文、附录、实验设置、标准差数据及代码链接，方法描述清晰，实验充分，结论有数据支撑。
