---
title: "2506.04210"
title_zh: "推理模型测试时扩展思考的幻象：更多思考未必更好"
arxiv_id: "2506.04210"
paper_type: "analysis"
source_kind: "raw"
raw_path: "raw/papers/2025/06/2506.04210.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 推理模型测试时扩展思考的幻象：更多思考未必更好

## 一句话定位

通过实证分析揭示测试时扩展思考（如“Wait”提示）会导致性能先升后降的‘过度思考’现象，并提出并行思考作为更优的推理预算分配策略。

## 小学生也能听懂

这篇论文发现，让AI多思考一会儿，一开始会变聪明，但想太久反而会犯更多错，就像小朋友反复改答案反而容易出错；于是他们提出让AI同时想好几个答案再选最好的，这样更准，最高能提升22%的正确率。

## 为什么值得记录

- 挑战了‘更多思考总是更好’的流行假设，揭示测试时扩展推理存在性能退化临界点
- 提出基于方差增长的‘幻象效应’解释，说明初始性能提升源于输出分布扩散而非真实推理能力增强
- 引入并行思考（parallel thinking）方法，在相同 token 预算下比串行扩展思考准确率高出最多 22%
- 为测试时计算资源分配提供了可复现、可量化的优化方向

## 核心方法

- 采用三种测试时预算控制策略：Wait & Think More、Exact Thinking Tokens、Minimum Thinking Tokens
- 在 GSM-8K、MATH-500 和 AIME 2024 数据集上评估 DeepSeek-R1-Distill 系列模型（1.5B/7B/8B）
- 构建一维概率模型分析策略分布方差与奖励期望的关系，解释非单调性能趋势
- 测量模型输出分布的熵随思考 token 增加的变化，验证方差增长假设
- 设计并行思考机制：将固定 token 预算分配给 N 条独立推理路径，通过多数投票选择最终答案

## 关键结果

- 所有模型和基准均显示：准确率随思考 token 增加呈先升后降趋势，例如 DeepSeek-R1-Distill-Qwen-1.5B 在 GSM-8K 上从 82.2% 升至 87.3% 再降至 70.3%
- 熵分析表明：思考 token 从 385 增至 6136 时，策略分布熵从 0.23 升至 2.79（12倍），验证方差显著增长
- 在 16K token 预算下，并行思考相比 Wait & Think More 提升准确率 22%，相比 Exact Thinking 提升 47%
- 重复相同推理步骤的实验证明：仅增加上下文长度不会提升熵，说明性能变化源于推理过程本身而非输入长度

## 局限与风险

- 实验仅基于数学推理任务，未验证其他领域（如代码、常识推理）是否具有相同模式
- 并行思考依赖多数投票机制，在答案空间稀疏或多样性不足时可能失效
- 未探索自适应停止策略，无法动态判断何时终止思考以避免过度思考
- 所有模型均为 DeepSeek-R1 蒸馏版本，结论在原生大模型上的普适性待验证

## 适合沉淀的概念

`test-time-scaling`, `overthinking-phenomenon`, `reasoning-models`, `parallel-thinking`, `best-of-n-sampling`, `variance-entropy-tradeoff`, `inference-budget-allocation`, `mirage-effect-in-llm`

## 阅读注意

- 重点关注图 2 和图 3 中准确率与 token 数量的非单调关系曲线
- 理解第 3 节中概率模型如何解释方差增加导致期望奖励先升后降
- 注意图 5 和附录图 10-11 中熵与 token 数量的对应关系，这是核心证据链
- 对比图 7 中绿色（并行）与橙色（串行）圆点的趋势差异，体会方法有效性
- 附录 F 的生成示例直观展示了过度思考如何导致错误答案

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/06/2506.04210.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设计、多维度结果、理论解释和替代方案，数据充分且逻辑自洽，具备可复现性。
