---
title: "2507.02076"
title_zh: "预算内推理：大模型自适应与可控测试时计算综述"
arxiv_id: "2507.02076"
paper_type: "survey"
source_kind: "raw"
raw_path: "raw/papers/2025/07/2507.02076.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 预算内推理：大模型自适应与可控测试时计算综述

## 一句话定位

提出双层分类框架（L1可控性/L2自适应性），系统梳理高效测试时计算（TTC）方法，并实证分析主流推理模型在预算控制与效率上的表现。

## 小学生也能听懂

这篇论文像给大模型装了个“聪明开关”，让它能根据题目难易自动调节思考时间：简单题少想快答，难题多花时间仔细算，还能按用户设定的“思考预算”严格控制用脑量，避免浪费算力。

## 为什么值得记录

- 揭示当前大模型推理中普遍存在的“过度思考”与“思考不足”问题，强调需根据任务难度动态分配计算资源
- 首次构建L1（可控）与L2（自适应）双层效率框架，为TTC研究提供结构化分类体系
- 实证显示主流模型（如DeepSeek-R1、Claude 3.7）在简单任务上token消耗可达基线5倍，但性能提升有限，凸显效率优化紧迫性
- 推动工业界“快慢思维”产品化趋势（如o1、Claude 3.7的thinking budget），提供理论支撑与实践指导

## 核心方法

- 定义TTC两大范式：并行（多路径采样）与串行（逐步推理），涵盖提示、SFT、RL三类实现方式
- 提出L1可控性：用户预设计算预算（如token数/样本数），模型严格遵循（如TokenSkip压缩CoT、CoT-Valve调节长度）
- 提出L2自适应性：模型依据输入难度或置信度动态调整计算量（如Adaptive-Consistency、DynaThink、Self-Calibration）
- 构建多轴分类树（图1），横向按TTC类型（并行/串行），纵向按优化手段（提示/SFT/RL），覆盖50+代表性工作
- 设计效率评估指标：Outcome Efficiency（有效token占比）、Token Cost、FLOPs Cost，量化“过度思考”程度

## 关键结果

- Claude 3.7在AIME/MATH500上虽支持thinking budget，但30%问题显著超预算，可控性不稳定（图2）
- o1与DeepSeek-R1在数学任务上准确率超90%，但平均token消耗达基线模型（如GPT-4o）3–5倍（图3）
- 蒸馏模型（如DeepSeek-Qwen 7B）输出最长却性能最低，表明SFT易导致推理轨迹死记硬背，泛化性差
- 串行方法（如MCTS、Beam Search）在复杂任务上优于纯并行采样，但缺乏预算感知，易造成资源浪费
- L2自适应方法（如ESC、DPTS）在保持性能同时降低20–40% token使用，验证动态分配有效性

## 局限与风险

- 现有模型对预算控制响应不一致，尤其串行推理难以精细调节步长（如RL训练后内部路径线性化）
- 多数效率指标依赖最终答案正确性，难以评估中间推理质量（如自我修正有效性）
- 实验仅覆盖文本推理，未验证多模态（如视觉推理）场景下的TTC效率
- 自适应方法依赖额外模块（如置信度估计器、难度分类器），增加系统复杂度

## 适合沉淀的概念

`test-time-compute`, `adaptive-reasoning`, `controllable-inference`, `overthinking-phenomenon`, `chain-of-thought-compression`, `reasoning-efficiency-metrics`, `fast-slow-thinking`, `reinforcement-learning-for-reasoning`

## 阅读注意

- 重点关注第2节对L1/L2的形式化定义（公式1–2）及效率指标设计逻辑
- 图1分类树是核心贡献，需结合第4–5节具体内容理解各方法归属
- 第3节实证结果揭示工业模型真实效率瓶颈，建议对比Table 2中Acc/Token列
- 注意区分‘推理过程优化’（本文焦点）与‘推理加速技术’（如KV缓存，本文排除）
- 附录A提供完整实验设置，包括温度、最大长度、评估方式（LLM-as-judge）

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/07/2507.02076.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含摘要、引言、方法、实验、结论及附录，结构清晰；实验数据详实（Table 2含10模型×10数据集指标），支撑主要论点；引用充分（200+文献），覆盖关键工作。
