---
title: "2507.03704"
title_zh: "推理模型中的思维速度控制"
arxiv_id: "2507.03704"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/07/2507.03704.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 推理模型中的思维速度控制

## 一句话定位

提出一种无需训练的推理速度动态调控方法，通过表征工程实现快慢思维切换，在保持准确率的同时降低8.6% token消耗。

## 小学生也能听懂

这篇论文让AI像人一样能快想和慢想：遇到简单题就快速答，难题就慢慢思考。它通过调整AI内部“想法”的方向来控制速度，不用重新训练，还能更准更省力气。

## 为什么值得记录

- 首次实现推理模型在推理过程中动态调整思维速度，模拟人类快慢双系统认知
- 提出基于表征编辑的测试时扩展方法，优于传统提示词扩展策略
- 引入实时难度估计信号指导速度调节，实现效率与精度协同优化
- 所有算法基于vLLM实现，可作为即插即用模块集成到现有部署系统

## 核心方法

- 发现LRMs内在的快慢思维模式可通过起始词（如'To' vs 'Okay'）自然触发
- 采用表征工程（RopE）提取快慢思维转换方向向量：通过对比快慢响应对的隐藏状态差异，经PCA获得主成分作为调控向量
- 在推理时向各层隐藏状态注入该向量：α>0加速（简洁输出），α<0减速（深入分析）
- 设计实时难度估计算法：利用早晚期层logits的Jensen-Shannon散度衡量当前token推理难度
- 实现自适应调控策略：基于滑动窗口难度均值与标准差设定阈值，高难度时降速，低难度时提速

## 关键结果

- 在DeepSeek-R1-Distill-Qwen-7B/32B、QwQ-32B、Qwen3-8B上平均提升+1.3%准确率，减少8.6% token使用
- 加速模式（α=4）相比强制早退基线平均提升+8.2%~+11.4% Pass@1
- 减速模式（α=-4）相比原始输出平均提升+0.51%~+1.46% Pass@1，优于'Wait'扩展方法
- 自适应策略在MATH-500、AIME24/25、GPQA Diamond等基准上全面超越常调控与基线

## 局限与风险

- 依赖LRMs本身具备快慢双模式输出能力，对纯聊天模型效果未验证
- 难度估计基于层间logits差异，可能受模型架构影响需调参
- 当前实现中调控强度范围需手动设定，缺乏理论最优值推导

## 适合沉淀的概念

`system-1-system-2-thinking`, `representation-engineering`, `test-time-scaling`, `reasoning-difficulty-estimation`, `adaptive-inference-control`, `vllm-integration`

## 阅读注意

- 重点关注第2节对快慢思维起始词的统计分析，这是发现内在切换机制的关键
- 第3.1节表征读取流程需理解正负刺激构建与PCA方向提取的数学原理
- 第4.1节难度计算公式（Equation 4）结合JSD与多层平均，是自适应控制的核心信号
- Table 2中自适应控制相比常调控的优势体现动态策略价值
- 附录B包含参数选择（如λ、k、层桶划分）的验证过程，对复现至关重要

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/07/2507.03704.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供完整方法描述、多模型多基准实验、消融分析与开源代码，材料充分可信。
