---
title: "2508.12265"
title_zh: "大模型快慢与工具增强思维综述"
arxiv_id: "2508.12265"
paper_type: "survey"
source_kind: "raw"
raw_path: "raw/papers/2025/08/2508.12265.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 大模型快慢与工具增强思维综述

## 一句话定位

提出基于快/慢和内部/外部知识边界的LLM推理策略分类体系，系统梳理自适应推理策略选择方法

## 小学生也能听懂

这篇论文像给大模型装了个“聪明大脑开关”，能根据题目难易自动选择快想（靠直觉）或慢想（仔细算），还能决定是自己答还是请工具帮忙，让AI更聪明又省力气。

## 为什么值得记录

- 首次构建涵盖快思考、慢思考与工具增强思维的统一推理策略分类框架
- 系统归纳基于模型置信度、任务复杂度、效用增益等决策因素的选择机制
- 区分隐式（端到端学习）与显式（外部路由）两种推理策略选择范式
- 为构建高效、可靠、自适应的大模型推理系统提供理论基础与方法指导

## 核心方法

- 提出双知识边界理论框架：快/慢边界（直觉vs deliberative）与内部/外部边界（参数知识vs工具增强）
- 建立统一数学建模：通过长度选择函数el(x)和知识源选择函数es(x)动态决定推理策略
- 设计决策评分机制：Φl和Φs分别聚合模型置信度、任务复杂度等特征，经阈值δ判断策略切换
- 分类综述现有方法：按隐式（SFT/RL）与显式（规则/模型路由）两大范式组织
- 构建细粒度决策因子图谱：围绕两大边界分析模型置信度、任务复杂度、效用增益三类核心因素

## 关键结果

- 整理30+代表性方法并制表对比，涵盖DynaThink、AdaCoT、ThinkSwitcher、Toolformer等关键工作
- 揭示当前研究趋势：RL-based方法在复杂决策中表现更优，轻量级路由器成为显式选择主流
- 发现实践差距：多数模型仍依赖用户指定推理模式，缺乏真正自主的策略切换能力
- 验证理论有效性：双边界框架成功解释Qwen3、Llama-Nemotron等混合推理模型的设计逻辑

## 局限与风险

- 未涵盖多模态推理策略选择（如视觉-语言协同决策）
- 对预训练阶段如何植入策略意识探讨不足
- 缺乏对策略切换过程中错误传播与鲁棒性的深入分析
- 多数评估集中于数学/代码任务，通用场景验证不足

## 适合沉淀的概念

`fast-slow-thinking`, `tool-augmented-reasoning`, `adaptive-reasoning-strategy`, `model-confidence-estimation`, `task-complexity-assessment`, `implicit-vs-explicit-selection`, `reasoning-orchestration`, `dual-process-theory-in-llms`

## 阅读注意

- 重点关注第5节决策因子分析，理解不同方法如何量化‘何时切换策略’
- 注意区分‘模型置信度’（内部信念）与‘任务复杂度’（外部属性）的本质差异
- 图3的决策因子树状图是理解全文分类逻辑的关键
- 表1汇总了各方法的核心特征，适合快速检索对比
- 未来方向部分提出预训练融合、统一选择等前沿问题，值得深入思考

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/08/2508.12265.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，分类体系清晰，引用全面（120+文献），但未提供具体实验数据或案例研究，部分结论基于作者归纳
