---
title: "2511.10037"
title_zh: "超越 ReAct：面向复杂工具增强 LLM 推理的规划器中心框架"
arxiv_id: "2511.10037"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/11/2511.10037.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 超越 ReAct：面向复杂工具增强 LLM 推理的规划器中心框架

## 一句话定位

提出一种以规划器为核心的 Plan-Execute 范式，通过 DAG 全局规划和两阶段 SFT+GRPO 训练，解决传统 ReAct 类方法在复杂多工具任务中的局部优化陷阱问题。

## 小学生也能听懂

这篇论文像搭积木前先画图纸，让AI先规划好每一步用哪些工具、谁先谁后，再按图执行，避免走错路，比边想边做的方法更快更准。

## 为什么值得记录

- 传统 ReAct 等反应式框架在复杂查询中易陷入局部优化，难以处理工具间的并行与依赖关系
- 首次将规划（Planning）与执行（Execution）解耦，通过专用 Planner 模型生成全局 DAG 执行计划，提升复杂工作流效率
- 构建 ComplexTool-Plan 基准数据集，填补复杂非线性规划评估的空白，支持细粒度难度分级
- 在 StableToolBench 上实现开源模型 SOTA 性能，且平均仅需 2.29 步推理，显著优于迭代式方法

## 核心方法

- 提出 Planner-centric 架构：使用独立 Planner 模型将用户查询转化为带依赖关系的 DAG 执行图，节点为工具，边为数据流
- 构建 ComplexTool-Plan 数据集：三阶段自动化流程（工作流生成 → 查询逆向工程 → 意图分析与重规划）生成高质量 (query, DAG) 训练对
- 两阶段训练策略：先通过监督微调（SFT）初始化模型，再采用 Group Relative Policy Optimization（GRPO）进行强化学习优化
- 设计分层奖励函数：优先惩罚语法错误、环路、非连通等结构问题，再基于边 F1 分数和完全匹配奖励优化计划质量
- RL 训练数据筛选：仅保留 SFT 模型表现不稳定的高方差样本，聚焦学习边界任务，防止策略退化

## 关键结果

- 在 ComplexTool-Plan Easy 集上，Qwen3-8B (SFT+RL) 的 DAG 完全匹配准确率达 0.803，优于 GPT-4o (0.635) 等闭源模型
- 在 Hard 集上，Qwen3-8B (SFT+RL) 的 DAG 准确率从 SFT 的 0.295 提升至 0.319（+8.1%），显示 RL 对复杂结构纠错的关键作用
- 在 StableToolBench 端到端评估中，Qwen3-8B (RL) 平均 SoPR 达 59.8%，超越 GPT-4 (ReAct) 的 48.2%，且为所有方法中最高
- 推理效率最优：平均仅需 2.29 步完成 task，低于 DTA-Llama (2.48) 和其他迭代/并行框架

## 局限与风险

- Qwen3-0.6B 模型在 RL 阶段出现训练不稳定，表明小模型可能难以避免奖励黑客（reward hacking）行为
- 非迭代架构虽高效，但缺乏执行过程中的错误恢复机制，对规划质量依赖较高
- ComplexTool-Plan 依赖 DeepSeek-V3 作为教师模型生成数据，可能存在偏差或泛化局限

## 适合沉淀的概念

`planner-centric-framework`, `dag-based-planning`, `sft-grpo-training`, `hierarchical-reward-function`, `complextool-plan-benchmark`, `tool-augmented-llm`, `global-vs-local-optimization`, `end-to-end-task-execution`

## 阅读注意

- 关注图 2 中训练与执行流程的对比，理解 Planner 如何一次性生成 DAG 而非逐步决策
- 注意分层奖励函数的设计逻辑：结构错误（如环路）优先于语义错误，体现‘fail-fast’思想
- Table 3 中 SoPR 与 SoWR 的区别：前者衡量绝对成功率，后者对比 GPT-3.5(ReAct) 的相对胜率
- Table 4 显示该方法步数最少，说明全局规划减少了冗余交互，是效率优势的关键
- Hard 集上所有模型 DAG 匹配率均低于 0.32，反映复杂依赖建模仍是挑战

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/11/2511.10037.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置、基线对比和消融分析，数据与代码已公开，结果可复现性强。
