论文
arXiv2511.10037
时间2025-11
来源Markdown
页面质量中文卡片
阅读量级44 分钟

2511.10037

论文导读

提出一种以规划器为核心的 Plan-Execute 范式,通过 DAG 全局规划和两阶段 SFT+GRPO 训练,解决传统 ReAct 类方法在复杂多工具任务中的局部优化陷阱问题。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

超越 ReAct:面向复杂工具增强 LLM 推理的规划器中心框架

一句话定位

提出一种以规划器为核心的 Plan-Execute 范式,通过 DAG 全局规划和两阶段 SFT+GRPO 训练,解决传统 ReAct 类方法在复杂多工具任务中的局部优化陷阱问题。

小学生也能听懂

这篇论文像搭积木前先画图纸,让AI先规划好每一步用哪些工具、谁先谁后,再按图执行,避免走错路,比边想边做的方法更快更准。

为什么值得记录

  • 传统 ReAct 等反应式框架在复杂查询中易陷入局部优化,难以处理工具间的并行与依赖关系
  • 首次将规划(Planning)与执行(Execution)解耦,通过专用 Planner 模型生成全局 DAG 执行计划,提升复杂工作流效率
  • 构建 ComplexTool-Plan 基准数据集,填补复杂非线性规划评估的空白,支持细粒度难度分级
  • 在 StableToolBench 上实现开源模型 SOTA 性能,且平均仅需 2.29 步推理,显著优于迭代式方法

核心方法

  • 提出 Planner-centric 架构:使用独立 Planner 模型将用户查询转化为带依赖关系的 DAG 执行图,节点为工具,边为数据流
  • 构建 ComplexTool-Plan 数据集:三阶段自动化流程(工作流生成 → 查询逆向工程 → 意图分析与重规划)生成高质量 (query, DAG) 训练对
  • 两阶段训练策略:先通过监督微调(SFT)初始化模型,再采用 Group Relative Policy Optimization(GRPO)进行强化学习优化
  • 设计分层奖励函数:优先惩罚语法错误、环路、非连通等结构问题,再基于边 F1 分数和完全匹配奖励优化计划质量
  • RL 训练数据筛选:仅保留 SFT 模型表现不稳定的高方差样本,聚焦学习边界任务,防止策略退化

关键结果

  • 在 ComplexTool-Plan Easy 集上,Qwen3-8B (SFT+RL) 的 DAG 完全匹配准确率达 0.803,优于 GPT-4o (0.635) 等闭源模型
  • 在 Hard 集上,Qwen3-8B (SFT+RL) 的 DAG 准确率从 SFT 的 0.295 提升至 0.319(+8.1%),显示 RL 对复杂结构纠错的关键作用
  • 在 StableToolBench 端到端评估中,Qwen3-8B (RL) 平均 SoPR 达 59.8%,超越 GPT-4 (ReAct) 的 48.2%,且为所有方法中最高
  • 推理效率最优:平均仅需 2.29 步完成 task,低于 DTA-Llama (2.48) 和其他迭代/并行框架

局限与风险

  • Qwen3-0.6B 模型在 RL 阶段出现训练不稳定,表明小模型可能难以避免奖励黑客(reward hacking)行为
  • 非迭代架构虽高效,但缺乏执行过程中的错误恢复机制,对规划质量依赖较高
  • ComplexTool-Plan 依赖 DeepSeek-V3 作为教师模型生成数据,可能存在偏差或泛化局限

适合沉淀的概念

planner-centric-framework, dag-based-planning, sft-grpo-training, hierarchical-reward-function, complextool-plan-benchmark, tool-augmented-llm, global-vs-local-optimization, end-to-end-task-execution

阅读注意

  • 关注图 2 中训练与执行流程的对比,理解 Planner 如何一次性生成 DAG 而非逐步决策
  • 注意分层奖励函数的设计逻辑:结构错误(如环路)优先于语义错误,体现‘fail-fast’思想
  • Table 3 中 SoPR 与 SoWR 的区别:前者衡量绝对成功率,后者对比 GPT-3.5(ReAct) 的相对胜率
  • Table 4 显示该方法步数最少,说明全局规划减少了冗余交互,是效率优势的关键
  • Hard 集上所有模型 DAG 匹配率均低于 0.32,反映复杂依赖建模仍是挑战

质量说明

  • 采用来源:rawraw/papers/2025/11/2511.10037.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、实验设置、基线对比和消融分析,数据与代码已公开,结果可复现性强。