论文
arXiv2510.26020
时间2025-10
来源Markdown
页面质量中文卡片
阅读量级134 分钟

2510.26020

论文导读

提出 PORTool,一种结合树状轨迹展开与步骤级奖励的策略优化算法,用于提升大模型在动态工具调用环境中的推理与执行能力。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

PORTool:基于奖励树的工具使用大模型训练方法

一句话定位

提出 PORTool,一种结合树状轨迹展开与步骤级奖励的策略优化算法,用于提升大模型在动态工具调用环境中的推理与执行能力。

小学生也能听懂

这篇论文教大模型像搭积木一样用工具解决问题:它先试几种方法(像树分叉),每一步都给打分,选最好的走,最后不仅答得更准,用的步骤还更少。

为什么值得记录

  • 首次通过强化学习让 LLM 与多个真实可执行工具交互,实现基于实时信息的动态工具调用;
  • 突破传统静态数据集训练的局限,支持模型探索多种有效解决路径;
  • 引入步骤级奖励机制,更精细地评估每一步工具调用的有效性;
  • 在最终答案准确率和工具调用步数上显著优于现有方法(如 GRPO、ARPO)。

核心方法

  • 构建包含 17 个工具的套件,涵盖实时(如天气)、事实(如数学计算)和混合型工具(如单位转换);
  • 设计双代理系统:工具使用代理生成轨迹,评估代理(GPT-4o)判断最终答案正确性;
  • 采用树状轨迹展开(tree rollout)策略,允许不同轨迹共享前缀并在分叉点探索不同路径;
  • 定义两步奖励函数:结果奖励(+1/0/-1)和格式奖励(0~1),后者经缩放确保正确性优先;
  • 计算两类优势:轨迹相对优势(整体表现)和分叉相对优势(局部最优选择);
  • 提出理论最优系数设置公式,平衡两类优势对策略更新的影响;
  • 使用改进的 GRPO 目标函数进行策略优化,无 KL 散度约束以增强灵活性。

关键结果

  • 在 2,701 个查询(2,560 训练 / 141 测试)上训练 Qwen-2.5-7B 和 Qwen-3-1.7B;
  • PORTool 相比 GRPO 在最终准确率上提升显著(具体数值未给出,但实验表明‘显著改进’);
  • 平均工具调用步数减少,表明模型更高效地找到解决方案;
  • 消融实验验证了步骤级奖励和树结构设计的有效性;
  • 与 ARPO 相比,PORTool 在轨迹生成效率和性能上均更优。

局限与风险

  • 依赖强大的评估代理(如 GPT-4o)进行轨迹评分,可能引入外部偏差;
  • 树状展开的计算开销高于独立轨迹生成,尤其在高分支因子时;
  • 格式奖励设计依赖预定义模板(如 /),泛化性受限;
  • 未公开完整代码与数据集,复现存在一定门槛。

适合沉淀的概念

tool-use-llm, reinforcement-learning-for-llm, tree-rollout, step-wise-reward, policy-optimization, react-framework, grpo, agentic-system

阅读注意

  • 重点关注树状轨迹如何构建以及分叉点如何定义;
  • 注意奖励函数中结果与格式权重的缩放机制,防止格式压倒正确性;
  • 理解 fork-relative advantage 如何捕捉局部最优决策;
  • 查看附录中的失败案例(如 Qwen-3-1.7B 格式错误无法恢复)以了解模型局限;
  • 对比 PORTool 与 ARPO 在 rollout 生成逻辑上的差异。

质量说明

  • 采用来源:rawraw/papers/2025/10/2510.26020.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、实验设置和部分结果分析,但关键性能指标(如准确率数值)未量化呈现,且缺乏开源信息,影响可验证性。