---
title: "2510.26020"
title_zh: "PORTool：基于奖励树的工具使用大模型训练方法"
arxiv_id: "2510.26020"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/10/2510.26020.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# PORTool：基于奖励树的工具使用大模型训练方法

## 一句话定位

提出 PORTool，一种结合树状轨迹展开与步骤级奖励的策略优化算法，用于提升大模型在动态工具调用环境中的推理与执行能力。

## 小学生也能听懂

这篇论文教大模型像搭积木一样用工具解决问题：它先试几种方法（像树分叉），每一步都给打分，选最好的走，最后不仅答得更准，用的步骤还更少。

## 为什么值得记录

- 首次通过强化学习让 LLM 与多个真实可执行工具交互，实现基于实时信息的动态工具调用；
- 突破传统静态数据集训练的局限，支持模型探索多种有效解决路径；
- 引入步骤级奖励机制，更精细地评估每一步工具调用的有效性；
- 在最终答案准确率和工具调用步数上显著优于现有方法（如 GRPO、ARPO）。

## 核心方法

- 构建包含 17 个工具的套件，涵盖实时（如天气）、事实（如数学计算）和混合型工具（如单位转换）；
- 设计双代理系统：工具使用代理生成轨迹，评估代理（GPT-4o）判断最终答案正确性；
- 采用树状轨迹展开（tree rollout）策略，允许不同轨迹共享前缀并在分叉点探索不同路径；
- 定义两步奖励函数：结果奖励（+1/0/-1）和格式奖励（0~1），后者经缩放确保正确性优先；
- 计算两类优势：轨迹相对优势（整体表现）和分叉相对优势（局部最优选择）；
- 提出理论最优系数设置公式，平衡两类优势对策略更新的影响；
- 使用改进的 GRPO 目标函数进行策略优化，无 KL 散度约束以增强灵活性。

## 关键结果

- 在 2,701 个查询（2,560 训练 / 141 测试）上训练 Qwen-2.5-7B 和 Qwen-3-1.7B；
- PORTool 相比 GRPO 在最终准确率上提升显著（具体数值未给出，但实验表明‘显著改进’）；
- 平均工具调用步数减少，表明模型更高效地找到解决方案；
- 消融实验验证了步骤级奖励和树结构设计的有效性；
- 与 ARPO 相比，PORTool 在轨迹生成效率和性能上均更优。

## 局限与风险

- 依赖强大的评估代理（如 GPT-4o）进行轨迹评分，可能引入外部偏差；
- 树状展开的计算开销高于独立轨迹生成，尤其在高分支因子时；
- 格式奖励设计依赖预定义模板（如 <think>/<tool_call>），泛化性受限；
- 未公开完整代码与数据集，复现存在一定门槛。

## 适合沉淀的概念

`tool-use-llm`, `reinforcement-learning-for-llm`, `tree-rollout`, `step-wise-reward`, `policy-optimization`, `react-framework`, `grpo`, `agentic-system`

## 阅读注意

- 重点关注树状轨迹如何构建以及分叉点如何定义；
- 注意奖励函数中结果与格式权重的缩放机制，防止格式压倒正确性；
- 理解 fork-relative advantage 如何捕捉局部最优决策；
- 查看附录中的失败案例（如 Qwen-3-1.7B 格式错误无法恢复）以了解模型局限；
- 对比 PORTool 与 ARPO 在 rollout 生成逻辑上的差异。

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/10/2510.26020.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置和部分结果分析，但关键性能指标（如准确率数值）未量化呈现，且缺乏开源信息，影响可验证性。
