---
title: "2604.02869"
title_zh: "多轮强化学习在工具调用代理中的迭代奖励校准"
arxiv_id: "2604.02869"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.02869.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 多轮强化学习在工具调用代理中的迭代奖励校准

## 一句话定位

提出结合 MT-GRPO 与 GTPO 的多轮强化学习方法，并引入迭代奖励校准（IRC）解决密集奖励导致的梯度错位问题，显著提升工具调用代理在真实客服任务上的性能。

## 小学生也能听懂

这篇论文教AI客服像学数学一样一步步改进：先用新方法（MT-GRPO+GTPO）让AI学会查航班，再用“奖励校准”像调音量一样调整打分，避免AI被错误奖励误导，最后小模型表现超过大模型，还能更快更准地帮人订机票。

## 为什么值得记录

- 首次在真实多轮工具调用任务（Tau-Bench 航空客服）上应用 MT-GRPO + GTPO，填补了该技术在代理任务中的空白
- 发现密集奖励若未经校准会严重损害性能（最多下降14个百分点），揭示了奖励判别力与优势方向对齐的重要性
- 提出的 IRC 方法通过经验判别分析系统性地设计每轮奖励，避免直觉偏差，提升训练稳定性
- 训练后的 4B 模型超越 GPT-4.1 和 GPT-4o，30.5B MoE 模型接近 Claude Sonnet 4.5，展示小模型通过 RL 达到前沿性能
- 开源代码与训练配方，为社区提供可复现的 RL 训练基准

## 核心方法

- 采用 MT-GRPO（多轮组相对策略优化）进行每轮优势归一化，结合 GTPO 的折扣回报与衰减结局优势，形成混合优势公式：A_hybrid = GN(∑γ^(l−k)r_l + γ^(K−k)o) + λ·A^O
- 引入迭代奖励校准（IRC）流程：收集 rollout 数据 → 计算各奖励层级与任务成功的点二列相关系数 → 根据判别力调整奖励值 → 验证优势方向一致性，循环至收敛
- 设计深度参数比较函数 _deep_equal，规范化 JSON 参数（排序、类型转换、去空值），减少 23.5% 的误匹配
- 使用 Qwen3.5-4B 和 Qwen3-30B-A3B MoE 模型，在 Tau-Bench v1 上进行 RL 训练，以 DeepSeek-V3 作为用户模拟器
- 评估在独立的 Tau2-Bench v2 上进行，确保泛化性；使用 GPT-4.1 作为评估用户模拟器，贪心解码
- 关键超参：γ=0.9（折扣因子），λ=0.3（结局优势衰减系数），每组 4 个 rollout，Adam 优化器，低方差 KL 惩罚

## 关键结果

- Qwen3.5-4B 模型从基线 63.8% 提升至 66.7%（+2.9pp），超过 GPT-4.1（49.4%）和 GPT-4o（42.8%）
- Qwen3-30B-A3B MoE 模型从 58.0% 提升至 69.5%（+11.5pp），接近 Claude Sonnet 4.5（70.0%）
- MT-GRPO 单独使用带来 +0.8pp（4B）和 +10.0pp（MoE）提升，IRC 进一步贡献 +2.1pp 和 +1.5pp
- 未校准的密集奖励（V5）导致性能下降 6.5pp（4B）和 4.0pp（MoE），证明校准必要性
- 混合优势公式实现零优势错位（vs. 标准 MT-GRPO 的 2 个），并将“死轮”（零梯度）比例从 11% 降至 1.4%
- 在任务 9 上，训练后模型将对话轮数减少 50%（56→28），耗时降低 65%（27→9.5分钟），动作准确率达 100%

## 局限与风险

- 实验仅限于 Tau-Bench 的航空领域（50 个任务），跨域泛化能力有待验证（电信域仅 32.0%）
- 训练与评估使用不同用户模拟器（DeepSeek-V3 vs GPT-4.1），存在分布偏移风险
- GTPO 混合超参数（γ=0.9, λ=0.3）仅在一个领域调优，未进行广泛搜索
- IRC 目前为离线迭代流程，未来需实现在线自适应版本（如 EDG）
- 未报告完整训练曲线与每任务详细 breakdown，部分结果依赖附录补充

## 适合沉淀的概念

`multi-turn-reinforcement-learning`, `tool-calling-agents`, `iterative-reward-calibration`, `advantage-misalignment`, `group-relative-policy-optimization`, `generalized-token-level-policy-optimization`, `reward-discriminativeness`, `dead-turn-gradient-focusing`, `deep-argument-comparison`, `tau-bench`

## 阅读注意

- 重点关注图 1 和表 1，理解优势错位（advantage misalignment）的成因与解决方案
- 注意 IRC 算法（Algorithm 1）中点二列相关系数（PointBiserial）的使用，这是判别力量化的核心
- 比较表 6 和表 7 中 V5（密集奖励）与 V6（IRC 校准）的性能差异，体会校准的重要性
- 分析表 3 中稀疏奖励如何“自然聚焦”梯度于关键轮次，解释其“意外成功”
- 查看附录 A 的奖励层级定义，理解 read-only、state-change 等分类标准

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.02869.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、消融实验、定量结果与定性分析，数据充分。虽部分细节（如完整训练曲线）留待附录，但核心结论有强支撑。
