---
title: "2509.06980"
title_zh: "RLFactory：面向LLM多轮工具使用的即插即用强化学习后训练框架"
arxiv_id: "2509.06980"
paper_type: "system"
source_kind: "raw"
raw_path: "raw/papers/2025/09/2509.06980.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# RLFactory：面向LLM多轮工具使用的即插即用强化学习后训练框架

## 一句话定位

提出RLFactory，一个支持异步工具调用、解耦架构与多样化奖励计算的即插即用强化学习后训练框架，用于提升大语言模型在多轮工具使用任务中的性能与训练效率。

## 小学生也能听懂

这篇论文发明了一个叫RLFactory的“智能助手训练工厂”，它让AI像搭积木一样轻松使用各种工具（比如搜索网页或查资料），通过不断试错和奖励机制，让AI在多轮任务中越用越聪明，而且训练速度比原来快6.8倍。

## 为什么值得记录

- 解决了多轮工具调用中工具异构性、接口不稳定和奖励计算多样化的核心挑战
- 通过引入观察标记重构MDP状态空间，实现模型-工具-环境的闭环交互
- 在Search-R1实验中，基于Qwen3-4B的模型以6.8倍训练吞吐量超越更大参数模型表现
- 提供低门槛、高可扩展的训练框架，适用于深度搜索、旅行规划等实际场景

## 核心方法

- 采用三层模块化架构（基础层、组件层、应用层），实现工具调用与训练系统的完全解耦
- 基于asyncio设计异步并行工具调用机制，提升多工具并发执行效率
- 引入Observation Tokens重构MDP状态空间，将工具反馈动态融入决策上下文
- 实现“生成-解析-调用-更新”闭环工作流，支持多轮动态策略优化
- 支持三类工具抽象：程序工具（如搜索引擎）、模型工具（如GPT-4o）、代理工具（如文献研究代理）
- 提供三种奖励计算机制：规则驱动、模型评判、工具验证，可独立或组合使用
- 基于veRL框架集成GRPO等算法，支持分布式奖励推理与高效梯度优化

## 关键结果

- 在NQ数据集上，RLFactory训练的Qwen3-4B模型测试得分为0.486，优于Qwen2.5-7B-Instruct-GRPO的0.473
- 训练吞吐量提升6.8倍，收敛时间从36小时缩短至5小时（A100*8）
- 训练过程Critic分数稳定上升，95%置信区间波动小，体现高稳定性
- 支持即插即用工具注册（MCP格式），无需修改核心代码即可集成新工具

## 局限与风险

- 当前实验主要基于Search-R1任务，泛化至其他复杂任务（如多模态规划）需进一步验证
- 模型评判奖励依赖外部强模型（如QwQ-32B），可能引入额外部署成本与延迟
- 工具验证机制要求具备可执行验证器，不适用于主观性强的开放任务
- 未详细说明Loss Mask的具体实现细节，可能影响复现

## 适合沉淀的概念

`multi-turn-tool-use`, `reinforcement-learning-post-training`, `observation-tokens`, `mdp-state-reconstruction`, `asynchronous-tool-invocation`, `decoupled-architecture`, `diverse-reward-computation`, `mcp-tool-registration`, `generate-parse-invoke-update`, `llm-agent-tool-collaboration`

## 阅读注意

- 重点关注Observation Tokens如何重构MDP状态空间及其与模型内生状态的区分
- 注意三种奖励机制（规则、模型评判、工具验证）的适用场景与组合方式
- 理解三层架构设计中各层的职责划分，特别是组件层的可定制性
- 分析异步工具调用如何避免单点阻塞并提升整体训练效率
- 结合Search-R1实验结果，评估框架在资源受限条件下的性价比优势

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/09/2509.06980.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法设计、实验设置与结果数据，包含架构图、算法流程与定量对比，技术细节充分，具备可复现性基础。
