---
title: ""
title_zh: "AgenticQwen：基于双数据飞轮的小规模智能体语言模型训练"
arxiv_id: "2604.21590"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.21590.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# AgenticQwen：基于双数据飞轮的小规模智能体语言模型训练

## 一句话定位

提出 AgenticQwen 模型族，通过推理与智能体双数据飞轮机制，在小规模模型上实现工业级工具使用能力。

## 小学生也能听懂

这篇论文像教小机器人学本领：先用大模型出题，让小模型不断做题、犯错、再挑战更难的题，同时模拟真实用户捣乱，让小模型学会灵活应对，最终小模型也能像大模型一样聪明地用工具解决问题，还更快更省钱。

## 为什么值得记录

- 填补了小规模开源模型在智能体任务中性能不足的空白，降低工业部署成本
- 提出双数据飞轮框架，解决合成数据同质化导致的训练饱和问题
- 在真实工业系统中验证了小模型可逼近大模型性能，具备高性价比推理优势

## 核心方法

- 采用 GRPO 风格的多轮强化学习（RL），结合推理 RL 与智能体 RL 双路径训练
- 构建推理数据飞轮：基于模型错误生成更难的数学/搜索任务，通过自指令扩展、角色注入和多模型一致性过滤提升多样性
- 构建智能体数据飞轮：将线性工作流逐步扩展为多分支行为树，引入对抗性模拟用户干扰决策
- 使用 Qwen3-235B 作为合成数据生成器、环境模拟器和奖励评估器，实现闭环训练
- 通过分支到任务反转（branch-to-task inversion）将行为树路径转化为可训练样本
- 每轮训练后基于新策略行为动态扩展任务空间，形成迭代式课程学习

## 关键结果

- AgenticQwen-8B 在 TAU-2 和 BFCL-V4 基准上平均得分 47.4，较 Qwen3-8B 提升超 100%
- AgenticQwen-30B-A3B 达到 50.2 平均分，接近 Qwen3-235B 性能（52.0）
- 在工业数据分析和搜索任务中，AgenticQwen-30B-A3B 比 Qwen3-30B 提升 17.0 分（XBench）
- 端到端推理时间比 Qwen3-235B 减少 23.4%（344.1s vs 449.5s）
- 三轮飞轮迭代后性能趋于收敛，表明机制有效但存在边际效益递减

## 局限与风险

- 小模型在超长上下文任务（如深度搜索）中仍受限于 40k 上下文窗口
- 依赖 Qwen 系列模型进行数据合成与评估，可能存在模型族偏差
- 未覆盖高度开放域或创造性智能体行为，聚焦于结构化工具调用场景

## 适合沉淀的概念

`agentic-reinforcement-learning`, `data-flywheel`, `behavior-tree-expansion`, `branch-to-task-inversion`, `synthetic-data-diversity`, `small-language-models`, `tool-use-benchmarks`, `industrial-agent-systems`

## 阅读注意

- 关注双飞轮如何协同工作：推理飞轮提升单步正确性，智能体飞轮增强多步决策鲁棒性
- 注意 Phase 3 的 branch-to-task inversion 是连接行为树与训练样本的关键技术
- 附录 B 提供了完整训练样本构造示例，有助于理解对抗性用户干预机制
- 实验部分强调‘有限搜索数据下泛化能力’，说明智能体能力具有跨任务迁移性
- 部署部分提到自动路由机制，体现工业落地中对成本-性能权衡的实际考量

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.21590.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置、开源链接和部署细节，数据与结论一致，具备可复现性基础。
