论文
arXiv2605.04036
时间2026-05
来源arXiv
页面质量中文卡片
阅读量级2 分钟

OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories

论文导读

通过高质量、高难度的合成轨迹数据,仅使用监督微调(SFT)训练出性能超越工业级 CPT+SFT+RL 流程的 30B 搜索代理 OpenSeeker-v2。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

OpenSeeker-v2:基于高难度轨迹的搜索代理性能突破

一句话定位

通过高质量、高难度的合成轨迹数据,仅使用监督微调(SFT)训练出性能超越工业级 CPT+SFT+RL 流程的 30B 搜索代理 OpenSeeker-v2。

小学生也能听懂

这篇论文像教机器人用“思考+行动”的方式上网找答案,他们不用复杂训练方法,只靠1万多条特别难的练习题目,就让一个300亿参数的大模型学会了更聪明地搜索,成绩超过了工业界的大模型。

为什么值得记录

  • 挑战了工业界依赖多阶段训练(CPT+SFT+RL)的范式,证明高质量数据驱动的单一 SFT 可达成 SOTA 性能
  • 首次由纯学术团队在 ReAct 范式下实现 30B 规模搜索代理的 SOTA 性能,推动研究民主化
  • 开源模型权重与训练方法,为社区提供可复现、低成本的前沿搜索代理基线
  • 在 BrowseComp、BrowseComp-ZH、HLE 和 xbench 四个基准上全面超越 Tongyi DeepResearch 等工业模型

核心方法

  • 采用监督微调(SFT)范式,基于 Qwen3-30B-A3B-Thinking-2507 模型进行训练
  • 数据合成阶段引入三项关键改进:扩大知识图谱扩展规模(K > k)以增强上下文丰富性与多跳推理需求
  • 扩展工具集(tool set)以支持更广泛的功能调用,提升代理策略多样性
  • 实施严格低步数过滤(T_min 阈值),剔除少于设定步数的简单轨迹,确保训练数据具备高难度下限
  • 最终仅使用 10.6k 条高难度、多步推理轨迹进行 SFT 训练
  • 模型支持 256k 上下文窗口,单轨迹最多允许 200 次工具调用

关键结果

  • 在 BrowseComp 上达到 46.0% 准确率,超越 Tongyi DeepResearch(43.4%)
  • 在 BrowseComp-ZH 上达到 58.1%,显著优于 Tongyi DeepResearch(46.7%)
  • 在 Humanity’s Last Exam 上达到 34.6%,略优于 Tongyi DeepResearch(32.9%)
  • 在 xbench 上达到 78.0%,优于 Tongyi DeepResearch(75.0%)
  • 平均轨迹步数达 64.67,高于 OpenSeeker-v1(46.97)和 RedSearcher(36.01),体现更高数据难度

局限与风险

  • 未使用强化学习(RL)或持续预训练(CPT),可能限制其在极端复杂任务上的泛化能力
  • 数据合成依赖特定知识图谱结构,泛化至其他领域需重新构建图结构
  • 仅基于 ReAct 范式,未探索其他 agent 架构(如 Reflexion、Self-Refine)
  • 未报告训练计算成本与时间,难以评估实际资源需求

适合沉淀的概念

search-agent, react-paradigm, supervised-fine-tuning, high-difficulty-trajectories, knowledge-graph-expansion, tool-set-expansion, low-step-filtering, long-horizon-reasoning

阅读注意

  • 重点关注数据合成策略如何提升轨迹难度与丰富性,而非模型架构创新
  • 注意对比 OpenSeeker-v2 与 Tongyi DeepResearch 的训练流程差异及性能反超现象
  • 观察平均工具调用步数与性能提升之间的相关性,理解长轨迹对推理能力的影响
  • 留意开源策略对学术研究的意义,包括模型权重与代码的公开

质量说明

  • 采用来源:cleanpapers/2026/05/2605.04036.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、实验设置、量化结果与对比分析,数据可信,结论有支撑。