---
title: "OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories"
title_zh: "OpenSeeker-v2：基于高难度轨迹的搜索代理性能突破"
arxiv_id: "2605.04036"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2026/05/2605.04036.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# OpenSeeker-v2：基于高难度轨迹的搜索代理性能突破

## 一句话定位

通过高质量、高难度的合成轨迹数据，仅使用监督微调（SFT）训练出性能超越工业级 CPT+SFT+RL 流程的 30B 搜索代理 OpenSeeker-v2。

## 小学生也能听懂

这篇论文像教机器人用“思考+行动”的方式上网找答案，他们不用复杂训练方法，只靠1万多条特别难的练习题目，就让一个300亿参数的大模型学会了更聪明地搜索，成绩超过了工业界的大模型。

## 为什么值得记录

- 挑战了工业界依赖多阶段训练（CPT+SFT+RL）的范式，证明高质量数据驱动的单一 SFT 可达成 SOTA 性能
- 首次由纯学术团队在 ReAct 范式下实现 30B 规模搜索代理的 SOTA 性能，推动研究民主化
- 开源模型权重与训练方法，为社区提供可复现、低成本的前沿搜索代理基线
- 在 BrowseComp、BrowseComp-ZH、HLE 和 xbench 四个基准上全面超越 Tongyi DeepResearch 等工业模型

## 核心方法

- 采用监督微调（SFT）范式，基于 Qwen3-30B-A3B-Thinking-2507 模型进行训练
- 数据合成阶段引入三项关键改进：扩大知识图谱扩展规模（K > k）以增强上下文丰富性与多跳推理需求
- 扩展工具集（tool set）以支持更广泛的功能调用，提升代理策略多样性
- 实施严格低步数过滤（T_min 阈值），剔除少于设定步数的简单轨迹，确保训练数据具备高难度下限
- 最终仅使用 10.6k 条高难度、多步推理轨迹进行 SFT 训练
- 模型支持 256k 上下文窗口，单轨迹最多允许 200 次工具调用

## 关键结果

- 在 BrowseComp 上达到 46.0% 准确率，超越 Tongyi DeepResearch（43.4%）
- 在 BrowseComp-ZH 上达到 58.1%，显著优于 Tongyi DeepResearch（46.7%）
- 在 Humanity’s Last Exam 上达到 34.6%，略优于 Tongyi DeepResearch（32.9%）
- 在 xbench 上达到 78.0%，优于 Tongyi DeepResearch（75.0%）
- 平均轨迹步数达 64.67，高于 OpenSeeker-v1（46.97）和 RedSearcher（36.01），体现更高数据难度

## 局限与风险

- 未使用强化学习（RL）或持续预训练（CPT），可能限制其在极端复杂任务上的泛化能力
- 数据合成依赖特定知识图谱结构，泛化至其他领域需重新构建图结构
- 仅基于 ReAct 范式，未探索其他 agent 架构（如 Reflexion、Self-Refine）
- 未报告训练计算成本与时间，难以评估实际资源需求

## 适合沉淀的概念

`search-agent`, `react-paradigm`, `supervised-fine-tuning`, `high-difficulty-trajectories`, `knowledge-graph-expansion`, `tool-set-expansion`, `low-step-filtering`, `long-horizon-reasoning`

## 阅读注意

- 重点关注数据合成策略如何提升轨迹难度与丰富性，而非模型架构创新
- 注意对比 OpenSeeker-v2 与 Tongyi DeepResearch 的训练流程差异及性能反超现象
- 观察平均工具调用步数与性能提升之间的相关性，理解长轨迹对推理能力的影响
- 留意开源策略对学术研究的意义，包括模型权重与代码的公开

## 质量说明

- 采用来源：`clean`，`papers/2026/05/2605.04036.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置、量化结果与对比分析，数据可信，结论有支撑。
