OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories
论文导读
通过高质量、高难度的合成轨迹数据,仅使用监督微调(SFT)训练出性能超越工业级 CPT+SFT+RL 流程的 30B 搜索代理 OpenSeeker-v2。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
OpenSeeker-v2:基于高难度轨迹的搜索代理性能突破
一句话定位
通过高质量、高难度的合成轨迹数据,仅使用监督微调(SFT)训练出性能超越工业级 CPT+SFT+RL 流程的 30B 搜索代理 OpenSeeker-v2。
小学生也能听懂
这篇论文像教机器人用“思考+行动”的方式上网找答案,他们不用复杂训练方法,只靠1万多条特别难的练习题目,就让一个300亿参数的大模型学会了更聪明地搜索,成绩超过了工业界的大模型。
为什么值得记录
- 挑战了工业界依赖多阶段训练(CPT+SFT+RL)的范式,证明高质量数据驱动的单一 SFT 可达成 SOTA 性能
- 首次由纯学术团队在 ReAct 范式下实现 30B 规模搜索代理的 SOTA 性能,推动研究民主化
- 开源模型权重与训练方法,为社区提供可复现、低成本的前沿搜索代理基线
- 在 BrowseComp、BrowseComp-ZH、HLE 和 xbench 四个基准上全面超越 Tongyi DeepResearch 等工业模型
核心方法
- 采用监督微调(SFT)范式,基于 Qwen3-30B-A3B-Thinking-2507 模型进行训练
- 数据合成阶段引入三项关键改进:扩大知识图谱扩展规模(K > k)以增强上下文丰富性与多跳推理需求
- 扩展工具集(tool set)以支持更广泛的功能调用,提升代理策略多样性
- 实施严格低步数过滤(T_min 阈值),剔除少于设定步数的简单轨迹,确保训练数据具备高难度下限
- 最终仅使用 10.6k 条高难度、多步推理轨迹进行 SFT 训练
- 模型支持 256k 上下文窗口,单轨迹最多允许 200 次工具调用
关键结果
- 在 BrowseComp 上达到 46.0% 准确率,超越 Tongyi DeepResearch(43.4%)
- 在 BrowseComp-ZH 上达到 58.1%,显著优于 Tongyi DeepResearch(46.7%)
- 在 Humanity’s Last Exam 上达到 34.6%,略优于 Tongyi DeepResearch(32.9%)
- 在 xbench 上达到 78.0%,优于 Tongyi DeepResearch(75.0%)
- 平均轨迹步数达 64.67,高于 OpenSeeker-v1(46.97)和 RedSearcher(36.01),体现更高数据难度
局限与风险
- 未使用强化学习(RL)或持续预训练(CPT),可能限制其在极端复杂任务上的泛化能力
- 数据合成依赖特定知识图谱结构,泛化至其他领域需重新构建图结构
- 仅基于 ReAct 范式,未探索其他 agent 架构(如 Reflexion、Self-Refine)
- 未报告训练计算成本与时间,难以评估实际资源需求
适合沉淀的概念
search-agent, react-paradigm, supervised-fine-tuning, high-difficulty-trajectories, knowledge-graph-expansion, tool-set-expansion, low-step-filtering, long-horizon-reasoning
阅读注意
- 重点关注数据合成策略如何提升轨迹难度与丰富性,而非模型架构创新
- 注意对比 OpenSeeker-v2 与 Tongyi DeepResearch 的训练流程差异及性能反超现象
- 观察平均工具调用步数与性能提升之间的相关性,理解长轨迹对推理能力的影响
- 留意开源策略对学术研究的意义,包括模型权重与代码的公开
质量说明
- 采用来源:
clean,papers/2026/05/2605.04036.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的方法描述、实验设置、量化结果与对比分析,数据可信,结论有支撑。