---
title: ""
title_zh: "LongSeeker：面向长时程搜索代理的弹性上下文编排"
arxiv_id: "2605.05191"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/05/2605.05191.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# LongSeeker：面向长时程搜索代理的弹性上下文编排

## 一句话定位

提出 Context-ReAct 范式，通过五种原子元操作（Skip、Compress、Rollback、Snippet、Delete）实现代理对自身上下文的动态弹性管理，解决长时程推理中上下文膨胀与噪声累积问题。

## 小学生也能听懂

就像一个聪明的助手在查资料时，不会把每一步都记下来，而是会主动整理笔记：把已经解决的问题压缩成一句话，删掉没用的尝试，保留关键数字或名字，甚至回退到之前某一步重新开始。这样它就能一直高效工作，不会因为记太多而混乱。

## 为什么值得记录

- 解决了传统 ReAct 代理在长时程任务中上下文无限增长、信号稀释和超出模型上下文窗口的问题
- 首次提出形式上完备的上下文操作集，支持细粒度、按需、内容感知的上下文重构
- 在 BrowseComp 和 BrowseComp-ZH 基准上显著优于 Tongyi DeepResearch 和 AgentFold 等强基线，证明弹性上下文管理的有效性
- 为长时程代理提供了一种可扩展的核心架构范式，适用于科研、法律、软件开发等复杂场景

## 核心方法

- 提出 Context-ReAct 范式：在标准 ReAct 循环中插入元操作层，使代理在每个推理步骤共同生成推理链、上下文元操作和工具调用
- 定义五种原子元操作：Skip（保持不变）、Compress（抽象摘要任意连续步骤）、Rollback（回退到早期状态并记录原因）、Snippet（无损提取关键子串如数字/实体）、Delete（完全移除无用步骤）
- 证明 Compress 操作在理论上是表达完备的，其他操作提供效率和保真度保证，降低生成成本和幻觉风险
- 基于 Qwen3-30B-A3B 微调 LongSeeker，使用 10k 条合成的 Context-ReAct 轨迹进行监督微调，教师模型为 DeepSeek V3.2
- 训练时损失函数覆盖完整结构化输出（推理、元操作、动机、工具调用），强制模型联合学习何时、何地、如何干预上下文

## 关键结果

- LongSeeker 在 BrowseComp 上达到 61.5%，在 BrowseComp-ZH 上达到 62.5%，显著优于 Tongyi DeepResearch（43.2%/46.7%）和 AgentFold（36.2%/47.3%）
- 在 xbench-2505 和 GAIA-text 上分别取得 78.0 和 77.7 分，表明弹性上下文管理泛化至广义代理能力
- 上下文 token 数增长显著放缓：在 BrowseComp 上，LongSeeker 平均上下文长度仅为被动累积方法的 1/3，且未出现上下文溢出
- 案例分析显示代理能正确使用 Rollback 放弃无效路径，用 Snippet 保留精确证据，用 Compress 整合已解决子问题

## 局限与风险

- 依赖高质量合成轨迹进行训练，真实场景中的分布偏移可能影响元操作决策质量
- Snippet 操作需指定锚点字符串，对模糊或结构不清的观测可能难以准确提取
- 当前实现未结合强化学习，元操作策略完全基于模仿学习，可能限制探索更优上下文管理策略
- Rollback 操作假设存在明确“失败点”，但在开放式探索任务中判断何时回退仍具挑战性

## 适合沉淀的概念

`context-react`, `elastic-context-orchestration`, `long-horizon-search-agents`, `meta-operations`, `context-management`, `react-paradigm`, `multi-resolution-context`, `expressively-complete-operations`

## 阅读注意

- 重点关注图 2 和图 3，理解 Context-ReAct 如何与标准 ReAct 区分，以及元操作如何实时重塑上下文
- 注意定理 3.1 的证明逻辑：Compress 的完备性意味着理论上单一操作即可实现任意变换，但专用操作提升效率与可靠性
- 数据合成部分强调教师模型直接生成完整四字段输出（<think>, <meta_tool_call>, <motivation>, <standard_tool_call>），这是训练成功的关键
- 实验中 BrowseComp 和 BrowseComp-ZH 的评分差异反映中英文搜索任务的不同难度，LongSeeker 在两者上表现均衡
- 附录中的案例研究（图 6 和图 7）是理解实际运行效果的最佳入口，建议结合阅读

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/05/2605.05191.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法、实验、图表和附录案例，数据充分，结论有支撑。
