论文
arXiv2605.05191
时间2026-05
来源Markdown
页面质量中文卡片
阅读量级77 分钟

论文导读

提出 Context-ReAct 范式,通过五种原子元操作(Skip、Compress、Rollback、Snippet、Delete)实现代理对自身上下文的动态弹性管理,解决长时程推理中上下文膨胀与噪声累积问题。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

LongSeeker:面向长时程搜索代理的弹性上下文编排

一句话定位

提出 Context-ReAct 范式,通过五种原子元操作(Skip、Compress、Rollback、Snippet、Delete)实现代理对自身上下文的动态弹性管理,解决长时程推理中上下文膨胀与噪声累积问题。

小学生也能听懂

就像一个聪明的助手在查资料时,不会把每一步都记下来,而是会主动整理笔记:把已经解决的问题压缩成一句话,删掉没用的尝试,保留关键数字或名字,甚至回退到之前某一步重新开始。这样它就能一直高效工作,不会因为记太多而混乱。

为什么值得记录

  • 解决了传统 ReAct 代理在长时程任务中上下文无限增长、信号稀释和超出模型上下文窗口的问题
  • 首次提出形式上完备的上下文操作集,支持细粒度、按需、内容感知的上下文重构
  • 在 BrowseComp 和 BrowseComp-ZH 基准上显著优于 Tongyi DeepResearch 和 AgentFold 等强基线,证明弹性上下文管理的有效性
  • 为长时程代理提供了一种可扩展的核心架构范式,适用于科研、法律、软件开发等复杂场景

核心方法

  • 提出 Context-ReAct 范式:在标准 ReAct 循环中插入元操作层,使代理在每个推理步骤共同生成推理链、上下文元操作和工具调用
  • 定义五种原子元操作:Skip(保持不变)、Compress(抽象摘要任意连续步骤)、Rollback(回退到早期状态并记录原因)、Snippet(无损提取关键子串如数字/实体)、Delete(完全移除无用步骤)
  • 证明 Compress 操作在理论上是表达完备的,其他操作提供效率和保真度保证,降低生成成本和幻觉风险
  • 基于 Qwen3-30B-A3B 微调 LongSeeker,使用 10k 条合成的 Context-ReAct 轨迹进行监督微调,教师模型为 DeepSeek V3.2
  • 训练时损失函数覆盖完整结构化输出(推理、元操作、动机、工具调用),强制模型联合学习何时、何地、如何干预上下文

关键结果

  • LongSeeker 在 BrowseComp 上达到 61.5%,在 BrowseComp-ZH 上达到 62.5%,显著优于 Tongyi DeepResearch(43.2%/46.7%)和 AgentFold(36.2%/47.3%)
  • 在 xbench-2505 和 GAIA-text 上分别取得 78.0 和 77.7 分,表明弹性上下文管理泛化至广义代理能力
  • 上下文 token 数增长显著放缓:在 BrowseComp 上,LongSeeker 平均上下文长度仅为被动累积方法的 1/3,且未出现上下文溢出
  • 案例分析显示代理能正确使用 Rollback 放弃无效路径,用 Snippet 保留精确证据,用 Compress 整合已解决子问题

局限与风险

  • 依赖高质量合成轨迹进行训练,真实场景中的分布偏移可能影响元操作决策质量
  • Snippet 操作需指定锚点字符串,对模糊或结构不清的观测可能难以准确提取
  • 当前实现未结合强化学习,元操作策略完全基于模仿学习,可能限制探索更优上下文管理策略
  • Rollback 操作假设存在明确“失败点”,但在开放式探索任务中判断何时回退仍具挑战性

适合沉淀的概念

context-react, elastic-context-orchestration, long-horizon-search-agents, meta-operations, context-management, react-paradigm, multi-resolution-context, expressively-complete-operations

阅读注意

  • 重点关注图 2 和图 3,理解 Context-ReAct 如何与标准 ReAct 区分,以及元操作如何实时重塑上下文
  • 注意定理 3.1 的证明逻辑:Compress 的完备性意味着理论上单一操作即可实现任意变换,但专用操作提升效率与可靠性
  • 数据合成部分强调教师模型直接生成完整四字段输出(, , , ),这是训练成功的关键
  • 实验中 BrowseComp 和 BrowseComp-ZH 的评分差异反映中英文搜索任务的不同难度,LongSeeker 在两者上表现均衡
  • 附录中的案例研究(图 6 和图 7)是理解实际运行效果的最佳入口,建议结合阅读

质量说明

  • 采用来源:rawraw/papers/2026/05/2605.05191.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法、实验、图表和附录案例,数据充分,结论有支撑。