论文导读
提出 Context-ReAct 范式,通过五种原子元操作(Skip、Compress、Rollback、Snippet、Delete)实现代理对自身上下文的动态弹性管理,解决长时程推理中上下文膨胀与噪声累积问题。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
LongSeeker:面向长时程搜索代理的弹性上下文编排
一句话定位
提出 Context-ReAct 范式,通过五种原子元操作(Skip、Compress、Rollback、Snippet、Delete)实现代理对自身上下文的动态弹性管理,解决长时程推理中上下文膨胀与噪声累积问题。
小学生也能听懂
就像一个聪明的助手在查资料时,不会把每一步都记下来,而是会主动整理笔记:把已经解决的问题压缩成一句话,删掉没用的尝试,保留关键数字或名字,甚至回退到之前某一步重新开始。这样它就能一直高效工作,不会因为记太多而混乱。
为什么值得记录
- 解决了传统 ReAct 代理在长时程任务中上下文无限增长、信号稀释和超出模型上下文窗口的问题
- 首次提出形式上完备的上下文操作集,支持细粒度、按需、内容感知的上下文重构
- 在 BrowseComp 和 BrowseComp-ZH 基准上显著优于 Tongyi DeepResearch 和 AgentFold 等强基线,证明弹性上下文管理的有效性
- 为长时程代理提供了一种可扩展的核心架构范式,适用于科研、法律、软件开发等复杂场景
核心方法
- 提出 Context-ReAct 范式:在标准 ReAct 循环中插入元操作层,使代理在每个推理步骤共同生成推理链、上下文元操作和工具调用
- 定义五种原子元操作:Skip(保持不变)、Compress(抽象摘要任意连续步骤)、Rollback(回退到早期状态并记录原因)、Snippet(无损提取关键子串如数字/实体)、Delete(完全移除无用步骤)
- 证明 Compress 操作在理论上是表达完备的,其他操作提供效率和保真度保证,降低生成成本和幻觉风险
- 基于 Qwen3-30B-A3B 微调 LongSeeker,使用 10k 条合成的 Context-ReAct 轨迹进行监督微调,教师模型为 DeepSeek V3.2
- 训练时损失函数覆盖完整结构化输出(推理、元操作、动机、工具调用),强制模型联合学习何时、何地、如何干预上下文
关键结果
- LongSeeker 在 BrowseComp 上达到 61.5%,在 BrowseComp-ZH 上达到 62.5%,显著优于 Tongyi DeepResearch(43.2%/46.7%)和 AgentFold(36.2%/47.3%)
- 在 xbench-2505 和 GAIA-text 上分别取得 78.0 和 77.7 分,表明弹性上下文管理泛化至广义代理能力
- 上下文 token 数增长显著放缓:在 BrowseComp 上,LongSeeker 平均上下文长度仅为被动累积方法的 1/3,且未出现上下文溢出
- 案例分析显示代理能正确使用 Rollback 放弃无效路径,用 Snippet 保留精确证据,用 Compress 整合已解决子问题
局限与风险
- 依赖高质量合成轨迹进行训练,真实场景中的分布偏移可能影响元操作决策质量
- Snippet 操作需指定锚点字符串,对模糊或结构不清的观测可能难以准确提取
- 当前实现未结合强化学习,元操作策略完全基于模仿学习,可能限制探索更优上下文管理策略
- Rollback 操作假设存在明确“失败点”,但在开放式探索任务中判断何时回退仍具挑战性
适合沉淀的概念
context-react, elastic-context-orchestration, long-horizon-search-agents, meta-operations, context-management, react-paradigm, multi-resolution-context, expressively-complete-operations
阅读注意
- 重点关注图 2 和图 3,理解 Context-ReAct 如何与标准 ReAct 区分,以及元操作如何实时重塑上下文
- 注意定理 3.1 的证明逻辑:Compress 的完备性意味着理论上单一操作即可实现任意变换,但专用操作提升效率与可靠性
- 数据合成部分强调教师模型直接生成完整四字段输出(
, , , ),这是训练成功的关键 - 实验中 BrowseComp 和 BrowseComp-ZH 的评分差异反映中英文搜索任务的不同难度,LongSeeker 在两者上表现均衡
- 附录中的案例研究(图 6 和图 7)是理解实际运行效果的最佳入口,建议结合阅读
质量说明
- 采用来源:
raw,raw/papers/2026/05/2605.05191.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法、实验、图表和附录案例,数据充分,结论有支撑。