论文
arXiv2602.04284
时间2026-02
来源Markdown
页面质量中文卡片
阅读量级105 分钟

2602.04284

论文导读

提出Agent-Omit框架,通过合成冷启动数据与省略感知强化学习,使LLM代理能自适应跳过冗余思维链和中间观察,显著降低token消耗同时保持任务准确率。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Agent-Omit:基于智能体强化学习的自适应思维与观察省略高效LLM代理

一句话定位

提出Agent-Omit框架,通过合成冷启动数据与省略感知强化学习,使LLM代理能自适应跳过冗余思维链和中间观察,显著降低token消耗同时保持任务准确率。

小学生也能听懂

这篇论文教AI像聪明学生一样,学会跳过重复的思考和观察步骤,用更少“力气”(token)完成任务,还能保持准确,就像做题时不再反复读题,直接写出答案。

为什么值得记录

  • 首次量化分析多轮交互中思维与观察的必要性差异,揭示中间轮次存在大量可省略内容
  • 提出统一框架同时管理思维与观察,优于现有单一维度压缩方法
  • 在5个基准测试中,Agent-Omit-8B达到与前沿模型相当的准确率,但token成本降低30%-60%
  • 理论证明省略策略偏差受KL散度上界约束,保障训练稳定性

核心方法

  • 冷启动数据合成:通过蒙特卡洛推演识别可省略轮次,构建单轮与多轮省略样本
  • 分层行为教学:使用系统提示引导模型学习空思维与观察省略指令
  • 双采样强化学习:完整轨迹评估整体性能,部分轨迹保留省略前上下文以学习决策依据
  • 多目标奖励设计:任务奖励保障准确性,省略奖励按节省token比例计算,失败时置零防作弊
  • GRPO优化策略:结合KL散度约束防止策略偏移,μ=0.2平衡效率与效果

关键结果

  • Agent-Omit-8B-RL在WebShop/TextCraft/BabyAI/SciWorld上Pass@1均达最高,DeepSearch仅次于o3
  • 相比Qwen3-8B基线,平均token消耗从17K降至9.6K,降幅43%
  • 在Qwen3-8B上全面超越7种高效代理方法,包括DEPO、ToolLight、ReSum等
  • 自适应省略3-4轮中间步骤,主要发生在第2/4/6轮,验证前期规划充分性假设

局限与风险

  • 依赖环境反馈质量,在低质量观察场景可能误删关键信息
  • 冷启动数据需人工设计系统提示,泛化至新任务需重新标注
  • RL阶段仅训练1个epoch,复杂任务可能欠优化
  • 未测试超大规模模型(>70B)上的扩展性

适合沉淀的概念

agentic-reinforcement-learning, thought-observation-omission, context-compression, dual-sampling-mechanism, omit-aware-reward, monte-carlo-rollout-analysis, kl-divergence-bound, hierarchical-behavior-synthesis

阅读注意

  • 重点关注图2与图3的定量分析,理解为何中间轮次更适合省略
  • 注意双采样机制如何解决'上下文变更'问题——这是传统RL无法训练省略策略的关键
  • 表3对比显示启发式方法(如Observation-Mask)虽省token但准确率下降明显
  • 附录B.1中的系统提示模板是复现核心,包含语法规范
  • 定理5.2的理论保证表明性能损失可控,增强方法可信度

质量说明

  • 采用来源:rawraw/papers/2026/02/2602.04284.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供完整方法描述、理论证明、多基准实验及消融分析,代码已开源,材料充分可信。