---
title: "2602.04284"
title_zh: "Agent-Omit：基于智能体强化学习的自适应思维与观察省略高效LLM代理"
arxiv_id: "2602.04284"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/02/2602.04284.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Agent-Omit：基于智能体强化学习的自适应思维与观察省略高效LLM代理

## 一句话定位

提出Agent-Omit框架，通过合成冷启动数据与省略感知强化学习，使LLM代理能自适应跳过冗余思维链和中间观察，显著降低token消耗同时保持任务准确率。

## 小学生也能听懂

这篇论文教AI像聪明学生一样，学会跳过重复的思考和观察步骤，用更少“力气”（token）完成任务，还能保持准确，就像做题时不再反复读题，直接写出答案。

## 为什么值得记录

- 首次量化分析多轮交互中思维与观察的必要性差异，揭示中间轮次存在大量可省略内容
- 提出统一框架同时管理思维与观察，优于现有单一维度压缩方法
- 在5个基准测试中，Agent-Omit-8B达到与前沿模型相当的准确率，但token成本降低30%-60%
- 理论证明省略策略偏差受KL散度上界约束，保障训练稳定性

## 核心方法

- 冷启动数据合成：通过蒙特卡洛推演识别可省略轮次，构建单轮与多轮省略样本
- 分层行为教学：使用系统提示引导模型学习<think></think>空思维与<omit_tool_response_N_...>观察省略指令
- 双采样强化学习：完整轨迹评估整体性能，部分轨迹保留省略前上下文以学习决策依据
- 多目标奖励设计：任务奖励保障准确性，省略奖励按节省token比例计算，失败时置零防作弊
- GRPO优化策略：结合KL散度约束防止策略偏移，μ=0.2平衡效率与效果

## 关键结果

- Agent-Omit-8B-RL在WebShop/TextCraft/BabyAI/SciWorld上Pass@1均达最高，DeepSearch仅次于o3
- 相比Qwen3-8B基线，平均token消耗从17K降至9.6K，降幅43%
- 在Qwen3-8B上全面超越7种高效代理方法，包括DEPO、ToolLight、ReSum等
- 自适应省略3-4轮中间步骤，主要发生在第2/4/6轮，验证前期规划充分性假设

## 局限与风险

- 依赖环境反馈质量，在低质量观察场景可能误删关键信息
- 冷启动数据需人工设计系统提示，泛化至新任务需重新标注
- RL阶段仅训练1个epoch，复杂任务可能欠优化
- 未测试超大规模模型（>70B）上的扩展性

## 适合沉淀的概念

`agentic-reinforcement-learning`, `thought-observation-omission`, `context-compression`, `dual-sampling-mechanism`, `omit-aware-reward`, `monte-carlo-rollout-analysis`, `kl-divergence-bound`, `hierarchical-behavior-synthesis`

## 阅读注意

- 重点关注图2与图3的定量分析，理解为何中间轮次更适合省略
- 注意双采样机制如何解决'上下文变更'问题——这是传统RL无法训练省略策略的关键
- 表3对比显示启发式方法（如Observation-Mask）虽省token但准确率下降明显
- 附录B.1中的系统提示模板是复现核心，包含<think></think>与<omit_tool_response_N_...>语法规范
- 定理5.2的理论保证表明性能损失可控，增强方法可信度

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/02/2602.04284.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供完整方法描述、理论证明、多基准实验及消融分析，代码已开源，材料充分可信。
