---
title: "SWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning Context"
title_zh: "SWE-AGILE：高效管理动态推理上下文的软件代理框架"
arxiv_id: "2604.11716"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.11716.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# SWE-AGILE：高效管理动态推理上下文的软件代理框架

## 一句话定位

提出 SWE-AGILE 框架，通过动态推理上下文、轨迹快照训练和压缩感知优化，在有限上下文窗口内实现深度 System-2 推理，显著提升 7B-8B 模型在 SWE-Bench-Verified 上的性能。

## 小学生也能听懂

这篇论文像给AI装了个“聪明笔记本”，把复杂的思考过程分成“最近想法”和“总结笔记”，只记重点，让AI在有限空间里也能深入思考，解决编程难题，小模型表现得像大模型一样棒。

## 为什么值得记录

- 解决了多轮 SWE 任务中完整推理历史导致的上下文爆炸与‘中间丢失’问题
- 提出推理摘要（Reasoning Digest）机制，在保留认知连续性的同时降低长期记忆开销
- 在仅使用 2.2k 轨迹的情况下，使 Qwen3-8B 模型在 SWE-Bench-Verified 上达到 24.1% 成功率，超越所有同规模基线
- 为中小参数模型激发 System-2 推理能力提供了可行范式

## 核心方法

- Dynamic Reasoning Context：采用滑动推理窗口（Last-N-Steps）保留近期详细推理（r_t），历史推理压缩为摘要（d_t）存入长期上下文
- Trajectory Snapshot Training：将完整轨迹拆解为多个快照，每个快照仅优化当前步的输出（r_t → d_t → a_t），并掩码历史详细推理以对齐推理时的可见性约束
- Backfilling Data Synthesis：利用强推理模型（Qwen3-235B）对成功轨迹进行后见之明增强，生成格式合规的详细推理与摘要数据
- RLVR with Compression Reward：引入轨迹级压缩率奖励 R_comp = 1 - L_hybrid / L_full，激励模型在成功前提下最大化上下文压缩效率
- 使用 DAPO 算法进行强化学习优化，设置压缩奖励权重 β=0.2，阈值 γ=0.55 防止奖励黑客行为

## 关键结果

- SWE-AGILE (SFT) 在 Qwen3-8B 上达到 21.45% 成功率，相对基线提升 35.5%
- 加入 RLVR 后进一步提升至 24.05%，超越所有 7B/8B 开源模型
- 在 Qwen3-14B 上仅用 SFT 即达到 30.06% 成功率，优于现有 14B 基线
- 平均单步推理长度从 Current-Step 的 ~1075 词元降至 ~819.6 词元（-28%），验证了增量推理有效性
- 压缩奖励使摘要长度减少 33.4%（41→27.3 词元/步），显著提升上下文利用率

## 局限与风险

- 依赖高质量成功轨迹进行后填充数据合成，对低成功率环境适应性有限
- 滑动窗口大小 N 需手动设定（实验中随机取 [2,5]），缺乏自适应调整机制
- 未显式建模工具输出压缩，而工具日志常占大量上下文空间
- RLVR 阶段仅使用 896 个任务，可能限制策略泛化能力

## 适合沉淀的概念

`dynamic-reasoning-context`, `reasoning-digest`, `trajectory-snapshot-training`, `backfilling-data-synthesis`, `compression-aware-rlvr`, `system-2-reasoning`, `lost-in-the-middle`, `sliding-reasoning-window`

## 阅读注意

- 重点关注 Fig.1 和 Fig.2 对三种上下文增长模式的对比及整体框架设计
- 注意 Sec.2.1 中关于训练-推理对齐问题的分析，这是快照训练的核心动机
- 理解 Eq.3 和 Eq.4 中全局压缩率的设计为何优于局部压缩率（抗反射步骤干扰）
- 查看 Tab.2 中‘Shallow Reasoning SFT’性能下降的 paradoxical 现象解释
- 附录 C 解释了为何采用 XML 而非 JSON 工具调用格式（代码内容转义鲁棒性）

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.11716.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，方法描述清晰，实验充分，数据可信。提供了详细的超参数（附录 B）和 scaffold 设计（附录 A），具备可复现性。
