概念
agentic-coding swe-agent fine-tuning execution
创建2026-04-15
更新2026-04-15
阅读量级1 分钟
概念导读

SWE Agent 训练从 execution-free(纯 SFT)走向 execution-based(带环境反馈的 RL)。

  1. 核心转变
  2. 方法
  3. 意义
  4. Related

SWE-ZERO to SWE-HERO

核心转变

SWE Agent 训练从 execution-free(纯 SFT)走向 execution-based(带环境反馈的 RL)。

方法

  • Execution-free: 纯文本训练,不运行代码
  • Execution-based: 训练时执行 patch,用测试结果做 reward
  • 渐进式从 free 到 based 的训练策略

意义

执行反馈是 SWE Agent 超越纯文本推理的关键。类似于 RLVR 在推理模型中的作用。