---
title: "SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents"
title_zh: "SWE-Shepherd：基于过程奖励模型的代码智能体强化方法"
arxiv_id: "2604.10493"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.10493.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# SWE-Shepherd：基于过程奖励模型的代码智能体强化方法

## 一句话定位

提出 SWE-Shepherd 框架，利用过程奖励模型（PRM）为代码智能体提供细粒度中间步骤反馈，提升其在真实软件工程任务中的决策效率与质量。

## 小学生也能听懂

这篇论文像给写代码的小机器人配了个“小老师”，在它每做一步（比如改代码或运行测试）时打分，告诉它这一步好不好，让它更快学会解决问题，还省力气。

## 为什么值得记录

- 解决了现有代码智能体缺乏中间决策评估机制的问题，减少无效探索和错误传播
- 提出轻量级 PRM 训练范式，避免复杂强化学习流程，实现奖励引导的搜索
- 基于 SWE-Bench 构建首个代码智能体动作级奖励数据集，支持可复现研究
- 揭示中间奖励与最终任务成功率之间的对齐挑战，为后续研究提供方向

## 核心方法

- 从 SWE-Bench 收集真实 GitHub 问题、仓库快照和测试用例作为训练与评估任务
- 使用 LLM 智能体生成包含文件读取、代码编辑、测试执行等动作的交互轨迹
- 设计启发式规则计算每个中间动作的标量奖励，反映其对问题解决的贡献度
- 构建监督数据集：输入为问题描述、历史交互和候选动作，输出为归一化奖励值
- 在预训练 LLM 上添加 MLP 头，采用 qLoRA 微调和 MSE 损失训练过程奖励模型（PRM）
- 推理时由 PRM 对候选动作打分，智能体选择最高分动作，实现奖励引导的决策

## 关键结果

- 在 SWE-Bench Verified 上，SWE-Shepherd 平均交互步数从 15.2 降至 12.2，提升效率
- 任务解决率从 mini-SWE-Agent 的 57% 略降至 51%，表明局部高奖励动作未必导向全局成功
- 已解决任务平均奖励为 0.4894，未解决任务为 0.4818，差异微弱，说明奖励信号与最终成功弱相关
- 相比 MCTS 方法 SWE-Search，SWE-Shepherd 成本更低且解决率更高

## 局限与风险

- 中间奖励函数依赖启发式设计，与最终任务成功对齐度不足
- PRM 仅提供动作评分，未结合策略优化或环境反馈进行端到端训练
- 实验仅基于 gpt-5-mini 和 100 个任务，泛化能力有待验证
- 未探索自适应步长限制或多样化动作生成策略

## 适合沉淀的概念

`process-reward-models`, `code-agents`, `swe-bench`, `reward-guided-search`, `intermediate-supervision`, `action-level-reward`, `llm-based-software-engineering`, `trajectory-reward-modeling`

## 阅读注意

- 关注 PRM 如何在不使用强化学习的情况下实现奖励引导的决策
- 注意奖励计算启发式规则的具体设计及其对模型训练的影响
- 分析表2中奖励与任务结果弱相关的深层原因
- 思考为何减少步数的同时解决率下降，是否存在探索-利用权衡问题
- 留意未来工作中提到的混合 RL 与 PRM 的可能性

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.10493.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，方法描述清晰，实验设计合理，数据与代码公开，具备可复现性。虽部分引用未标注具体年份，但不影响核心内容理解。
