SRPO Sample Routed Policy Optimization
论文导读
提出 SRPO 框架,通过样本级路由将正确样本导向 GRPO 奖励对齐更新,错误样本导向 SDPO 密集修正,并结合熵感知动态加权提升稳定性与性能。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
SRPO:基于样本路由的统一策略优化框架
一句话定位
提出 SRPO 框架,通过样本级路由将正确样本导向 GRPO 奖励对齐更新,错误样本导向 SDPO 密集修正,并结合熵感知动态加权提升稳定性与性能。
小学生也能听懂
这篇论文像给AI做题时配了个“智能小管家”:做对的题用GRPO方法表扬,做错但有提示的题用SDPO方法细心教,还根据题目难度自动调整教学力度,让AI学得更稳更快,成绩平均提高了3到6分。
为什么值得记录
- 解决了 GRPO 在失败样本上信用分配粗糙的问题,以及 SDPO 后期训练不稳定的问题
- 首次系统诊断了 SDPO 内在缺陷:对正确样本自蒸馏引入优化歧义,且自教师信号随训练退化
- 在五个基准测试和两个模型规模上均超越 GRPO 和 SDPO,Qwen3-8B 平均准确率提升 3.4% 和 6.3%
- 同时实现适度响应长度与更低单步计算成本(最长训练下比 GRPO 节省 17.2% 时间)
核心方法
- 定义样本路由机制:正确样本(c_i=1)使用 GRPO,错误但有教师信息的样本((1−c_i)m_i=1)使用 SDPO
- 教师信息来自同组内成功兄弟 rollout 的完整响应文本,构造反馈条件自教师分布 π_θ(·|x,f_i,y_{i,<t})
- 引入熵感知动态加权(DW-SDPO):根据自教师 token 级熵 H_{i,t} 对 SDPO 损失进行重加权,权重 w̃{i,t}=exp(−βH{i,t}),β=1
- 最终目标函数为归一化加权和:ℒ_final = (∑z^{GRPO}ℓ^{GRPO} + ∑z^{SDPO}ℓ^{DW-SDPO}) / (总路由 token 数)
- 训练流程保持 on-policy,每步生成 G=8 个 rollout,仅当存在正确兄弟时才激活 SDPO 分支
关键结果
- Qwen3-8B 在 10h 训练下五基准平均准确率达 77.4%,较 GRPO(74.0%)提升 +3.4,较 SDPO(71.1%)提升 +6.3
- Qwen3-4B 平均准确率达 74.2%,较 GRPO(69.7%)提升 +4.5,较 SDPO(66.7%)提升 +7.5
- SRPO 避免 SDPO 后期崩溃(如 Chemistry 上 SDPO 10h 性能回落至 80.6,SRPO 达 83.0)
- 在 Tool Use 等 SDPO 失效场景下,SRPO 保持稳定并优于 GRPO(10h: 71.2 vs 69.0)
- 10h 训练下单步计算时间比 GRPO 低 17.2%(75.8s vs 91.5s),响应长度介于 GRPO 与 SDPO 之间
局限与风险
- 依赖组内存在正确 rollout 才能构建教师信息,全错组需回退至 GRPO,可能限制早期修正能力
- 动态加权仅缓解但未根除自教师信号退化问题,长期训练仍可能受噪声影响
- 实验仅覆盖 Qwen3 系列与科学推理/工具调用任务,泛化性待验证
- 未探索其他教师信息源(如环境反馈、外部模型),当前设计局限于同策略兄弟样本
适合沉淀的概念
sample-routed-policy-optimization, group-relative-policy-optimization-grpo, self-distillation-policy-optimization-sdpo, entropy-aware-dynamic-weighting, credit-assignment-in-rl, on-policy-distillation, teacher-student-degradation, reinforcement-learning-with-verifiable-rewards
阅读注意
- 重点关注图 1 对 SDPO 不稳定性机制的实证分析:正确样本上应用 SDPO 反而损害性能
- 注意路由逻辑细节:即使有教师信息,正确样本仍强制走 GRPO 分支,避免优化歧义
- 动态加权公式中归一化操作(除以 |Ω_sdpo| 均值)确保损失尺度稳定,避免训练波动
- 附录 C 图 5 显示 SDPO 分支占比随训练下降,解释计算开销降低现象
- 对比 Advantage Mix 消融实验证明样本级路由优于优势值混合策略
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.02288.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法细节、实验设置、消融研究与计算效率分析,数据充分支持结论。