论文
arXiv2604.02288
时间2026-04
来源https://arxiv.org/html/2604.02288
页面质量中文卡片
阅读量级86 分钟

SRPO Sample Routed Policy Optimization

论文导读

提出 SRPO 框架,通过样本级路由将正确样本导向 GRPO 奖励对齐更新,错误样本导向 SDPO 密集修正,并结合熵感知动态加权提升稳定性与性能。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

SRPO:基于样本路由的统一策略优化框架

一句话定位

提出 SRPO 框架,通过样本级路由将正确样本导向 GRPO 奖励对齐更新,错误样本导向 SDPO 密集修正,并结合熵感知动态加权提升稳定性与性能。

小学生也能听懂

这篇论文像给AI做题时配了个“智能小管家”:做对的题用GRPO方法表扬,做错但有提示的题用SDPO方法细心教,还根据题目难度自动调整教学力度,让AI学得更稳更快,成绩平均提高了3到6分。

为什么值得记录

  • 解决了 GRPO 在失败样本上信用分配粗糙的问题,以及 SDPO 后期训练不稳定的问题
  • 首次系统诊断了 SDPO 内在缺陷:对正确样本自蒸馏引入优化歧义,且自教师信号随训练退化
  • 在五个基准测试和两个模型规模上均超越 GRPO 和 SDPO,Qwen3-8B 平均准确率提升 3.4% 和 6.3%
  • 同时实现适度响应长度与更低单步计算成本(最长训练下比 GRPO 节省 17.2% 时间)

核心方法

  • 定义样本路由机制:正确样本(c_i=1)使用 GRPO,错误但有教师信息的样本((1−c_i)m_i=1)使用 SDPO
  • 教师信息来自同组内成功兄弟 rollout 的完整响应文本,构造反馈条件自教师分布 π_θ(·|x,f_i,y_{i,<t})
  • 引入熵感知动态加权(DW-SDPO):根据自教师 token 级熵 H_{i,t} 对 SDPO 损失进行重加权,权重 w̃{i,t}=exp(−βH{i,t}),β=1
  • 最终目标函数为归一化加权和:ℒ_final = (∑z^{GRPO}ℓ^{GRPO} + ∑z^{SDPO}ℓ^{DW-SDPO}) / (总路由 token 数)
  • 训练流程保持 on-policy,每步生成 G=8 个 rollout,仅当存在正确兄弟时才激活 SDPO 分支

关键结果

  • Qwen3-8B 在 10h 训练下五基准平均准确率达 77.4%,较 GRPO(74.0%)提升 +3.4,较 SDPO(71.1%)提升 +6.3
  • Qwen3-4B 平均准确率达 74.2%,较 GRPO(69.7%)提升 +4.5,较 SDPO(66.7%)提升 +7.5
  • SRPO 避免 SDPO 后期崩溃(如 Chemistry 上 SDPO 10h 性能回落至 80.6,SRPO 达 83.0)
  • 在 Tool Use 等 SDPO 失效场景下,SRPO 保持稳定并优于 GRPO(10h: 71.2 vs 69.0)
  • 10h 训练下单步计算时间比 GRPO 低 17.2%(75.8s vs 91.5s),响应长度介于 GRPO 与 SDPO 之间

局限与风险

  • 依赖组内存在正确 rollout 才能构建教师信息,全错组需回退至 GRPO,可能限制早期修正能力
  • 动态加权仅缓解但未根除自教师信号退化问题,长期训练仍可能受噪声影响
  • 实验仅覆盖 Qwen3 系列与科学推理/工具调用任务,泛化性待验证
  • 未探索其他教师信息源(如环境反馈、外部模型),当前设计局限于同策略兄弟样本

适合沉淀的概念

sample-routed-policy-optimization, group-relative-policy-optimization-grpo, self-distillation-policy-optimization-sdpo, entropy-aware-dynamic-weighting, credit-assignment-in-rl, on-policy-distillation, teacher-student-degradation, reinforcement-learning-with-verifiable-rewards

阅读注意

  • 重点关注图 1 对 SDPO 不稳定性机制的实证分析:正确样本上应用 SDPO 反而损害性能
  • 注意路由逻辑细节:即使有教师信息,正确样本仍强制走 GRPO 分支,避免优化歧义
  • 动态加权公式中归一化操作(除以 |Ω_sdpo| 均值)确保损失尺度稳定,避免训练波动
  • 附录 C 图 5 显示 SDPO 分支占比随训练下降,解释计算开销降低现象
  • 对比 Advantage Mix 消融实验证明样本级路由优于优势值混合策略

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.02288.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法细节、实验设置、消融研究与计算效率分析,数据充分支持结论。