---
title: "SRPO Sample Routed Policy Optimization"
title_zh: "SRPO：基于样本路由的统一策略优化框架"
arxiv_id: "2604.02288"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.02288.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# SRPO：基于样本路由的统一策略优化框架

## 一句话定位

提出 SRPO 框架，通过样本级路由将正确样本导向 GRPO 奖励对齐更新，错误样本导向 SDPO 密集修正，并结合熵感知动态加权提升稳定性与性能。

## 小学生也能听懂

这篇论文像给AI做题时配了个“智能小管家”：做对的题用GRPO方法表扬，做错但有提示的题用SDPO方法细心教，还根据题目难度自动调整教学力度，让AI学得更稳更快，成绩平均提高了3到6分。

## 为什么值得记录

- 解决了 GRPO 在失败样本上信用分配粗糙的问题，以及 SDPO 后期训练不稳定的问题
- 首次系统诊断了 SDPO 内在缺陷：对正确样本自蒸馏引入优化歧义，且自教师信号随训练退化
- 在五个基准测试和两个模型规模上均超越 GRPO 和 SDPO，Qwen3-8B 平均准确率提升 3.4% 和 6.3%
- 同时实现适度响应长度与更低单步计算成本（最长训练下比 GRPO 节省 17.2% 时间）

## 核心方法

- 定义样本路由机制：正确样本（c_i=1）使用 GRPO，错误但有教师信息的样本（(1−c_i)m_i=1）使用 SDPO
- 教师信息来自同组内成功兄弟 rollout 的完整响应文本，构造反馈条件自教师分布 π_θ(·|x,f_i,y_{i,<t})
- 引入熵感知动态加权（DW-SDPO）：根据自教师 token 级熵 H_{i,t} 对 SDPO 损失进行重加权，权重 w̃_{i,t}=exp(−βH_{i,t})，β=1
- 最终目标函数为归一化加权和：ℒ_final = (∑z^{GRPO}ℓ^{GRPO} + ∑z^{SDPO}ℓ^{DW-SDPO}) / (总路由 token 数)
- 训练流程保持 on-policy，每步生成 G=8 个 rollout，仅当存在正确兄弟时才激活 SDPO 分支

## 关键结果

- Qwen3-8B 在 10h 训练下五基准平均准确率达 77.4%，较 GRPO（74.0%）提升 +3.4，较 SDPO（71.1%）提升 +6.3
- Qwen3-4B 平均准确率达 74.2%，较 GRPO（69.7%）提升 +4.5，较 SDPO（66.7%）提升 +7.5
- SRPO 避免 SDPO 后期崩溃（如 Chemistry 上 SDPO 10h 性能回落至 80.6，SRPO 达 83.0）
- 在 Tool Use 等 SDPO 失效场景下，SRPO 保持稳定并优于 GRPO（10h: 71.2 vs 69.0）
- 10h 训练下单步计算时间比 GRPO 低 17.2%（75.8s vs 91.5s），响应长度介于 GRPO 与 SDPO 之间

## 局限与风险

- 依赖组内存在正确 rollout 才能构建教师信息，全错组需回退至 GRPO，可能限制早期修正能力
- 动态加权仅缓解但未根除自教师信号退化问题，长期训练仍可能受噪声影响
- 实验仅覆盖 Qwen3 系列与科学推理/工具调用任务，泛化性待验证
- 未探索其他教师信息源（如环境反馈、外部模型），当前设计局限于同策略兄弟样本

## 适合沉淀的概念

`sample-routed-policy-optimization`, `group-relative-policy-optimization-grpo`, `self-distillation-policy-optimization-sdpo`, `entropy-aware-dynamic-weighting`, `credit-assignment-in-rl`, `on-policy-distillation`, `teacher-student-degradation`, `reinforcement-learning-with-verifiable-rewards`

## 阅读注意

- 重点关注图 1 对 SDPO 不稳定性机制的实证分析：正确样本上应用 SDPO 反而损害性能
- 注意路由逻辑细节：即使有教师信息，正确样本仍强制走 GRPO 分支，避免优化歧义
- 动态加权公式中归一化操作（除以 |Ω_sdpo| 均值）确保损失尺度稳定，避免训练波动
- 附录 C 图 5 显示 SDPO 分支占比随训练下降，解释计算开销降低现象
- 对比 Advantage Mix 消融实验证明样本级路由优于优势值混合策略

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.02288.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、消融研究与计算效率分析，数据充分支持结论。
