---
title: "Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation"
title_zh: "Nemotron-Cascade 2：基于级联强化学习与多领域同策略蒸馏的 LLM 后训练"
arxiv_id: "2603.19220"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/03/2603.19220.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Nemotron-Cascade 2：基于级联强化学习与多领域同策略蒸馏的 LLM 后训练

## 一句话定位

提出 Nemotron-Cascade 2，一个 30B MoE 模型（激活 3B 参数），通过扩展 Cascade RL 框架并引入多领域同策略蒸馏（MOPD），在数学、编程和智能体任务上实现金牌级性能，显著提升推理密度与训练效率。

## 小学生也能听懂

这篇论文像教一个聪明的小机器人分步骤学数学、编程和解决问题，先用简单题打基础，再逐步挑战难题，并用“小老师”帮它不忘旧知识，最后让它像金牌选手一样厉害，还开源了所有方法让大家一起进步。

## 为什么值得记录

- 首次在 30B MoE 规模模型上实现 IMO 2025 和 IOI 2025 金牌表现，证明小模型可通过高效后训练达到前沿推理能力
- 提出多领域同策略蒸馏（MOPD）机制，有效缓解级联 RL 中的能力退化问题，提升训练稳定性与最终性能
- 开源完整模型权重、训练数据与方法细节，推动社区对复杂 RL 训练范式的复现与改进
- 验证了 Cascade RL 在多样化任务（如长上下文、代码推理、软件工程智能体）上的可扩展性与工程优势

## 核心方法

- 采用 Cascade RL 框架，按序进行 IF-RL、多领域 RL、MOPD、RLHF、长上下文 RL、代码 RL 和 SWE RL 等阶段训练
- 引入多领域同策略蒸馏（MOPD）：从各 Cascade RL 阶段的最优中间检查点选择教师模型，对学生模型进行 token 级知识蒸馏
- 使用 GRPO 算法进行严格同策略训练，移除 KL 散度项，采用组归一化奖励与 token 级损失
- SFT 阶段融合多领域数据（数学、代码、科学、智能体、安全等），总量达数百万样本，支持思考与非思考模式切换
- 动态过滤机制用于 IF-RL，剔除全对或全错样本以稳定训练；超长响应惩罚防止冗余生成
- 多领域 RL 阶段整合 STEM 选择题、工具调用与结构化输出任务，利用相似响应长度与验证成本提升效率
- SWE 任务结合 agentic 与 agentless 数据，分别用于不同训练模式以增强软件修复能力

## 关键结果

- Nemotron-Cascade-2-30B-A3B 在 IMO 2025 获得 35/42 分（金牌），IOI 2025 获得 439.28/600 分（金牌），ICPC World Finals 2025 同样获金牌
- 在 IFBench 上达到 83.13% 准确率，优于同类模型；在 MMLU-Pro、τ²-Bench 等基准上表现最佳
- 相比前代 Nemotron-Cascade 1，在保持低参数量（3B 激活）的同时，推理性能接近更大规模模型（如 120B）
- MOPD 阶段成功恢复因专用 RL 训练导致的基准性能下降，实现更均衡的能力分布

## 局限与风险

- 在知识密集型任务（如 MMLU）和复杂智能体任务上仍落后于 Qwen3.5-35B-A3B，表明预训练知识与智能体 RL 需进一步加强
- Cascade RL 阶段顺序依赖经验设计，缺乏自动化最优排序机制，可能影响泛化性
- MOPD 需存储多个中间教师模型，增加存储与工程复杂度
- 未公开完整训练计算开销与碳排放数据，难以评估实际部署成本

## 适合沉淀的概念

`cascade-reinforcement-learning`, `multi-domain-on-policy-distillation`, `group-relative-policy-optimization`, `verifiable-instruction-following`, `agentic-software-engineering`, `thinking-mode-vs-non-thinking-mode`, `dynamic-filtering-in-rl`, `long-context-reasoning`

## 阅读注意

- 重点关注第 4 节中 Cascade RL 的阶段顺序设计逻辑及其对灾难性遗忘的缓解机制
- 注意 MOPD 如何利用同一训练流程中的中间检查点作为教师，避免引入外部模型带来的分布偏移
- 附录 B 提供详细超参数，可用于复现实验；附录 E 包含 IMO 2025 完整解题过程，具教学价值
- 图 2 和图 3 展示了训练流程与效率对比，是理解整体架构的关键

## 质量说明

- 采用来源：`clean`，`papers/2026/03/2603.19220.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置、结果数据与开源承诺，技术细节充分，具备高度可复现性。
