Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
论文导读
提出 Nemotron-Cascade 2,一个 30B MoE 模型(激活 3B 参数),通过扩展 Cascade RL 框架并引入多领域同策略蒸馏(MOPD),在数学、编程和智能体任务上实现金牌级性能,显著提升推理密度与训练效率。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Nemotron-Cascade 2:基于级联强化学习与多领域同策略蒸馏的 LLM 后训练
一句话定位
提出 Nemotron-Cascade 2,一个 30B MoE 模型(激活 3B 参数),通过扩展 Cascade RL 框架并引入多领域同策略蒸馏(MOPD),在数学、编程和智能体任务上实现金牌级性能,显著提升推理密度与训练效率。
小学生也能听懂
这篇论文像教一个聪明的小机器人分步骤学数学、编程和解决问题,先用简单题打基础,再逐步挑战难题,并用“小老师”帮它不忘旧知识,最后让它像金牌选手一样厉害,还开源了所有方法让大家一起进步。
为什么值得记录
- 首次在 30B MoE 规模模型上实现 IMO 2025 和 IOI 2025 金牌表现,证明小模型可通过高效后训练达到前沿推理能力
- 提出多领域同策略蒸馏(MOPD)机制,有效缓解级联 RL 中的能力退化问题,提升训练稳定性与最终性能
- 开源完整模型权重、训练数据与方法细节,推动社区对复杂 RL 训练范式的复现与改进
- 验证了 Cascade RL 在多样化任务(如长上下文、代码推理、软件工程智能体)上的可扩展性与工程优势
核心方法
- 采用 Cascade RL 框架,按序进行 IF-RL、多领域 RL、MOPD、RLHF、长上下文 RL、代码 RL 和 SWE RL 等阶段训练
- 引入多领域同策略蒸馏(MOPD):从各 Cascade RL 阶段的最优中间检查点选择教师模型,对学生模型进行 token 级知识蒸馏
- 使用 GRPO 算法进行严格同策略训练,移除 KL 散度项,采用组归一化奖励与 token 级损失
- SFT 阶段融合多领域数据(数学、代码、科学、智能体、安全等),总量达数百万样本,支持思考与非思考模式切换
- 动态过滤机制用于 IF-RL,剔除全对或全错样本以稳定训练;超长响应惩罚防止冗余生成
- 多领域 RL 阶段整合 STEM 选择题、工具调用与结构化输出任务,利用相似响应长度与验证成本提升效率
- SWE 任务结合 agentic 与 agentless 数据,分别用于不同训练模式以增强软件修复能力
关键结果
- Nemotron-Cascade-2-30B-A3B 在 IMO 2025 获得 35/42 分(金牌),IOI 2025 获得 439.28/600 分(金牌),ICPC World Finals 2025 同样获金牌
- 在 IFBench 上达到 83.13% 准确率,优于同类模型;在 MMLU-Pro、τ²-Bench 等基准上表现最佳
- 相比前代 Nemotron-Cascade 1,在保持低参数量(3B 激活)的同时,推理性能接近更大规模模型(如 120B)
- MOPD 阶段成功恢复因专用 RL 训练导致的基准性能下降,实现更均衡的能力分布
局限与风险
- 在知识密集型任务(如 MMLU)和复杂智能体任务上仍落后于 Qwen3.5-35B-A3B,表明预训练知识与智能体 RL 需进一步加强
- Cascade RL 阶段顺序依赖经验设计,缺乏自动化最优排序机制,可能影响泛化性
- MOPD 需存储多个中间教师模型,增加存储与工程复杂度
- 未公开完整训练计算开销与碳排放数据,难以评估实际部署成本
适合沉淀的概念
cascade-reinforcement-learning, multi-domain-on-policy-distillation, group-relative-policy-optimization, verifiable-instruction-following, agentic-software-engineering, thinking-mode-vs-non-thinking-mode, dynamic-filtering-in-rl, long-context-reasoning
阅读注意
- 重点关注第 4 节中 Cascade RL 的阶段顺序设计逻辑及其对灾难性遗忘的缓解机制
- 注意 MOPD 如何利用同一训练流程中的中间检查点作为教师,避免引入外部模型带来的分布偏移
- 附录 B 提供详细超参数,可用于复现实验;附录 E 包含 IMO 2025 完整解题过程,具教学价值
- 图 2 和图 3 展示了训练流程与效率对比,是理解整体架构的关键
质量说明
- 采用来源:
clean,papers/2026/03/2603.19220.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的方法描述、实验设置、结果数据与开源承诺,技术细节充分,具备高度可复现性。