论文
arXiv2603.19220
时间2026-03
来源Markdown
页面质量中文卡片
阅读量级219 分钟

Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation

论文导读

提出 Nemotron-Cascade 2,一个 30B MoE 模型(激活 3B 参数),通过扩展 Cascade RL 框架并引入多领域同策略蒸馏(MOPD),在数学、编程和智能体任务上实现金牌级性能,显著提升推理密度与训练效率。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Nemotron-Cascade 2:基于级联强化学习与多领域同策略蒸馏的 LLM 后训练

一句话定位

提出 Nemotron-Cascade 2,一个 30B MoE 模型(激活 3B 参数),通过扩展 Cascade RL 框架并引入多领域同策略蒸馏(MOPD),在数学、编程和智能体任务上实现金牌级性能,显著提升推理密度与训练效率。

小学生也能听懂

这篇论文像教一个聪明的小机器人分步骤学数学、编程和解决问题,先用简单题打基础,再逐步挑战难题,并用“小老师”帮它不忘旧知识,最后让它像金牌选手一样厉害,还开源了所有方法让大家一起进步。

为什么值得记录

  • 首次在 30B MoE 规模模型上实现 IMO 2025 和 IOI 2025 金牌表现,证明小模型可通过高效后训练达到前沿推理能力
  • 提出多领域同策略蒸馏(MOPD)机制,有效缓解级联 RL 中的能力退化问题,提升训练稳定性与最终性能
  • 开源完整模型权重、训练数据与方法细节,推动社区对复杂 RL 训练范式的复现与改进
  • 验证了 Cascade RL 在多样化任务(如长上下文、代码推理、软件工程智能体)上的可扩展性与工程优势

核心方法

  • 采用 Cascade RL 框架,按序进行 IF-RL、多领域 RL、MOPD、RLHF、长上下文 RL、代码 RL 和 SWE RL 等阶段训练
  • 引入多领域同策略蒸馏(MOPD):从各 Cascade RL 阶段的最优中间检查点选择教师模型,对学生模型进行 token 级知识蒸馏
  • 使用 GRPO 算法进行严格同策略训练,移除 KL 散度项,采用组归一化奖励与 token 级损失
  • SFT 阶段融合多领域数据(数学、代码、科学、智能体、安全等),总量达数百万样本,支持思考与非思考模式切换
  • 动态过滤机制用于 IF-RL,剔除全对或全错样本以稳定训练;超长响应惩罚防止冗余生成
  • 多领域 RL 阶段整合 STEM 选择题、工具调用与结构化输出任务,利用相似响应长度与验证成本提升效率
  • SWE 任务结合 agentic 与 agentless 数据,分别用于不同训练模式以增强软件修复能力

关键结果

  • Nemotron-Cascade-2-30B-A3B 在 IMO 2025 获得 35/42 分(金牌),IOI 2025 获得 439.28/600 分(金牌),ICPC World Finals 2025 同样获金牌
  • 在 IFBench 上达到 83.13% 准确率,优于同类模型;在 MMLU-Pro、τ²-Bench 等基准上表现最佳
  • 相比前代 Nemotron-Cascade 1,在保持低参数量(3B 激活)的同时,推理性能接近更大规模模型(如 120B)
  • MOPD 阶段成功恢复因专用 RL 训练导致的基准性能下降,实现更均衡的能力分布

局限与风险

  • 在知识密集型任务(如 MMLU)和复杂智能体任务上仍落后于 Qwen3.5-35B-A3B,表明预训练知识与智能体 RL 需进一步加强
  • Cascade RL 阶段顺序依赖经验设计,缺乏自动化最优排序机制,可能影响泛化性
  • MOPD 需存储多个中间教师模型,增加存储与工程复杂度
  • 未公开完整训练计算开销与碳排放数据,难以评估实际部署成本

适合沉淀的概念

cascade-reinforcement-learning, multi-domain-on-policy-distillation, group-relative-policy-optimization, verifiable-instruction-following, agentic-software-engineering, thinking-mode-vs-non-thinking-mode, dynamic-filtering-in-rl, long-context-reasoning

阅读注意

  • 重点关注第 4 节中 Cascade RL 的阶段顺序设计逻辑及其对灾难性遗忘的缓解机制
  • 注意 MOPD 如何利用同一训练流程中的中间检查点作为教师,避免引入外部模型带来的分布偏移
  • 附录 B 提供详细超参数,可用于复现实验;附录 E 包含 IMO 2025 完整解题过程,具教学价值
  • 图 2 和图 3 展示了训练流程与效率对比,是理解整体架构的关键

质量说明

  • 采用来源:cleanpapers/2026/03/2603.19220.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、实验设置、结果数据与开源承诺,技术细节充分,具备高度可复现性。