---
title: "2604.08477"
title_zh: "SuperNova：基于自然指令的强化学习通用推理数据构建框架"
arxiv_id: "2604.08477"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.08477.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# SuperNova：基于自然指令的强化学习通用推理数据构建框架

## 一句话定位

提出 SuperNova 数据构建框架，通过系统化筛选和混合自然指令任务，提升大语言模型在通用推理任务上的强化学习效果。

## 小学生也能听懂

这篇论文像搭积木一样，从很多任务里挑出有用的，用“微混合”方法组合成高质量数据，让AI通过强化学习变得更会推理，小模型也能打败更大的模型。

## 为什么值得记录

- 首次将强化学习可验证奖励（RLVR）扩展至通用推理领域，突破其在数学与代码之外的局限
- 揭示了任务选择对推理性能的关键影响，发现部分任务会损害模型表现
- 提出微混合（micro mixing）策略，优于传统宏混合，能更好覆盖多样化推理技能
- 在 BBEH、Zebralogic、MMLU-Pro 等挑战性基准上实现显著性能提升，最高相对增益达 52.8%
- 证明高质量数据可让小模型（如 4B）超越更大基线模型（如 Qwen3-8B）

## 核心方法

- 从 SuperNI 指令数据集中筛选 83 个候选任务，重构成可验证格式（如选择题）
- 采用 GRPO 算法进行强化学习训练，跳过 KL 惩罚以提升效率
- 定义任务效用评分机制：通过在目标子任务上的实际训练性能评估任务价值
- 提出两种混合策略：宏混合（macro mixing）基于整体平均性能选任务，微混合（micro mixing）为每个子任务单独选 top-N 任务
- 测试多种合成数据干预手段（如长上下文依赖、对抗先验），但发现其未带来性能增益
- 最终构建 SuperNova 数据集，包含 25K 条高质量 RLVR 样本
- 在 Qwen3 系列模型（0.6B–4B）上进行训练与评估

## 关键结果

- SuperNova-4B 在 BBEH-test 上 pass@1 和 pass@8 分别提升 29.4% 和 42.9%
- SuperNova-4B 在 pass@8 上超越 Qwen3-8B 达 8.2 个百分点
- 微混合策略（Micro-Top2）在 BBEH-mini 上达到最高 pass@8 为 22.8%，优于宏混合
- 任务选择影响显著：最佳任务（task738-perspectrum）带来 +39pp 增益，最差任务（task213-rocstories）造成 -9pp 下降
- 在未见基准（BBH、Zebralogic、MMLU-Pro）上平均 pass@8 提升 12.3%，其中 Zebralogic 提升 21pp
- 性能随测试时计算量（k 值）增加持续提升，表明增强了推理探索能力

## 局限与风险

- 实验基于有限计算资源（250–5000 RL 步），未验证无限扩展下的表现
- 评估集中于学术基准，可能无法完全反映真实世界复杂问题解决能力
- 合成数据干预未带来收益，说明高质量原始数据已接近最优，难以通过简单增强改进
- 任务效用评估依赖实际训练，计算成本高，缺乏高效代理指标

## 适合沉淀的概念

`reinforcement-learning-with-verifiable-rewards`, `general-reasoning`, `data-curation-for-llms`, `micro-mixing-strategy`, `task-selection-impact`, `rlvr-beyond-stem`, `instruction-tuning-to-rlvr`, `pass@k-evaluation`

## 阅读注意

- 关注任务选择实验设计：为何某些任务会降低性能？是否与负迁移有关？
- 注意微混合策略的具体实现：如何为每个 BBEH 子任务独立选择 top-N 任务？
- 对比不同数据干预方法的效果差异，理解为何‘更难’不等于‘更好’
- 观察 pass@k 随 k 增长的趋势，分析模型是否真正提升了推理多样性而非仅记忆
- 思考 SuperNova 与 General-Reasoner、Nemotron-Crossthink 等工作的本质区别：数据来源 vs. 数据质量

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.08477.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、实验设置、消融分析和跨基准验证，数据与结论一致，具备可复现性基础。
