概念
rl reasoning natural-instructions generalization
创建2026-04-15
更新2026-04-15
阅读量级1 分钟
概念导读

在自然语言指令上用 RL 训练,激发 LLM 的通用推理能力——不需要专门的数学/代码推理数据。

  1. 核心方法
  2. 与 RLVR 的区别
  3. Related

SUPERNOVA

核心方法

在自然语言指令上用 RL 训练,激发 LLM 的通用推理能力——不需要专门的数学/代码推理数据。

与 RLVR 的区别

  • RLVR 依赖可验证 reward(数学、代码有明确对错)
  • SUPERNOVA 在更广泛的自然语言任务上做 RL,用 LLM judge 做 reward
  • 目标是通用推理能力,而非特定领域