论文
arXiv2509.25300
时间2025-09
来源Markdown
页面质量中文卡片
阅读量级95 分钟

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning

论文导读

通过 Qwen2.5 和 Llama 3 系列模型(0.5B–72B)上的大规模 RL 实验,提出并验证了描述测试损失与模型规模、计算量和数据量之间关系的预测性幂律公式,揭示学习效率随模型增大趋于饱和的现象,并证明在数据受限时重复使用数据是有效策略。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

大模型强化学习后训练的缩放行为:数学推理中的实证研究

一句话定位

通过 Qwen2.5 和 Llama 3 系列模型(0.5B–72B)上的大规模 RL 实验,提出并验证了描述测试损失与模型规模、计算量和数据量之间关系的预测性幂律公式,揭示学习效率随模型增大趋于饱和的现象,并证明在数据受限时重复使用数据是有效策略。

小学生也能听懂

这篇论文像做实验一样,用不同大小的语言模型学做数学题,发现模型越大、算得越多、题目练得越多,成绩就越好,但大模型进步会变慢,而且重复做题也有帮助。

为什么值得记录

  • 首次系统刻画了 LLM 在强化学习后训练阶段的缩放规律,填补了预训练缩放律与后训练优化之间的空白
  • 提出的对数线性幂律模型(log L = -k(N)·log X + E(N))具备强预测能力,可用于跨模型外推和训练轨迹预测
  • 发现学习效率 k(N) 随模型增大呈现饱和趋势,表明超大模型存在边际效益递减,对资源分配具有指导意义
  • 验证了数据重用在低资源场景下的有效性,为数据稀缺时的 RL 微调提供实用策略
  • 在多个架构(Qwen2.5、Llama 3)上验证结论的普适性,增强结果的可靠性

核心方法

  • 使用 Qwen2.5(0.5B–72B)和 Llama 3(1B–70B)系列模型,控制架构一致,仅参数规模为变量
  • 采用 GRPO 算法进行强化学习微调,奖励信号为数学答案正确性(0/1 二元奖励)
  • 训练数据来自 Reasoning360 项目的 guru-RL-92k 数学子集,按难度排序以支持课程学习
  • 定义测试损失 L = 1 - PassRate 作为核心评估指标,与预训练缩放律文献保持一致
  • 设计三种资源约束场景:计算受限(固定 FLOPs)、数据受限(固定唯一样本数)、数据重用(固定总量,变化重复因子 τ)
  • 使用两种拟合协议:跨模型外推(用 0.5B–32B 拟合预测 72B)和模型内预测(用早期训练步预测全程)
  • FLOPs 计算基于标准公式:每步约 6×N×T FLOPs(N 为非嵌入参数量,T 为 token 数)

关键结果

  • 测试损失与计算量/数据量呈对数线性关系,可用幂律模型 log L = -k(N)·log X + E(N) 高精度拟合(R² > 0.99)
  • 学习效率 k(N) 随模型增大而提升,但增长趋势饱和,拟合得 k(N) = K_max / (1 + N₀/N),表明存在理论效率上限
  • 在计算受限时,大模型更高效,但 32B 在初期可能优于 72B 因可执行更多训练步,体现规模与步数的权衡
  • 在数据受限时,性能主要由总训练数据量 D_total 决定,而非样本唯一性;重复因子 τ ≤ 25 时性能几乎无退化
  • 过度重复(τ = 100)导致过拟合,验证了适度重用的有效性边界
  • 缩放律在 Qwen2.5 和 Llama 3 上均成立,证明其架构无关性
  • RL 微调显著提升数学域内泛化(如 GSM8K、MATH500),但几乎不迁移至代码、科学等领域,逻辑推理任务甚至出现负迁移

局限与风险

  • 结论限于数学推理领域,未扩展至多领域混合 RL 场景
  • 最大模型为 72B,无法验证更大规模(如万亿参数)下的效率饱和趋势
  • 实验仅涵盖稠密模型(Qwen2.5、Llama 3),未涉及混合专家(MoE)架构的泛化性

适合沉淀的概念

scaling-laws, reinforcement-learning-post-training, mathematical-reasoning, compute-optimal-scaling, data-optimal-scaling, data-reuse, learning-efficiency-saturation, grpo-algorithm, test-loss-metric, inter-model-extrapolation, intra-model-prediction

阅读注意

  • 重点关注公式 (1) 和 (2) 提出的幂律模型及其参数含义,特别是 k(N) 的饱和结构
  • 注意区分‘计算受限’与‘数据受限’两种场景下的最优缩放策略差异
  • 图 2 和图 3 展示了模型内与跨模型预测能力,是验证公式预测性的关键
  • 图 5 显示 k_C(N) 和 k_D(N) 的饱和趋势,支持效率存在上限的结论
  • 附录 D 提出的损失分解模型提供了更细粒度的解释框架,虽未作为主结论,但值得深入阅读

质量说明

  • 采用来源:rawraw/papers/2025/09/2509.25300.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的实验设置、多轮重复结果、不确定性分析、跨架构验证和详细的附录推导,数据充分,方法严谨,结论有坚实支撑。