Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
论文导读
通过 Qwen2.5 和 Llama 3 系列模型(0.5B–72B)上的大规模 RL 实验,提出并验证了描述测试损失与模型规模、计算量和数据量之间关系的预测性幂律公式,揭示学习效率随模型增大趋于饱和的现象,并证明在数据受限时重复使用数据是有效策略。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
大模型强化学习后训练的缩放行为:数学推理中的实证研究
一句话定位
通过 Qwen2.5 和 Llama 3 系列模型(0.5B–72B)上的大规模 RL 实验,提出并验证了描述测试损失与模型规模、计算量和数据量之间关系的预测性幂律公式,揭示学习效率随模型增大趋于饱和的现象,并证明在数据受限时重复使用数据是有效策略。
小学生也能听懂
这篇论文像做实验一样,用不同大小的语言模型学做数学题,发现模型越大、算得越多、题目练得越多,成绩就越好,但大模型进步会变慢,而且重复做题也有帮助。
为什么值得记录
- 首次系统刻画了 LLM 在强化学习后训练阶段的缩放规律,填补了预训练缩放律与后训练优化之间的空白
- 提出的对数线性幂律模型(log L = -k(N)·log X + E(N))具备强预测能力,可用于跨模型外推和训练轨迹预测
- 发现学习效率 k(N) 随模型增大呈现饱和趋势,表明超大模型存在边际效益递减,对资源分配具有指导意义
- 验证了数据重用在低资源场景下的有效性,为数据稀缺时的 RL 微调提供实用策略
- 在多个架构(Qwen2.5、Llama 3)上验证结论的普适性,增强结果的可靠性
核心方法
- 使用 Qwen2.5(0.5B–72B)和 Llama 3(1B–70B)系列模型,控制架构一致,仅参数规模为变量
- 采用 GRPO 算法进行强化学习微调,奖励信号为数学答案正确性(0/1 二元奖励)
- 训练数据来自 Reasoning360 项目的 guru-RL-92k 数学子集,按难度排序以支持课程学习
- 定义测试损失 L = 1 - PassRate 作为核心评估指标,与预训练缩放律文献保持一致
- 设计三种资源约束场景:计算受限(固定 FLOPs)、数据受限(固定唯一样本数)、数据重用(固定总量,变化重复因子 τ)
- 使用两种拟合协议:跨模型外推(用 0.5B–32B 拟合预测 72B)和模型内预测(用早期训练步预测全程)
- FLOPs 计算基于标准公式:每步约 6×N×T FLOPs(N 为非嵌入参数量,T 为 token 数)
关键结果
- 测试损失与计算量/数据量呈对数线性关系,可用幂律模型 log L = -k(N)·log X + E(N) 高精度拟合(R² > 0.99)
- 学习效率 k(N) 随模型增大而提升,但增长趋势饱和,拟合得 k(N) = K_max / (1 + N₀/N),表明存在理论效率上限
- 在计算受限时,大模型更高效,但 32B 在初期可能优于 72B 因可执行更多训练步,体现规模与步数的权衡
- 在数据受限时,性能主要由总训练数据量 D_total 决定,而非样本唯一性;重复因子 τ ≤ 25 时性能几乎无退化
- 过度重复(τ = 100)导致过拟合,验证了适度重用的有效性边界
- 缩放律在 Qwen2.5 和 Llama 3 上均成立,证明其架构无关性
- RL 微调显著提升数学域内泛化(如 GSM8K、MATH500),但几乎不迁移至代码、科学等领域,逻辑推理任务甚至出现负迁移
局限与风险
- 结论限于数学推理领域,未扩展至多领域混合 RL 场景
- 最大模型为 72B,无法验证更大规模(如万亿参数)下的效率饱和趋势
- 实验仅涵盖稠密模型(Qwen2.5、Llama 3),未涉及混合专家(MoE)架构的泛化性
适合沉淀的概念
scaling-laws, reinforcement-learning-post-training, mathematical-reasoning, compute-optimal-scaling, data-optimal-scaling, data-reuse, learning-efficiency-saturation, grpo-algorithm, test-loss-metric, inter-model-extrapolation, intra-model-prediction
阅读注意
- 重点关注公式 (1) 和 (2) 提出的幂律模型及其参数含义,特别是 k(N) 的饱和结构
- 注意区分‘计算受限’与‘数据受限’两种场景下的最优缩放策略差异
- 图 2 和图 3 展示了模型内与跨模型预测能力,是验证公式预测性的关键
- 图 5 显示 k_C(N) 和 k_D(N) 的饱和趋势,支持效率存在上限的结论
- 附录 D 提出的损失分解模型提供了更细粒度的解释框架,虽未作为主结论,但值得深入阅读
质量说明
- 采用来源:
raw,raw/papers/2025/09/2509.25300.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的实验设置、多轮重复结果、不确定性分析、跨架构验证和详细的附录推导,数据充分,方法严谨,结论有坚实支撑。