---
title: "Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning"
title_zh: "大模型强化学习后训练的缩放行为：数学推理中的实证研究"
arxiv_id: "2509.25300"
paper_type: "analysis"
source_kind: "raw"
raw_path: "raw/papers/2025/09/2509.25300.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 大模型强化学习后训练的缩放行为：数学推理中的实证研究

## 一句话定位

通过 Qwen2.5 和 Llama 3 系列模型（0.5B–72B）上的大规模 RL 实验，提出并验证了描述测试损失与模型规模、计算量和数据量之间关系的预测性幂律公式，揭示学习效率随模型增大趋于饱和的现象，并证明在数据受限时重复使用数据是有效策略。

## 小学生也能听懂

这篇论文像做实验一样，用不同大小的语言模型学做数学题，发现模型越大、算得越多、题目练得越多，成绩就越好，但大模型进步会变慢，而且重复做题也有帮助。

## 为什么值得记录

- 首次系统刻画了 LLM 在强化学习后训练阶段的缩放规律，填补了预训练缩放律与后训练优化之间的空白
- 提出的对数线性幂律模型（log L = -k(N)·log X + E(N)）具备强预测能力，可用于跨模型外推和训练轨迹预测
- 发现学习效率 k(N) 随模型增大呈现饱和趋势，表明超大模型存在边际效益递减，对资源分配具有指导意义
- 验证了数据重用在低资源场景下的有效性，为数据稀缺时的 RL 微调提供实用策略
- 在多个架构（Qwen2.5、Llama 3）上验证结论的普适性，增强结果的可靠性

## 核心方法

- 使用 Qwen2.5（0.5B–72B）和 Llama 3（1B–70B）系列模型，控制架构一致，仅参数规模为变量
- 采用 GRPO 算法进行强化学习微调，奖励信号为数学答案正确性（0/1 二元奖励）
- 训练数据来自 Reasoning360 项目的 guru-RL-92k 数学子集，按难度排序以支持课程学习
- 定义测试损失 L = 1 - PassRate 作为核心评估指标，与预训练缩放律文献保持一致
- 设计三种资源约束场景：计算受限（固定 FLOPs）、数据受限（固定唯一样本数）、数据重用（固定总量，变化重复因子 τ）
- 使用两种拟合协议：跨模型外推（用 0.5B–32B 拟合预测 72B）和模型内预测（用早期训练步预测全程）
- FLOPs 计算基于标准公式：每步约 6×N×T FLOPs（N 为非嵌入参数量，T 为 token 数）

## 关键结果

- 测试损失与计算量/数据量呈对数线性关系，可用幂律模型 log L = -k(N)·log X + E(N) 高精度拟合（R² > 0.99）
- 学习效率 k(N) 随模型增大而提升，但增长趋势饱和，拟合得 k(N) = K_max / (1 + N₀/N)，表明存在理论效率上限
- 在计算受限时，大模型更高效，但 32B 在初期可能优于 72B 因可执行更多训练步，体现规模与步数的权衡
- 在数据受限时，性能主要由总训练数据量 D_total 决定，而非样本唯一性；重复因子 τ ≤ 25 时性能几乎无退化
- 过度重复（τ = 100）导致过拟合，验证了适度重用的有效性边界
- 缩放律在 Qwen2.5 和 Llama 3 上均成立，证明其架构无关性
- RL 微调显著提升数学域内泛化（如 GSM8K、MATH500），但几乎不迁移至代码、科学等领域，逻辑推理任务甚至出现负迁移

## 局限与风险

- 结论限于数学推理领域，未扩展至多领域混合 RL 场景
- 最大模型为 72B，无法验证更大规模（如万亿参数）下的效率饱和趋势
- 实验仅涵盖稠密模型（Qwen2.5、Llama 3），未涉及混合专家（MoE）架构的泛化性

## 适合沉淀的概念

`scaling-laws`, `reinforcement-learning-post-training`, `mathematical-reasoning`, `compute-optimal-scaling`, `data-optimal-scaling`, `data-reuse`, `learning-efficiency-saturation`, `grpo-algorithm`, `test-loss-metric`, `inter-model-extrapolation`, `intra-model-prediction`

## 阅读注意

- 重点关注公式 (1) 和 (2) 提出的幂律模型及其参数含义，特别是 k(N) 的饱和结构
- 注意区分‘计算受限’与‘数据受限’两种场景下的最优缩放策略差异
- 图 2 和图 3 展示了模型内与跨模型预测能力，是验证公式预测性的关键
- 图 5 显示 k_C(N) 和 k_D(N) 的饱和趋势，支持效率存在上限的结论
- 附录 D 提出的损失分解模型提供了更细粒度的解释框架，虽未作为主结论，但值得深入阅读

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/09/2509.25300.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、多轮重复结果、不确定性分析、跨架构验证和详细的附录推导，数据充分，方法严谨，结论有坚实支撑。
