Are complicated loss functions necessary for teaching LLMs to reason?
论文导读
通过系统分析GRPO损失函数的组件,提出简化版RGRA方法,证明负反馈和优势估计关键,而PPO式裁剪非必需。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
复杂损失函数对LLM推理训练是否必要?
一句话定位
通过系统分析GRPO损失函数的组件,提出简化版RGRA方法,证明负反馈和优势估计关键,而PPO式裁剪非必需。
小学生也能听懂
这篇论文像做实验一样,把复杂的训练方法拆开来看,发现只要保留“答错了要扣分”和“比组里其他答案好才加分”这两个关键部分,去掉多余的复杂规则,就能让AI学数学更稳、更快,还更容易实现。
为什么值得记录
- 揭示了GRPO中真正关键的组件:负反馈和组相对优势估计,而非PPO式约束
- 提出RGRA方法,在多个数学基准上优于GRPO,且训练更稳定、实现更简单
- 挑战了当前LLM后训练中过度依赖复杂RL算法的趋势,支持回归基础策略梯度方法
- 为资源受限场景提供了高效替代方案,推动推理能力训练的透明化与可复现性
核心方法
- 对GRPO进行组件级消融实验:分别移除负反馈(仅正优势)、PPO裁剪、优势估计
- 提出RGRA(REINFORCE with Group Relative Advantage):保留组内相对优势估计,去除策略比率和clip机制
- 在Qwen2.5-0.5B/1.5B和Llama3.2-1B模型上对比GRPO、RGRA、RAFT、REINFORCE及监督微调
- 使用GSM8K训练集,评估涵盖9个中英文数学与STEM基准
- 采用LoRA微调(rank=128),每组8个生成样本,最大生成长度512 tokens
- 奖励函数包含格式奖励(0.1分)和正确性奖励(1分)
关键结果
- RGRA在27项任务中有17项优于GRPO,平均性能最高(如Qwen2.5-1.5B在Math-English上达38.3 vs GRPO的37.3)
- 仅使用正优势(GRPO-pos)导致训练不稳定,小模型(0.5B)出现奖励崩溃和响应长度骤减
- 直接使用REINFORCE(无优势估计)在1.5B模型上也发生崩溃,证明优势估计不可或缺
- RAFT表现最差,尤其在0.5B模型上平均准确率仅8.7(Math-English)
- RGRA在中文数学(CMATH/CN-Middle-School)和STEM任务上同样表现最佳
局限与风险
- 实验限于小型模型(≤1.5B参数),未验证在大模型上的可扩展性
- 训练数据仅来自GSM8K,可能影响方法在其他领域(如代码、逻辑推理)的泛化性
- 未探索不同KL系数或学习率对RGRA稳定性的影响
- 缺乏对推理 trace 质量的细粒度分析(如步骤正确性、冗余度)
适合沉淀的概念
group-relative-policy-optimization, reinforce-with-group-relative-advantage, advantage-estimation-in-llm-rl, ppo-clipping-unnecessary-for-llms, negative-feedback-in-reasoning-training, training-collapse-in-raft, lora-fine-tuning-for-math-llms, multilingual-math-benchmarks
阅读注意
- 重点关注第3.2节中的三种变体设计及其理论动机
- 图1展示了训练动态差异,是理解稳定性的关键
- 表1-3需横向比较RGRA与GRPO在各模型尺寸下的表现
- 注意作者如何定义‘推理行为涌现’(如Countdown数据集上的中间步骤重评估)
- 附录A提供了完整超参数,对复现至关重要
质量说明
- 采用来源:
raw,raw/papers/2026/03/2603.18756.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的实验设置、多维度评估结果和消融分析,数据充分支持结论。代码已公开,方法描述清晰,具备良好可复现性。