论文
arXiv2603.18756
时间2026-03
来源Markdown
页面质量中文卡片
阅读量级101 分钟

Are complicated loss functions necessary for teaching LLMs to reason?

论文导读

通过系统分析GRPO损失函数的组件,提出简化版RGRA方法,证明负反馈和优势估计关键,而PPO式裁剪非必需。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

复杂损失函数对LLM推理训练是否必要?

一句话定位

通过系统分析GRPO损失函数的组件,提出简化版RGRA方法,证明负反馈和优势估计关键,而PPO式裁剪非必需。

小学生也能听懂

这篇论文像做实验一样,把复杂的训练方法拆开来看,发现只要保留“答错了要扣分”和“比组里其他答案好才加分”这两个关键部分,去掉多余的复杂规则,就能让AI学数学更稳、更快,还更容易实现。

为什么值得记录

  • 揭示了GRPO中真正关键的组件:负反馈和组相对优势估计,而非PPO式约束
  • 提出RGRA方法,在多个数学基准上优于GRPO,且训练更稳定、实现更简单
  • 挑战了当前LLM后训练中过度依赖复杂RL算法的趋势,支持回归基础策略梯度方法
  • 为资源受限场景提供了高效替代方案,推动推理能力训练的透明化与可复现性

核心方法

  • 对GRPO进行组件级消融实验:分别移除负反馈(仅正优势)、PPO裁剪、优势估计
  • 提出RGRA(REINFORCE with Group Relative Advantage):保留组内相对优势估计,去除策略比率和clip机制
  • 在Qwen2.5-0.5B/1.5B和Llama3.2-1B模型上对比GRPO、RGRA、RAFT、REINFORCE及监督微调
  • 使用GSM8K训练集,评估涵盖9个中英文数学与STEM基准
  • 采用LoRA微调(rank=128),每组8个生成样本,最大生成长度512 tokens
  • 奖励函数包含格式奖励(0.1分)和正确性奖励(1分)

关键结果

  • RGRA在27项任务中有17项优于GRPO,平均性能最高(如Qwen2.5-1.5B在Math-English上达38.3 vs GRPO的37.3)
  • 仅使用正优势(GRPO-pos)导致训练不稳定,小模型(0.5B)出现奖励崩溃和响应长度骤减
  • 直接使用REINFORCE(无优势估计)在1.5B模型上也发生崩溃,证明优势估计不可或缺
  • RAFT表现最差,尤其在0.5B模型上平均准确率仅8.7(Math-English)
  • RGRA在中文数学(CMATH/CN-Middle-School)和STEM任务上同样表现最佳

局限与风险

  • 实验限于小型模型(≤1.5B参数),未验证在大模型上的可扩展性
  • 训练数据仅来自GSM8K,可能影响方法在其他领域(如代码、逻辑推理)的泛化性
  • 未探索不同KL系数或学习率对RGRA稳定性的影响
  • 缺乏对推理 trace 质量的细粒度分析(如步骤正确性、冗余度)

适合沉淀的概念

group-relative-policy-optimization, reinforce-with-group-relative-advantage, advantage-estimation-in-llm-rl, ppo-clipping-unnecessary-for-llms, negative-feedback-in-reasoning-training, training-collapse-in-raft, lora-fine-tuning-for-math-llms, multilingual-math-benchmarks

阅读注意

  • 重点关注第3.2节中的三种变体设计及其理论动机
  • 图1展示了训练动态差异,是理解稳定性的关键
  • 表1-3需横向比较RGRA与GRPO在各模型尺寸下的表现
  • 注意作者如何定义‘推理行为涌现’(如Countdown数据集上的中间步骤重评估)
  • 附录A提供了完整超参数,对复现至关重要

质量说明

  • 采用来源:rawraw/papers/2026/03/2603.18756.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的实验设置、多维度评估结果和消融分析,数据充分支持结论。代码已公开,方法描述清晰,具备良好可复现性。