---
title: "Are complicated loss functions necessary for teaching LLMs to reason?"
title_zh: "复杂损失函数对LLM推理训练是否必要？"
arxiv_id: "2603.18756"
paper_type: "analysis"
source_kind: "raw"
raw_path: "raw/papers/2026/03/2603.18756.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 复杂损失函数对LLM推理训练是否必要？

## 一句话定位

通过系统分析GRPO损失函数的组件，提出简化版RGRA方法，证明负反馈和优势估计关键，而PPO式裁剪非必需。

## 小学生也能听懂

这篇论文像做实验一样，把复杂的训练方法拆开来看，发现只要保留“答错了要扣分”和“比组里其他答案好才加分”这两个关键部分，去掉多余的复杂规则，就能让AI学数学更稳、更快，还更容易实现。

## 为什么值得记录

- 揭示了GRPO中真正关键的组件：负反馈和组相对优势估计，而非PPO式约束
- 提出RGRA方法，在多个数学基准上优于GRPO，且训练更稳定、实现更简单
- 挑战了当前LLM后训练中过度依赖复杂RL算法的趋势，支持回归基础策略梯度方法
- 为资源受限场景提供了高效替代方案，推动推理能力训练的透明化与可复现性

## 核心方法

- 对GRPO进行组件级消融实验：分别移除负反馈（仅正优势）、PPO裁剪、优势估计
- 提出RGRA（REINFORCE with Group Relative Advantage）：保留组内相对优势估计，去除策略比率和clip机制
- 在Qwen2.5-0.5B/1.5B和Llama3.2-1B模型上对比GRPO、RGRA、RAFT、REINFORCE及监督微调
- 使用GSM8K训练集，评估涵盖9个中英文数学与STEM基准
- 采用LoRA微调（rank=128），每组8个生成样本，最大生成长度512 tokens
- 奖励函数包含格式奖励（0.1分）和正确性奖励（1分）

## 关键结果

- RGRA在27项任务中有17项优于GRPO，平均性能最高（如Qwen2.5-1.5B在Math-English上达38.3 vs GRPO的37.3）
- 仅使用正优势（GRPO-pos）导致训练不稳定，小模型（0.5B）出现奖励崩溃和响应长度骤减
- 直接使用REINFORCE（无优势估计）在1.5B模型上也发生崩溃，证明优势估计不可或缺
- RAFT表现最差，尤其在0.5B模型上平均准确率仅8.7（Math-English）
- RGRA在中文数学（CMATH/CN-Middle-School）和STEM任务上同样表现最佳

## 局限与风险

- 实验限于小型模型（≤1.5B参数），未验证在大模型上的可扩展性
- 训练数据仅来自GSM8K，可能影响方法在其他领域（如代码、逻辑推理）的泛化性
- 未探索不同KL系数或学习率对RGRA稳定性的影响
- 缺乏对推理 trace 质量的细粒度分析（如步骤正确性、冗余度）

## 适合沉淀的概念

`group-relative-policy-optimization`, `reinforce-with-group-relative-advantage`, `advantage-estimation-in-llm-rl`, `ppo-clipping-unnecessary-for-llms`, `negative-feedback-in-reasoning-training`, `training-collapse-in-raft`, `lora-fine-tuning-for-math-llms`, `multilingual-math-benchmarks`

## 阅读注意

- 重点关注第3.2节中的三种变体设计及其理论动机
- 图1展示了训练动态差异，是理解稳定性的关键
- 表1-3需横向比较RGRA与GRPO在各模型尺寸下的表现
- 注意作者如何定义‘推理行为涌现’（如Countdown数据集上的中间步骤重评估）
- 附录A提供了完整超参数，对复现至关重要

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/03/2603.18756.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、多维度评估结果和消融分析，数据充分支持结论。代码已公开，方法描述清晰，具备良好可复现性。
