An Imperfect Verifier is Good Enough: Learning with Noisy Rewards
论文导读
该论文系统研究了强化学习可验证奖励(RLVR)中验证器噪声对模型训练的影响,发现中等程度噪声(≤15%)不会显著损害性能,且高精度比高召回更重要。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
不完美验证器已足够:基于噪声奖励的学习
一句话定位
该论文系统研究了强化学习可验证奖励(RLVR)中验证器噪声对模型训练的影响,发现中等程度噪声(≤15%)不会显著损害性能,且高精度比高召回更重要。
小学生也能听懂
这篇论文像教机器人做题时,发现即使批改老师偶尔出错(比如15%以内),只要少冤枉好答案,机器人照样能学得很好,甚至比完美批改时更不容易死记硬背。
为什么值得记录
- RLVR 是当前提升大语言模型推理能力的主流方法,但其依赖的验证器往往存在误差,本文首次系统量化了噪声容忍阈值。
- 结果表明,实践中无需追求完美验证器,适度精度(约85%)配合高精确率即可实现接近最优的训练效果,降低了 RLVR 在 semi-verifiable 域的应用门槛。
- 揭示了噪声可能通过正则化机制防止过拟合,甚至在某些情况下提升泛化性能,挑战了‘噪声必然有害’的传统认知。
- 为模型基验证器(LLM-as-a-Judge)的设计提供了明确指导:应优先优化精确率而非召回率,以减少误报带来的奖励误导。
核心方法
- 在代码生成(MBPP)和科学推理(GPQA)两个领域开展实验,使用 GRPO/GSPO 算法进行 RLVR 训练。
- 设计四种受控噪声注入模式:样本×测试项、样本×轨迹、组×测试项、组×轨迹,模拟不同粒度的验证错误。
- 引入模型基验证器(Qwen3 4B/30B)替代真实单元测试,以研究更现实的噪声分布。
- 所有实验均以无噪声基线为对照,并在训练后使用真实验证器评估模型性能,确保结果可比性。
- 通过 Ackley 函数优化实验,从优化 landscape 角度解释噪声为何有助于逃离局部极小值。
关键结果
- 在 MBPP 上,组级整轨迹噪声(group rollout noise)在 p ≤ 0.15 时,峰值验证准确率与无噪声基线差距小于 2 个百分点。
- Qwen3 8B 和 GLM4 9B 在 p=0.10 噪声下,最终检查点性能甚至略优于无噪声基线(如 GLM4: 0.895 vs 0.884),表明轻微噪声可能起正则化作用。
- 不同噪声类型(受控 vs 模型基)在相同错误率下表现相近,说明噪声结构影响较小,总量是关键因素。
- 在 GPQA 上,p=0.30 的组级噪声仍未导致性能下降(0.603 vs 基线 0.600),证明结论可推广至其他领域。
- 模型基验证器实验显示:Qwen3 30B 验证器(高精度)可达 0.871 验证奖励,接近基线 0.901;而 Qwen3 4B(低精度)仅达 0.704,且训练停滞,凸显精确率的重要性。
局限与风险
- 实验主要集中在 4B–9B 参数规模的模型(Qwen3, GLM4, Llama 3.1),更大模型或其他架构的鲁棒性尚待验证。
- 受控噪声假设对称错误率(FPR=FNR)且每轮重采样,未涵盖现实验证器常见的非对称或固定偏差。
- 未系统研究假阳性与假阴性独立变化的影响,限制了关于‘精确率优先’结论的普适性。
- 科学推理任务仅使用 GPQA,且奖励为二元,其噪声鲁棒性是否适用于多测试项任务仍需进一步验证。
适合沉淀的概念
reinforcement-learning-with-verifiable-rewards, noisy-rewards-in-rl, llm-as-a-judge, group-relative-policy-optimization, verifier-precision-vs-recall, noise-as-regularizer, flat-minima-generalization, reward-overoptimization
阅读注意
- 重点关注第5节结果和第6节讨论,尤其是图2、图3、表1和图5,它们直观展示了噪声鲁棒性和精确率的关键作用。
- 附录E.1提供了噪声有益性的理论背景,连接了SGD噪声、平坦极小值和PAC-Bayes理论,值得深入阅读。
- 注意作者对[xuTinyVReducingFalse2025]的回应(附录E.2),解释了为何其‘减少假阴性’的结论与本文‘提升精确率’不矛盾——因任务域和评估指标不同。
- 附录L的Ackley函数实验虽为简化模拟,但有效说明了噪声如何帮助逃离局部最优,是理解机制的重要补充。
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.07666.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含主文、附录、图表和详细实验设置,数据充分,分析深入,结论有坚实实验支撑。