论文
arXiv2604.07666
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级73 分钟

An Imperfect Verifier is Good Enough: Learning with Noisy Rewards

论文导读

该论文系统研究了强化学习可验证奖励(RLVR)中验证器噪声对模型训练的影响,发现中等程度噪声(≤15%)不会显著损害性能,且高精度比高召回更重要。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

不完美验证器已足够:基于噪声奖励的学习

一句话定位

该论文系统研究了强化学习可验证奖励(RLVR)中验证器噪声对模型训练的影响,发现中等程度噪声(≤15%)不会显著损害性能,且高精度比高召回更重要。

小学生也能听懂

这篇论文像教机器人做题时,发现即使批改老师偶尔出错(比如15%以内),只要少冤枉好答案,机器人照样能学得很好,甚至比完美批改时更不容易死记硬背。

为什么值得记录

  • RLVR 是当前提升大语言模型推理能力的主流方法,但其依赖的验证器往往存在误差,本文首次系统量化了噪声容忍阈值。
  • 结果表明,实践中无需追求完美验证器,适度精度(约85%)配合高精确率即可实现接近最优的训练效果,降低了 RLVR 在 semi-verifiable 域的应用门槛。
  • 揭示了噪声可能通过正则化机制防止过拟合,甚至在某些情况下提升泛化性能,挑战了‘噪声必然有害’的传统认知。
  • 为模型基验证器(LLM-as-a-Judge)的设计提供了明确指导:应优先优化精确率而非召回率,以减少误报带来的奖励误导。

核心方法

  • 在代码生成(MBPP)和科学推理(GPQA)两个领域开展实验,使用 GRPO/GSPO 算法进行 RLVR 训练。
  • 设计四种受控噪声注入模式:样本×测试项、样本×轨迹、组×测试项、组×轨迹,模拟不同粒度的验证错误。
  • 引入模型基验证器(Qwen3 4B/30B)替代真实单元测试,以研究更现实的噪声分布。
  • 所有实验均以无噪声基线为对照,并在训练后使用真实验证器评估模型性能,确保结果可比性。
  • 通过 Ackley 函数优化实验,从优化 landscape 角度解释噪声为何有助于逃离局部极小值。

关键结果

  • 在 MBPP 上,组级整轨迹噪声(group rollout noise)在 p ≤ 0.15 时,峰值验证准确率与无噪声基线差距小于 2 个百分点。
  • Qwen3 8B 和 GLM4 9B 在 p=0.10 噪声下,最终检查点性能甚至略优于无噪声基线(如 GLM4: 0.895 vs 0.884),表明轻微噪声可能起正则化作用。
  • 不同噪声类型(受控 vs 模型基)在相同错误率下表现相近,说明噪声结构影响较小,总量是关键因素。
  • 在 GPQA 上,p=0.30 的组级噪声仍未导致性能下降(0.603 vs 基线 0.600),证明结论可推广至其他领域。
  • 模型基验证器实验显示:Qwen3 30B 验证器(高精度)可达 0.871 验证奖励,接近基线 0.901;而 Qwen3 4B(低精度)仅达 0.704,且训练停滞,凸显精确率的重要性。

局限与风险

  • 实验主要集中在 4B–9B 参数规模的模型(Qwen3, GLM4, Llama 3.1),更大模型或其他架构的鲁棒性尚待验证。
  • 受控噪声假设对称错误率(FPR=FNR)且每轮重采样,未涵盖现实验证器常见的非对称或固定偏差。
  • 未系统研究假阳性与假阴性独立变化的影响,限制了关于‘精确率优先’结论的普适性。
  • 科学推理任务仅使用 GPQA,且奖励为二元,其噪声鲁棒性是否适用于多测试项任务仍需进一步验证。

适合沉淀的概念

reinforcement-learning-with-verifiable-rewards, noisy-rewards-in-rl, llm-as-a-judge, group-relative-policy-optimization, verifier-precision-vs-recall, noise-as-regularizer, flat-minima-generalization, reward-overoptimization

阅读注意

  • 重点关注第5节结果和第6节讨论,尤其是图2、图3、表1和图5,它们直观展示了噪声鲁棒性和精确率的关键作用。
  • 附录E.1提供了噪声有益性的理论背景,连接了SGD噪声、平坦极小值和PAC-Bayes理论,值得深入阅读。
  • 注意作者对[xuTinyVReducingFalse2025]的回应(附录E.2),解释了为何其‘减少假阴性’的结论与本文‘提升精确率’不矛盾——因任务域和评估指标不同。
  • 附录L的Ackley函数实验虽为简化模拟,但有效说明了噪声如何帮助逃离局部最优,是理解机制的重要补充。

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.07666.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含主文、附录、图表和详细实验设置,数据充分,分析深入,结论有坚实实验支撑。