---
title: "An Imperfect Verifier is Good Enough: Learning with Noisy Rewards"
title_zh: "不完美验证器已足够：基于噪声奖励的学习"
arxiv_id: "2604.07666"
paper_type: "analysis"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.07666.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 不完美验证器已足够：基于噪声奖励的学习

## 一句话定位

该论文系统研究了强化学习可验证奖励（RLVR）中验证器噪声对模型训练的影响，发现中等程度噪声（≤15%）不会显著损害性能，且高精度比高召回更重要。

## 小学生也能听懂

这篇论文像教机器人做题时，发现即使批改老师偶尔出错（比如15%以内），只要少冤枉好答案，机器人照样能学得很好，甚至比完美批改时更不容易死记硬背。

## 为什么值得记录

- RLVR 是当前提升大语言模型推理能力的主流方法，但其依赖的验证器往往存在误差，本文首次系统量化了噪声容忍阈值。
- 结果表明，实践中无需追求完美验证器，适度精度（约85%）配合高精确率即可实现接近最优的训练效果，降低了 RLVR 在 semi-verifiable 域的应用门槛。
- 揭示了噪声可能通过正则化机制防止过拟合，甚至在某些情况下提升泛化性能，挑战了‘噪声必然有害’的传统认知。
- 为模型基验证器（LLM-as-a-Judge）的设计提供了明确指导：应优先优化精确率而非召回率，以减少误报带来的奖励误导。

## 核心方法

- 在代码生成（MBPP）和科学推理（GPQA）两个领域开展实验，使用 GRPO/GSPO 算法进行 RLVR 训练。
- 设计四种受控噪声注入模式：样本×测试项、样本×轨迹、组×测试项、组×轨迹，模拟不同粒度的验证错误。
- 引入模型基验证器（Qwen3 4B/30B）替代真实单元测试，以研究更现实的噪声分布。
- 所有实验均以无噪声基线为对照，并在训练后使用真实验证器评估模型性能，确保结果可比性。
- 通过 Ackley 函数优化实验，从优化 landscape 角度解释噪声为何有助于逃离局部极小值。

## 关键结果

- 在 MBPP 上，组级整轨迹噪声（group rollout noise）在 p ≤ 0.15 时，峰值验证准确率与无噪声基线差距小于 2 个百分点。
- Qwen3 8B 和 GLM4 9B 在 p=0.10 噪声下，最终检查点性能甚至略优于无噪声基线（如 GLM4: 0.895 vs 0.884），表明轻微噪声可能起正则化作用。
- 不同噪声类型（受控 vs 模型基）在相同错误率下表现相近，说明噪声结构影响较小，总量是关键因素。
- 在 GPQA 上，p=0.30 的组级噪声仍未导致性能下降（0.603 vs 基线 0.600），证明结论可推广至其他领域。
- 模型基验证器实验显示：Qwen3 30B 验证器（高精度）可达 0.871 验证奖励，接近基线 0.901；而 Qwen3 4B（低精度）仅达 0.704，且训练停滞，凸显精确率的重要性。

## 局限与风险

- 实验主要集中在 4B–9B 参数规模的模型（Qwen3, GLM4, Llama 3.1），更大模型或其他架构的鲁棒性尚待验证。
- 受控噪声假设对称错误率（FPR=FNR）且每轮重采样，未涵盖现实验证器常见的非对称或固定偏差。
- 未系统研究假阳性与假阴性独立变化的影响，限制了关于‘精确率优先’结论的普适性。
- 科学推理任务仅使用 GPQA，且奖励为二元，其噪声鲁棒性是否适用于多测试项任务仍需进一步验证。

## 适合沉淀的概念

`reinforcement-learning-with-verifiable-rewards`, `noisy-rewards-in-rl`, `llm-as-a-judge`, `group-relative-policy-optimization`, `verifier-precision-vs-recall`, `noise-as-regularizer`, `flat-minima-generalization`, `reward-overoptimization`

## 阅读注意

- 重点关注第5节结果和第6节讨论，尤其是图2、图3、表1和图5，它们直观展示了噪声鲁棒性和精确率的关键作用。
- 附录E.1提供了噪声有益性的理论背景，连接了SGD噪声、平坦极小值和PAC-Bayes理论，值得深入阅读。
- 注意作者对[xuTinyVReducingFalse2025]的回应（附录E.2），解释了为何其‘减少假阴性’的结论与本文‘提升精确率’不矛盾——因任务域和评估指标不同。
- 附录L的Ackley函数实验虽为简化模拟，但有效说明了噪声如何帮助逃离局部最优，是理解机制的重要补充。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.07666.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含主文、附录、图表和详细实验设置，数据充分，分析深入，结论有坚实实验支撑。
