论文
arXiv2604.23333
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级109 分钟

Process Supervision of Confidence Margin for Calibrated LLM Reasoning

论文导读

提出 RLCM 框架,通过中间推理步骤的置信度边际奖励实现校准感知的强化学习,在保持推理准确性的同时显著提升置信度可靠性。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

基于置信度边际的过程监督用于校准大语言模型推理

一句话定位

提出 RLCM 框架,通过中间推理步骤的置信度边际奖励实现校准感知的强化学习,在保持推理准确性的同时显著提升置信度可靠性。

小学生也能听懂

这篇论文教大模型在解题时不仅要知道答案对不对,还要学会判断自己“有多确定”。它给每一步推理打分,奖励那些能清楚区分“有把握”和“没把握”的模型,让答案更准的同时,自信程度也更真实可靠。

为什么值得记录

  • 传统结果导向的强化学习(如 GRPO)虽提升推理能力,但导致模型过度自信,置信度不可靠;
  • 现有校准方法多聚焦最终答案,缺乏对推理过程中置信度演化的细粒度监督;
  • RLCM 通过过程级边际奖励机制,使模型在中间步骤中区分可解与不可解状态,提升置信度表达能力;
  • 校准后的置信度可用于高效的风险控制(如 LTT)和置信度加权聚合,提升实际应用价值。

核心方法

  • 在推理轨迹的多个计算预算点截断,使用轻量级探针从隐藏状态预测当前前缀生成正确答案的概率;
  • 通过蒙特卡洛采样估计每个截断点的中间正确性(即强制生成答案后的准确率);
  • 将中间状态按正确性分为高潜力(≥0.5)和低潜力(<0.5)两组,定义置信度边际奖励为两组平均置信度之差;
  • 总奖励结合最终答案正确性奖励与边际奖励:R(y) = R_ans(y) + λ·R_margin(y);
  • 探针通过二元交叉熵损失训练,目标为软蒙特卡洛正确率,梯度不反向传播至策略模型;
  • 采用在线 RL 训练,探针与策略同步更新,确保信号与当前 rollout 分布匹配。

关键结果

  • 在 AIME24/25、MATH-500 等数学基准上,RLCM 在保持 GRPO 高准确率的同时,ECE 和 PCE 显著降低,实现最优帕累托权衡;
  • 在编码(LiveCodeBench)、科学(GPQA)和逻辑(LogiQA)等域外任务上,RLCM 在准确率和校准误差上均表现最佳;
  • 消融实验表明,过程级监督优于仅最终步监督,边际奖励优于 Brier 分数匹配,尤其在减少过度自信方面;
  • 置信度分布分析显示,RLCM 的置信度覆盖 [0,1] 区间更广,避免了 RLCR 的离散化和 C²GSPG 的高置信压缩问题;
  • 下游应用中,RLCM 支持更平滑的共形风险控制曲线,并在置信度加权投票中实现最大准确率提升(如从 62.7% 到 74.8%)。

局限与风险

  • 探针依赖强制生成答案的蒙特卡洛估计,可能引入噪声,且增加训练开销;
  • 边际奖励依赖于中间状态的二分划分(≥0.5),对阈值敏感,可能影响稳定性;
  • 实验主要在 7B 规模模型上进行,更大模型上的扩展性未验证;
  • 探针为简单 MLP,未探索更复杂的置信度建模结构。

适合沉淀的概念

reinforcement-learning-with-verifiable-rewards, process-reward-model, confidence-calibration, margin-based-learning, epistemic-uncertainty, conformal-prediction, confidence-weighted-aggregation, hidden-state-probing

阅读注意

  • 关注图 1 和图 4,理解 RLCM 在准确率-校准权衡上的优势;
  • 注意附录 C 对置信度分布的分析,解释为何 RLCR 和 C²GSPG 表现不佳;
  • 图 6 展示 LTT 风险控制效果,体现校准置信度的实际价值;
  • 表 2 的消融实验是关键,说明过程监督与边际奖励的各自贡献;
  • 附录 D 描述了强制生成答案的机制,是中间监督目标构建的核心。

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.23333.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法细节、实验设置、消融分析和下游应用,数据充分,结论可靠。