---
title: "Process Supervision of Confidence Margin for Calibrated LLM Reasoning"
title_zh: "基于置信度边际的过程监督用于校准大语言模型推理"
arxiv_id: "2604.23333"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.23333.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 基于置信度边际的过程监督用于校准大语言模型推理

## 一句话定位

提出 RLCM 框架，通过中间推理步骤的置信度边际奖励实现校准感知的强化学习，在保持推理准确性的同时显著提升置信度可靠性。

## 小学生也能听懂

这篇论文教大模型在解题时不仅要知道答案对不对，还要学会判断自己“有多确定”。它给每一步推理打分，奖励那些能清楚区分“有把握”和“没把握”的模型，让答案更准的同时，自信程度也更真实可靠。

## 为什么值得记录

- 传统结果导向的强化学习（如 GRPO）虽提升推理能力，但导致模型过度自信，置信度不可靠；
- 现有校准方法多聚焦最终答案，缺乏对推理过程中置信度演化的细粒度监督；
- RLCM 通过过程级边际奖励机制，使模型在中间步骤中区分可解与不可解状态，提升置信度表达能力；
- 校准后的置信度可用于高效的风险控制（如 LTT）和置信度加权聚合，提升实际应用价值。

## 核心方法

- 在推理轨迹的多个计算预算点截断，使用轻量级探针从隐藏状态预测当前前缀生成正确答案的概率；
- 通过蒙特卡洛采样估计每个截断点的中间正确性（即强制生成答案后的准确率）；
- 将中间状态按正确性分为高潜力（≥0.5）和低潜力（<0.5）两组，定义置信度边际奖励为两组平均置信度之差；
- 总奖励结合最终答案正确性奖励与边际奖励：R(y) = R_ans(y) + λ·R_margin(y)；
- 探针通过二元交叉熵损失训练，目标为软蒙特卡洛正确率，梯度不反向传播至策略模型；
- 采用在线 RL 训练，探针与策略同步更新，确保信号与当前 rollout 分布匹配。

## 关键结果

- 在 AIME24/25、MATH-500 等数学基准上，RLCM 在保持 GRPO 高准确率的同时，ECE 和 PCE 显著降低，实现最优帕累托权衡；
- 在编码（LiveCodeBench）、科学（GPQA）和逻辑（LogiQA）等域外任务上，RLCM 在准确率和校准误差上均表现最佳；
- 消融实验表明，过程级监督优于仅最终步监督，边际奖励优于 Brier 分数匹配，尤其在减少过度自信方面；
- 置信度分布分析显示，RLCM 的置信度覆盖 [0,1] 区间更广，避免了 RLCR 的离散化和 C²GSPG 的高置信压缩问题；
- 下游应用中，RLCM 支持更平滑的共形风险控制曲线，并在置信度加权投票中实现最大准确率提升（如从 62.7% 到 74.8%）。

## 局限与风险

- 探针依赖强制生成答案的蒙特卡洛估计，可能引入噪声，且增加训练开销；
- 边际奖励依赖于中间状态的二分划分（≥0.5），对阈值敏感，可能影响稳定性；
- 实验主要在 7B 规模模型上进行，更大模型上的扩展性未验证；
- 探针为简单 MLP，未探索更复杂的置信度建模结构。

## 适合沉淀的概念

`reinforcement-learning-with-verifiable-rewards`, `process-reward-model`, `confidence-calibration`, `margin-based-learning`, `epistemic-uncertainty`, `conformal-prediction`, `confidence-weighted-aggregation`, `hidden-state-probing`

## 阅读注意

- 关注图 1 和图 4，理解 RLCM 在准确率-校准权衡上的优势；
- 注意附录 C 对置信度分布的分析，解释为何 RLCR 和 C²GSPG 表现不佳；
- 图 6 展示 LTT 风险控制效果，体现校准置信度的实际价值；
- 表 2 的消融实验是关键，说明过程监督与边际奖励的各自贡献；
- 附录 D 描述了强制生成答案的机制，是中间监督目标构建的核心。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.23333.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、消融分析和下游应用，数据充分，结论可靠。
