Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning
论文导读
本文通过提出因果重要性(CIR)和推理充分性(SR)两个新指标,系统分析强化学习从可验证奖励(RLVR)对推理链质量的影响,发现仅靠结果奖励不能保证推理的因果性或可验证性,但可通过SFT预训练或辅助奖励机制改善。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
结果奖励无法保证可验证或因果重要的推理
一句话定位
本文通过提出因果重要性(CIR)和推理充分性(SR)两个新指标,系统分析强化学习从可验证奖励(RLVR)对推理链质量的影响,发现仅靠结果奖励不能保证推理的因果性或可验证性,但可通过SFT预训练或辅助奖励机制改善。
小学生也能听懂
这篇论文像检查作业时不仅看答案对不对,还看解题步骤是不是真的有用。它发现,只奖励正确答案会让模型“抄近路”,不认真推理。于是提出新方法:先用老师示范的步骤教模型,再奖励它写出真正帮到解题的步骤,这样模型才会真正动脑筋。
为什么值得记录
- 挑战了当前大模型后训练中‘RLVR自动提升推理质量’的普遍假设
- 提出两个可量化推理链因果性和可验证性的新指标CIR与SR
- 证明在多数任务上RLVR虽提升准确率,却导致CIR/SR下降,说明模型可能未真正使用推理
- 提供两种有效改进方案:SFT预训练专家轨迹、在RLVR中加入CIR/SR作为辅助奖励
- 为构建可解释、可信赖的推理模型提供了评估框架和训练策略
核心方法
- 定义因果重要性(CIR):通过逐步截断推理链并比较答案分布变化,衡量推理对最终答案的实际影响
- 定义推理充分性(SR):利用外部验证器(gpt-4o-mini)判断仅凭推理是否能得出 unambiguous 答案,评估其自包含性
- 在Qwen2.5系列(1.5B/3B/7B)和Llama3.2-3B上开展RLVR实验,覆盖ReasoningGym中40个多样化任务
- 对比三种训练策略:纯RLVR、SFT+RLVR、带CIR/SR辅助奖励的RLVR
- 控制变量实验:比较有/无推理链训练的性能差异,验证推理是否真正被使用
- 使用o3-mini生成高质量专家推理轨迹用于SFT监督
关键结果
- 在40个任务中,19个任务CIR下降,17个SR下降;仅当准确率提升>50点时,CIR/SR才 reliably 提升
- 低CIR/SR任务上,无推理训练与有推理训练性能相当(平均差-0.053),表明模型未依赖推理
- SFT仅需少量(如64条)专家轨迹即可显著提升CIR(至~0.4)和SR(至~0.65),并延长后续RLVR收益
- 加入CIR或SR作为辅助奖励后,可在保持准确率的同时将CIR提升至0.5+,SR至0.7+
- 推理长度与CIR(ρ=0.7)和SR(ρ=0.59)显著正相关,高质量推理更具体、含计算步骤且词汇丰富
局限与风险
- 实验主要基于Qwen和Llama开源模型,结论在闭源模型(如o1)上的普适性待验证
- SR评估依赖API模型(gpt-4o-mini),虽验证一致性高,但仍存在黑盒偏差
- CIR/SR指标为代理度量,不能完全等价于人类理解的‘真实推理过程’
- SFT所需专家轨迹依赖o3-mini生成,成本较高,难以大规模应用
- 未探索其他RL算法(如PPO)或不同奖励塑形方式的影响
适合沉淀的概念
causal-importance-of-reasoning, sufficiency-of-reasoning, reinforcement-learning-from-verifiable-rewards, chain-of-thought-faithfulness, reasoning-verifiability, sft-before-rl, auxiliary-reward-design, reasoning-trace-quality
阅读注意
- 重点关注第3节对CIR和SR的形式化定义及其互补性解释
- 图2和图5揭示了RLVR下CIR/SR与准确率提升的非线性关系,是核心发现
- 第6节SFT实验表明‘少量高质量示范’即可改变模型推理模式
- 第7节辅助奖励实验证明无需专家数据也能提升推理质量,具有实用价值
- 附录F的质量分析(具体步骤、计算、词汇丰富度)为CIR/SR提供了语义层面的佐证
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.22074.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法、实验、附录和代码链接,数据充分,分析严谨,结论有支撑。