论文
arXiv2604.22074
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级108 分钟

Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning

论文导读

本文通过提出因果重要性(CIR)和推理充分性(SR)两个新指标,系统分析强化学习从可验证奖励(RLVR)对推理链质量的影响,发现仅靠结果奖励不能保证推理的因果性或可验证性,但可通过SFT预训练或辅助奖励机制改善。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

结果奖励无法保证可验证或因果重要的推理

一句话定位

本文通过提出因果重要性(CIR)和推理充分性(SR)两个新指标,系统分析强化学习从可验证奖励(RLVR)对推理链质量的影响,发现仅靠结果奖励不能保证推理的因果性或可验证性,但可通过SFT预训练或辅助奖励机制改善。

小学生也能听懂

这篇论文像检查作业时不仅看答案对不对,还看解题步骤是不是真的有用。它发现,只奖励正确答案会让模型“抄近路”,不认真推理。于是提出新方法:先用老师示范的步骤教模型,再奖励它写出真正帮到解题的步骤,这样模型才会真正动脑筋。

为什么值得记录

  • 挑战了当前大模型后训练中‘RLVR自动提升推理质量’的普遍假设
  • 提出两个可量化推理链因果性和可验证性的新指标CIR与SR
  • 证明在多数任务上RLVR虽提升准确率,却导致CIR/SR下降,说明模型可能未真正使用推理
  • 提供两种有效改进方案:SFT预训练专家轨迹、在RLVR中加入CIR/SR作为辅助奖励
  • 为构建可解释、可信赖的推理模型提供了评估框架和训练策略

核心方法

  • 定义因果重要性(CIR):通过逐步截断推理链并比较答案分布变化,衡量推理对最终答案的实际影响
  • 定义推理充分性(SR):利用外部验证器(gpt-4o-mini)判断仅凭推理是否能得出 unambiguous 答案,评估其自包含性
  • 在Qwen2.5系列(1.5B/3B/7B)和Llama3.2-3B上开展RLVR实验,覆盖ReasoningGym中40个多样化任务
  • 对比三种训练策略:纯RLVR、SFT+RLVR、带CIR/SR辅助奖励的RLVR
  • 控制变量实验:比较有/无推理链训练的性能差异,验证推理是否真正被使用
  • 使用o3-mini生成高质量专家推理轨迹用于SFT监督

关键结果

  • 在40个任务中,19个任务CIR下降,17个SR下降;仅当准确率提升>50点时,CIR/SR才 reliably 提升
  • 低CIR/SR任务上,无推理训练与有推理训练性能相当(平均差-0.053),表明模型未依赖推理
  • SFT仅需少量(如64条)专家轨迹即可显著提升CIR(至~0.4)和SR(至~0.65),并延长后续RLVR收益
  • 加入CIR或SR作为辅助奖励后,可在保持准确率的同时将CIR提升至0.5+,SR至0.7+
  • 推理长度与CIR(ρ=0.7)和SR(ρ=0.59)显著正相关,高质量推理更具体、含计算步骤且词汇丰富

局限与风险

  • 实验主要基于Qwen和Llama开源模型,结论在闭源模型(如o1)上的普适性待验证
  • SR评估依赖API模型(gpt-4o-mini),虽验证一致性高,但仍存在黑盒偏差
  • CIR/SR指标为代理度量,不能完全等价于人类理解的‘真实推理过程’
  • SFT所需专家轨迹依赖o3-mini生成,成本较高,难以大规模应用
  • 未探索其他RL算法(如PPO)或不同奖励塑形方式的影响

适合沉淀的概念

causal-importance-of-reasoning, sufficiency-of-reasoning, reinforcement-learning-from-verifiable-rewards, chain-of-thought-faithfulness, reasoning-verifiability, sft-before-rl, auxiliary-reward-design, reasoning-trace-quality

阅读注意

  • 重点关注第3节对CIR和SR的形式化定义及其互补性解释
  • 图2和图5揭示了RLVR下CIR/SR与准确率提升的非线性关系,是核心发现
  • 第6节SFT实验表明‘少量高质量示范’即可改变模型推理模式
  • 第7节辅助奖励实验证明无需专家数据也能提升推理质量,具有实用价值
  • 附录F的质量分析(具体步骤、计算、词汇丰富度)为CIR/SR提供了语义层面的佐证

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.22074.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法、实验、附录和代码链接,数据充分,分析严谨,结论有支撑。