---
title: "Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning"
title_zh: "结果奖励无法保证可验证或因果重要的推理"
arxiv_id: "2604.22074"
paper_type: "analysis"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.22074.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 结果奖励无法保证可验证或因果重要的推理

## 一句话定位

本文通过提出因果重要性（CIR）和推理充分性（SR）两个新指标，系统分析强化学习从可验证奖励（RLVR）对推理链质量的影响，发现仅靠结果奖励不能保证推理的因果性或可验证性，但可通过SFT预训练或辅助奖励机制改善。

## 小学生也能听懂

这篇论文像检查作业时不仅看答案对不对，还看解题步骤是不是真的有用。它发现，只奖励正确答案会让模型“抄近路”，不认真推理。于是提出新方法：先用老师示范的步骤教模型，再奖励它写出真正帮到解题的步骤，这样模型才会真正动脑筋。

## 为什么值得记录

- 挑战了当前大模型后训练中‘RLVR自动提升推理质量’的普遍假设
- 提出两个可量化推理链因果性和可验证性的新指标CIR与SR
- 证明在多数任务上RLVR虽提升准确率，却导致CIR/SR下降，说明模型可能未真正使用推理
- 提供两种有效改进方案：SFT预训练专家轨迹、在RLVR中加入CIR/SR作为辅助奖励
- 为构建可解释、可信赖的推理模型提供了评估框架和训练策略

## 核心方法

- 定义因果重要性（CIR）：通过逐步截断推理链并比较答案分布变化，衡量推理对最终答案的实际影响
- 定义推理充分性（SR）：利用外部验证器（gpt-4o-mini）判断仅凭推理是否能得出 unambiguous 答案，评估其自包含性
- 在Qwen2.5系列（1.5B/3B/7B）和Llama3.2-3B上开展RLVR实验，覆盖ReasoningGym中40个多样化任务
- 对比三种训练策略：纯RLVR、SFT+RLVR、带CIR/SR辅助奖励的RLVR
- 控制变量实验：比较有/无推理链训练的性能差异，验证推理是否真正被使用
- 使用o3-mini生成高质量专家推理轨迹用于SFT监督

## 关键结果

- 在40个任务中，19个任务CIR下降，17个SR下降；仅当准确率提升>50点时，CIR/SR才 reliably 提升
- 低CIR/SR任务上，无推理训练与有推理训练性能相当（平均差-0.053），表明模型未依赖推理
- SFT仅需少量（如64条）专家轨迹即可显著提升CIR（至~0.4）和SR（至~0.65），并延长后续RLVR收益
- 加入CIR或SR作为辅助奖励后，可在保持准确率的同时将CIR提升至0.5+，SR至0.7+
- 推理长度与CIR（ρ=0.7）和SR（ρ=0.59）显著正相关，高质量推理更具体、含计算步骤且词汇丰富

## 局限与风险

- 实验主要基于Qwen和Llama开源模型，结论在闭源模型（如o1）上的普适性待验证
- SR评估依赖API模型（gpt-4o-mini），虽验证一致性高，但仍存在黑盒偏差
- CIR/SR指标为代理度量，不能完全等价于人类理解的‘真实推理过程’
- SFT所需专家轨迹依赖o3-mini生成，成本较高，难以大规模应用
- 未探索其他RL算法（如PPO）或不同奖励塑形方式的影响

## 适合沉淀的概念

`causal-importance-of-reasoning`, `sufficiency-of-reasoning`, `reinforcement-learning-from-verifiable-rewards`, `chain-of-thought-faithfulness`, `reasoning-verifiability`, `sft-before-rl`, `auxiliary-reward-design`, `reasoning-trace-quality`

## 阅读注意

- 重点关注第3节对CIR和SR的形式化定义及其互补性解释
- 图2和图5揭示了RLVR下CIR/SR与准确率提升的非线性关系，是核心发现
- 第6节SFT实验表明‘少量高质量示范’即可改变模型推理模式
- 第7节辅助奖励实验证明无需专家数据也能提升推理质量，具有实用价值
- 附录F的质量分析（具体步骤、计算、词汇丰富度）为CIR/SR提供了语义层面的佐证

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.22074.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法、实验、附录和代码链接，数据充分，分析严谨，结论有支撑。
