概要: PieceHint 提出了一种基于价值驱动的问题增强框架,通过识别推理中的关键瓶颈步骤、按问题难度分配提示、并渐进式撤回支架,使小模型(1.5B)在六项数学推理基准上达到与 32B 基线可比的平均性能,同时保持 pass@k 探索多样性。
- Overview
- Key Contributions
- Experimental Results
- Related
PieceHint: 面向强化学习的问题增强框架
概要: PieceHint 提出了一种基于价值驱动的问题增强框架,通过识别推理中的关键瓶颈步骤、按问题难度分配提示、并渐进式撤回支架,使小模型(1.5B)在六项数学推理基准上达到与 32B 基线可比的平均性能,同时保持 pass@k 探索多样性。
Overview
强化学习训练 LLM 推理能力面临一个基本困境:训练简单问题导致过拟合和 pass@k 退化,训练困难问题则奖励信号稀疏。现有问题增强方法(如 StepHint)通过在问题前附加部分解作为提示来弥合差距,但均匀提供提示可能引入冗余信息、遗漏关键瓶颈,且过度提示会降低推理多样性。
Key Contributions
- 方差驱动的问题选择: 两阶段筛选策略:
- 用弱模型过滤过易问题
-
用训练模型做能力对齐选择,保留中等成功率区间的问题——既有挑战性又可学习
-
价值驱动的瓶颈识别: 不按位置机械截断,而是用强 LLM 将标准解分解为推理片段(reasoning pieces),基于新颖性、难度、影响力三维评分,识别关键推理瓶颈。每个问题通常有 1-3 个高价值关键步骤。
-
分层提示分配: 根据问题难度分配初始提示预算——困难问题分配最大提示数 k_max,中等问题分配一半,简单问题不给提示。
-
渐进式撤回课程: 训练中逐步撤回提示,每次采样检查点移除价值最低的片段,确保模型最终学会独立推理。提示在经过 k(0) × N_check 次采样后完全撤回。
Experimental Results
- 主实验: 基于 OpenR1-Math-220K 数据集,在 6 项数学推理基准上评测
- PieceHint-Nemotron-1.5B: 平均准确率 62.6%,可比肩 DeepSeek-R1-Distill-32B(62.0%),参数量仅为后者的 1/20
- 在 AIME24 达到 54.5%,MATH500 达到 91.3%,AMC23 达到 89.1%
-
PieceHint-Qwen3-1.7B 和 PieceHint-DeepSeek-1.5B 分别达 59.2% 和 51.2%,均超越更大的 4B 基线
-
消融实验:
- 方差驱动选择优于硬问题选择和随机选择
- 价值驱动片段选择优于 50%/25% 前缀截断和随机选择
-
渐进式课程优于固定提示策略
-
Pass@k 分析: 保持所有 k 值的探索多样性,解决 RL 训练常见的 pass@k 退化问题
-
可扩展性: 在更大模型上同样有效;在代码生成任务上也取得正向结果
Related
- grpo — PieceHint 基于 GRPO 框架实现强化学习训练
- rl-post-training-scaling-laws — 展示了 RL 后训练的参数效率:1.5B 模型可匹敌 32B
- free-process-rewards — 价值驱动的片段评分与过程奖励的思路互补,都试图为中间推理步骤提供学习信号