---
title: 'PieceHint: Question Augmentation Framework for RL'
created: 2026-05-01
updated: 2026-05-01
type: concept
tags:
- rl
- data-augmentation
- reward
sources:
- raw/papers/2026/04/2604.15830.md
---

# PieceHint: 面向强化学习的问题增强框架

**概要**: PieceHint 提出了一种基于价值驱动的问题增强框架，通过识别推理中的关键瓶颈步骤、按问题难度分配提示、并渐进式撤回支架，使小模型（1.5B）在六项数学推理基准上达到与 32B 基线可比的平均性能，同时保持 pass@k 探索多样性。

## Overview

强化学习训练 LLM 推理能力面临一个基本困境：训练简单问题导致过拟合和 pass@k 退化，训练困难问题则奖励信号稀疏。现有问题增强方法（如 StepHint）通过在问题前附加部分解作为提示来弥合差距，但均匀提供提示可能引入冗余信息、遗漏关键瓶颈，且过度提示会降低推理多样性。

## Key Contributions

1. **方差驱动的问题选择**: 两阶段筛选策略：
   - 用弱模型过滤过易问题
   - 用训练模型做能力对齐选择，保留中等成功率区间的问题——既有挑战性又可学习

2. **价值驱动的瓶颈识别**: 不按位置机械截断，而是用强 LLM 将标准解分解为推理片段（reasoning pieces），基于新颖性、难度、影响力三维评分，识别关键推理瓶颈。每个问题通常有 1-3 个高价值关键步骤。

3. **分层提示分配**: 根据问题难度分配初始提示预算——困难问题分配最大提示数 k_max，中等问题分配一半，简单问题不给提示。

4. **渐进式撤回课程**: 训练中逐步撤回提示，每次采样检查点移除价值最低的片段，确保模型最终学会独立推理。提示在经过 k(0) × N_check 次采样后完全撤回。

## Experimental Results

- **主实验**: 基于 OpenR1-Math-220K 数据集，在 6 项数学推理基准上评测
  - **PieceHint-Nemotron-1.5B**: 平均准确率 62.6%，可比肩 DeepSeek-R1-Distill-32B（62.0%），参数量仅为后者的 1/20
  - 在 AIME24 达到 54.5%，MATH500 达到 91.3%，AMC23 达到 89.1%
  - PieceHint-Qwen3-1.7B 和 PieceHint-DeepSeek-1.5B 分别达 59.2% 和 51.2%，均超越更大的 4B 基线

- **消融实验**:
  - 方差驱动选择优于硬问题选择和随机选择
  - 价值驱动片段选择优于 50%/25% 前缀截断和随机选择
  - 渐进式课程优于固定提示策略

- **Pass@k 分析**: 保持所有 k 值的探索多样性，解决 RL 训练常见的 pass@k 退化问题

- **可扩展性**: 在更大模型上同样有效；在代码生成任务上也取得正向结果

## Related

- [[grpo]] — PieceHint 基于 GRPO 框架实现强化学习训练
- [[rl-post-training-scaling-laws]] — 展示了 RL 后训练的参数效率：1.5B 模型可匹敌 32B
- [[free-process-rewards]] — 价值驱动的片段评分与过程奖励的思路互补，都试图为中间推理步骤提供学习信号
