---
title: "GASP: Guided Asymmetric Self-Play For Coding LLMs"
title_zh: "GASP：面向代码大模型的引导式非对称自博弈"
arxiv_id: "2603.15957"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/03/2603.15957.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# GASP：面向代码大模型的引导式非对称自博弈

## 一句话定位

提出 GASP 方法，通过真实数据中的难题作为目标点（goalpost）引导非对称自博弈，生成渐进式课程，提升代码大模型在 LiveCodeBench 上的表现并解决部分原本无法解决的难题。

## 小学生也能听懂

这篇论文像给AI老师和学生搭了个“闯关游戏”：用真实难题当终点，AI老师先出简单题让学生练手，再慢慢变难，像搭台阶一样帮学生学会解原本不会的难题，成绩还比原来提高了。

## 为什么值得记录

- 解决了现有非对称自博弈方法（如 AZR）目标无关、生成问题缺乏相关性的问题，通过引入真实数据中的硬问题作为目标点，使生成的问题更具信息量和下游价值。
- 在 LiveCodeBench 上 pass@20 相比 AZR 提升 2.5%，并在更大 k 值下表现更优，验证了引导式自博弈的有效性。
- 成功解决了 11 个原本所有基线都无法解决的 goalpost 难题，证明该方法能突破模型能力边界。
- 展示了合成数据与真实数据联合训练（GASP + Real-data RL）的互补性，为后训练提供了新范式。
- 通过拒绝采样和双阶段课程设计，提升了训练稳定性和样本效率。

## 核心方法

- 基于 AZR 的非对称自博弈框架，教师模型生成问题，学生模型求解，共享参数。
- 从 LiveCodeBench 训练集中筛选出 146 个 pass@100=0 的极难题目作为 goalpost 集合 H，用于引导教师。
- 教师针对每个 goalpost h，首先生成一个更易的 lemma 问题 l0，要求其通过率 p ∈ [0.3, 0.7]；再基于 l0 生成更难的 lift 问题 l1，形成渐进式课程。
- 教师奖励采用广义可学习性奖励：lemma 奖励峰值在 p=0.5，lift 奖励峰值在 p=0.1，鼓励生成挑战性适中和更难的问题。
- 难度调整沿两个轴进行：I/O 轴（输入输出复杂度）和 f 轴（算法复杂度），每次随机选择。
- 引入拒绝采样机制，基于文本和代码嵌入的余弦相似度（阈值 0.95）过滤与已有缓冲区重复的提案，防止模式崩溃。
- 学生训练使用可验证奖励（pass/fail），并随机将问题转换为归纳、演绎或溯因形式以增加多样性。

## 关键结果

- 在 LCB^v5 上，GASP 的 pass@20 为 33.69±0.28，显著优于 AZR 的 31.15，提升 2.5%。
- GASP + Real-data RL 的 pass@20 达到 34.46±0.34，优于单独的 GASP 和 Real-data RL，显示互补性。
- GASP 成功解决了 11 个 goalpost 问题（共 146 个），而 AZR 和 Real-data RL 均未解决任何 goalpost。
- 移除拒绝采样导致高方差和多样性崩溃，但训练步数更多时解决的 goalpost 更多（14 vs 11），表明拒绝采样提升样本效率。
- 移除 I/O 难度轴导致目标点解决数下降（4 vs 11），表明输入输出多样性对课程有效性重要。
- 单阶段课程（一步中/难）在 LCB 上表现不如两阶段，且一步难解决的 goalpost 更少（2 vs 11），表明 lemma 作为踏脚石的重要性。

## 局限与风险

- 未显式验证 lemma/lift 问题是否真正对齐 goalpost 的底层概念，可能存在表面相似但概念偏离的问题。
- 当前 LLM 在抽象任务概念和生成真正有信息量的难度递增方面仍有局限，常依赖添加约束等表面方式。
- 仅使用 LCB 作为真实数据源，未来需扩展至更大代码语料库。
- 采用固定 goalpost 集合，未实现动态更新，模型能力提升后引导可能失效。
- goalpost 问题的解决具有间歇性，表明其处于能力边界，需更多机制巩固所学能力。

## 适合沉淀的概念

`guided-asymmetric-self-play`, `goalpost-questions`, `lemma-lift-curriculum`, `learnability-reward`, `rejection-sampling`, `difficulty-axis`, `livecodebench`, `reinforcement-learning-with-verifiable-rewards`

## 阅读注意

- 重点关注 3.2 节 goalpost 的筛选流程，这是引导有效性的基础。
- 图 2 和算法 1 概括了 GASP 的核心训练循环，需理解 lemma 和 lift 的生成与筛选逻辑。
- 图 3 展示了教师奖励函数的设计，理解其如何引导生成不同难度的问题。
- 表 2 和表 4 是核心结果，比较了不同方法在 LCB 和 goalpost 上的表现。
- 附录 C 的消融实验（拒绝采样、难度轴、单阶段）对理解各组件贡献至关重要。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/03/2603.15957.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、详细的实验设置、充分的消融分析和丰富的附录结果，包括超参数、额外实验和定性示例，信息完整，足以支持理解和复现。
