论文
arXiv2603.15957
时间2026-03
来源Markdown
页面质量中文卡片
阅读量级72 分钟

GASP: Guided Asymmetric Self-Play For Coding LLMs

论文导读

提出 GASP 方法,通过真实数据中的难题作为目标点(goalpost)引导非对称自博弈,生成渐进式课程,提升代码大模型在 LiveCodeBench 上的表现并解决部分原本无法解决的难题。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

GASP:面向代码大模型的引导式非对称自博弈

一句话定位

提出 GASP 方法,通过真实数据中的难题作为目标点(goalpost)引导非对称自博弈,生成渐进式课程,提升代码大模型在 LiveCodeBench 上的表现并解决部分原本无法解决的难题。

小学生也能听懂

这篇论文像给AI老师和学生搭了个“闯关游戏”:用真实难题当终点,AI老师先出简单题让学生练手,再慢慢变难,像搭台阶一样帮学生学会解原本不会的难题,成绩还比原来提高了。

为什么值得记录

  • 解决了现有非对称自博弈方法(如 AZR)目标无关、生成问题缺乏相关性的问题,通过引入真实数据中的硬问题作为目标点,使生成的问题更具信息量和下游价值。
  • 在 LiveCodeBench 上 pass@20 相比 AZR 提升 2.5%,并在更大 k 值下表现更优,验证了引导式自博弈的有效性。
  • 成功解决了 11 个原本所有基线都无法解决的 goalpost 难题,证明该方法能突破模型能力边界。
  • 展示了合成数据与真实数据联合训练(GASP + Real-data RL)的互补性,为后训练提供了新范式。
  • 通过拒绝采样和双阶段课程设计,提升了训练稳定性和样本效率。

核心方法

  • 基于 AZR 的非对称自博弈框架,教师模型生成问题,学生模型求解,共享参数。
  • 从 LiveCodeBench 训练集中筛选出 146 个 pass@100=0 的极难题目作为 goalpost 集合 H,用于引导教师。
  • 教师针对每个 goalpost h,首先生成一个更易的 lemma 问题 l0,要求其通过率 p ∈ [0.3, 0.7];再基于 l0 生成更难的 lift 问题 l1,形成渐进式课程。
  • 教师奖励采用广义可学习性奖励:lemma 奖励峰值在 p=0.5,lift 奖励峰值在 p=0.1,鼓励生成挑战性适中和更难的问题。
  • 难度调整沿两个轴进行:I/O 轴(输入输出复杂度)和 f 轴(算法复杂度),每次随机选择。
  • 引入拒绝采样机制,基于文本和代码嵌入的余弦相似度(阈值 0.95)过滤与已有缓冲区重复的提案,防止模式崩溃。
  • 学生训练使用可验证奖励(pass/fail),并随机将问题转换为归纳、演绎或溯因形式以增加多样性。

关键结果

  • 在 LCB^v5 上,GASP 的 pass@20 为 33.69±0.28,显著优于 AZR 的 31.15,提升 2.5%。
  • GASP + Real-data RL 的 pass@20 达到 34.46±0.34,优于单独的 GASP 和 Real-data RL,显示互补性。
  • GASP 成功解决了 11 个 goalpost 问题(共 146 个),而 AZR 和 Real-data RL 均未解决任何 goalpost。
  • 移除拒绝采样导致高方差和多样性崩溃,但训练步数更多时解决的 goalpost 更多(14 vs 11),表明拒绝采样提升样本效率。
  • 移除 I/O 难度轴导致目标点解决数下降(4 vs 11),表明输入输出多样性对课程有效性重要。
  • 单阶段课程(一步中/难)在 LCB 上表现不如两阶段,且一步难解决的 goalpost 更少(2 vs 11),表明 lemma 作为踏脚石的重要性。

局限与风险

  • 未显式验证 lemma/lift 问题是否真正对齐 goalpost 的底层概念,可能存在表面相似但概念偏离的问题。
  • 当前 LLM 在抽象任务概念和生成真正有信息量的难度递增方面仍有局限,常依赖添加约束等表面方式。
  • 仅使用 LCB 作为真实数据源,未来需扩展至更大代码语料库。
  • 采用固定 goalpost 集合,未实现动态更新,模型能力提升后引导可能失效。
  • goalpost 问题的解决具有间歇性,表明其处于能力边界,需更多机制巩固所学能力。

适合沉淀的概念

guided-asymmetric-self-play, goalpost-questions, lemma-lift-curriculum, learnability-reward, rejection-sampling, difficulty-axis, livecodebench, reinforcement-learning-with-verifiable-rewards

阅读注意

  • 重点关注 3.2 节 goalpost 的筛选流程,这是引导有效性的基础。
  • 图 2 和算法 1 概括了 GASP 的核心训练循环,需理解 lemma 和 lift 的生成与筛选逻辑。
  • 图 3 展示了教师奖励函数的设计,理解其如何引导生成不同难度的问题。
  • 表 2 和表 4 是核心结果,比较了不同方法在 LCB 和 goalpost 上的表现。
  • 附录 C 的消融实验(拒绝采样、难度轴、单阶段)对理解各组件贡献至关重要。

质量说明

  • 采用来源:rawraw/papers/2026/03/2603.15957.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、详细的实验设置、充分的消融分析和丰富的附录结果,包括超参数、额外实验和定性示例,信息完整,足以支持理解和复现。