---
title: "OPSDL: On-Policy Self-Distillation for Long-Context Language Models"
title_zh: "OPSDL：面向长上下文语言模型的在线自蒸馏方法"
arxiv_id: "2604.17535"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.17535.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# OPSDL：面向长上下文语言模型的在线自蒸馏方法

## 一句话定位

提出一种在线自蒸馏框架OPSDL，利用模型自身在短上下文上的强能力作为教师信号，通过逐点反向KL散度对长上下文生成进行逐令牌监督，提升长上下文建模效果且不损害短上下文性能。

## 小学生也能听懂

这篇论文教大模型用“短句子当老师”来学会读长文章：它让模型自己从短内容出题，再用长内容回答，并对比两种回答的差别来改进，就像照镜子练习，既提升了读长文的能力，又没忘记原来读短文的本领。

## 为什么值得记录

- 解决了现有长上下文训练方法依赖高质量标注数据或稀疏序列级奖励导致训练不稳定、样本效率低的问题
- 首次将模型自身的短上下文能力作为动态教师，实现无需外部监督或辅助模型的自对齐机制
- 在7B至32B参数规模的Qwen2.5模型上均取得显著性能提升，尤其在128K超长上下文场景下表现突出
- 相比Long-SFT和LongPO等方法，OPSDL在保持短上下文能力方面更具优势，平均性能下降仅约1.3个百分点

## 核心方法

- 构建三元组训练数据⟨CL, CS, Q⟩：从长文档中采样长上下文CL，提取核心短上下文CS，并基于CS由模型自动生成问题Q
- 采用在线策略生成响应：模型在长上下文CL下自回归生成完整回答y = {y₁,…,yₜ}
- 定义逐令牌优势函数Aₜ(yₜ) = log π_Teacher(yₜ|CS,Q,y<ₜ) − log π_θ(yₜ|CL,Q,y<ₜ)，其中教师与学生共享参数θ
- 优化策略梯度目标ℒ_PG(θ) = −𝔼[∑Aₜ(yₜ)·log π_θ(yₜ|CL,Q,y<ₜ)]，推动长上下文分布逼近短上下文锚点
- 整个过程无需人工标注、奖励模型或偏好对，实现完全自监督的端到端训练

## 关键结果

- 在RULER基准上，OPSDL在7B/14B/32B模型上分别将平均得分提升至86.32/90.90/93.36，显著优于Long-SFT和LongPO
- 在128K超长上下文任务中，OPSDL相比基础模型分别提升+48.70（7B）、+34.25（14B）、+30.29（32B）分
- 在LongBench V2真实长文档推理任务中，OPSDL整体得分达56.61（7B）、62.30（14B）、64.93（32B），超越所有可训练基线
- 与官方长上下文优化模型Qwen2.5-Instruct-1M相比，OPSDL将性能差距从13.10缩小至3.94（7B），从10.57缩小至3.28（14B）
- 短上下文能力保持良好：MMLU等通用基准平均仅下降1.3个百分点，MT-Bench几乎无变化

## 局限与风险

- 依赖高质量的长文档语料进行数据构造，若原始文档噪声过大可能影响短上下文提取质量
- 假设短上下文CS能完整覆盖问题Q所需证据，若信息分散则教师信号可能失效
- 未在更大规模（如70B以上）或非Qwen架构模型上验证泛化性
- 训练过程中需同时计算长短上下文的对数概率，显存开销约为标准SFT的两倍

## 适合沉淀的概念

`on-policy-self-distillation`, `long-context-modeling`, `reverse-kl-divergence`, `token-level-advantage`, `self-alignment`, `context-length-extrapolation`, `ruler-benchmark`, `longbench-v2`

## 阅读注意

- 注意OPSDL与LongPO的关键区别：前者使用逐令牌反向KL而非序列级DPO，且教师信号来自同一策略的短上下文输出
- 数据构造采用‘反向生成’策略：先抽短上下文再生成问题，确保问题可答性，避免分布偏移
- 优势函数Aₜ>0表示学生低估了教师认为正确的令牌，应加强；Aₜ<0则可能表示幻觉，需抑制
- 实验显示LongPO在14B/32B模型上无法收敛，凸显OPSDL训练稳定性优势
- 尽管未使用百万级token预训练，OPSDL仍接近Qwen2.5-Instruct-1M性能，说明其高效性

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.17535.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、算法流程、多模型多基准实验结果及消融分析，数据充分，结论可信。虽部分细节（如CS提取具体规则）未详述，但整体信息足以支持复现与评估。
