---
title: "2604.07941"
title_zh: "大模型后训练的统一视角：离策略与在策略学习"
arxiv_id: "2604.07941"
paper_type: "survey"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.07941.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 大模型后训练的统一视角：离策略与在策略学习

## 一句话定位

提出以轨迹来源（离策略/在策略）为顶层组织轴，结合功能角色（支持扩展、策略重塑、行为巩固）的统一框架，系统梳理大模型后训练方法。

## 小学生也能听懂

这篇论文像搭积木一样，把训练大模型的各种方法按“数据来源”和“作用”重新分类，发现不同方法其实在做三件事：让模型学会新本领、优化已有本领、记住本领不忘记，并指出混合使用效果更好。

## 为什么值得记录

- 打破传统按目标家族（如SFT、DPO、RLHF）割裂讨论后训练方法的局限
- 提供诊断后训练瓶颈的新视角：是缺乏可达行为，还是已有状态下的决策不佳？
- 解释为何混合流水线（hybrid pipelines）优于单一方法，强调跨阶段协调设计的重要性
- 将蒸馏重新理解为行为巩固机制，而非仅是模型压缩
- 推动后训练从‘目标堆叠’向‘系统级行为干预设计’演进

## 核心方法

- 提出‘轨迹来源’（trajectory provenance）作为后训练分类的顶层标准：离策略（外部轨迹） vs 在策略（模型生成轨迹）
- 引入‘监督接口’（supervision interfaces）作为次级描述层，统一比较token目标、偏好、奖励、验证器反馈等信号形式
- 定义三种功能角色：有效支持扩展（使有用行为可达）、策略重塑（在可达区域内优化行为）、行为巩固（跨阶段/模型保留行为）
- 使用占用度量（occupancy measure）分析前缀可达性与状态-动作可用性，区分行为改进的层次
- 将混合流水线视为多阶段协调组合，而非独立范式
- 通过统一框架重新解读SFT、DPO、RLHF、RLVR、蒸馏等主流方法的行为作用
- 强调评估需超越端到端指标，关注阶段交接质量、支架移除后的行为保持等系统级问题

## 关键结果

- 构建了一个三层分析框架（轨迹来源 → 监督接口 → 功能角色），实现对后训练方法的统一解释
- 指出SFT既可用于支持扩展也可用于策略重塑，取决于数据与模型当前能力的关系
- 表明偏好优化多为离策略重塑，而在策略RL可在引导下实现支持扩展
- 论证蒸馏的核心作用是行为巩固，尤其在多阶段系统中
- 揭示当前评估体系缺陷：端到端分数无法反映行为是否真正被巩固或仅依赖支架
- 提出多个未解科学问题：如何量化支持扩展 vs 策略重塑？如何衡量跨阶段行为保真度？

## 局限与风险

- 框架偏重概念组织与解释，未提供可直接用于训练的新算法或损失函数
- 功能角色分类为分析性主导归类，实际方法可能兼具多重角色，边界非绝对
- 对‘有效支持’的操作化定义仍不完整，依赖pass@k等代理指标，缺乏细粒度状态-动作级测量
- 未深入探讨不同预训练基础模型对后训练阶段行为可塑性的影响
- 实验验证有限，主要基于文献分析与逻辑推演，缺乏系统性消融研究

## 适合沉淀的概念

`trajectory-provenance`, `off-policy-learning`, `on-policy-learning`, `effective-support-expansion`, `policy-reshaping`, `behavioral-consolidation`, `occupancy-measure`, `prefix-reachability`, `supervision-interface`, `hybrid-post-training-pipeline`, `stage-handoff-fidelity`, `support-attrition`

## 阅读注意

- 重点理解图1所示的三层框架结构及其交互关系
- 注意作者如何用‘占用度量’桥接序列生成与强化学习视角
- 关注第6节对混合流水线的合成分析，理解为何多阶段优于单阶段
- 思考第7节提出的开放问题，特别是关于瓶颈诊断与行为可迁移性的讨论
- 对比表1中本调查与其他综述在组织原则上的差异，体会其创新点

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.07941.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文为概念驱动型综述，材料完整，逻辑严密，引用充分，虽无新算法但提供了极具价值的统一分析框架。部分术语（如effective support）的操作化定义有待深化，但不影响整体贡献。
