2604.07941
论文导读
提出以轨迹来源(离策略/在策略)为顶层组织轴,结合功能角色(支持扩展、策略重塑、行为巩固)的统一框架,系统梳理大模型后训练方法。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
大模型后训练的统一视角:离策略与在策略学习
一句话定位
提出以轨迹来源(离策略/在策略)为顶层组织轴,结合功能角色(支持扩展、策略重塑、行为巩固)的统一框架,系统梳理大模型后训练方法。
小学生也能听懂
这篇论文像搭积木一样,把训练大模型的各种方法按“数据来源”和“作用”重新分类,发现不同方法其实在做三件事:让模型学会新本领、优化已有本领、记住本领不忘记,并指出混合使用效果更好。
为什么值得记录
- 打破传统按目标家族(如SFT、DPO、RLHF)割裂讨论后训练方法的局限
- 提供诊断后训练瓶颈的新视角:是缺乏可达行为,还是已有状态下的决策不佳?
- 解释为何混合流水线(hybrid pipelines)优于单一方法,强调跨阶段协调设计的重要性
- 将蒸馏重新理解为行为巩固机制,而非仅是模型压缩
- 推动后训练从‘目标堆叠’向‘系统级行为干预设计’演进
核心方法
- 提出‘轨迹来源’(trajectory provenance)作为后训练分类的顶层标准:离策略(外部轨迹) vs 在策略(模型生成轨迹)
- 引入‘监督接口’(supervision interfaces)作为次级描述层,统一比较token目标、偏好、奖励、验证器反馈等信号形式
- 定义三种功能角色:有效支持扩展(使有用行为可达)、策略重塑(在可达区域内优化行为)、行为巩固(跨阶段/模型保留行为)
- 使用占用度量(occupancy measure)分析前缀可达性与状态-动作可用性,区分行为改进的层次
- 将混合流水线视为多阶段协调组合,而非独立范式
- 通过统一框架重新解读SFT、DPO、RLHF、RLVR、蒸馏等主流方法的行为作用
- 强调评估需超越端到端指标,关注阶段交接质量、支架移除后的行为保持等系统级问题
关键结果
- 构建了一个三层分析框架(轨迹来源 → 监督接口 → 功能角色),实现对后训练方法的统一解释
- 指出SFT既可用于支持扩展也可用于策略重塑,取决于数据与模型当前能力的关系
- 表明偏好优化多为离策略重塑,而在策略RL可在引导下实现支持扩展
- 论证蒸馏的核心作用是行为巩固,尤其在多阶段系统中
- 揭示当前评估体系缺陷:端到端分数无法反映行为是否真正被巩固或仅依赖支架
- 提出多个未解科学问题:如何量化支持扩展 vs 策略重塑?如何衡量跨阶段行为保真度?
局限与风险
- 框架偏重概念组织与解释,未提供可直接用于训练的新算法或损失函数
- 功能角色分类为分析性主导归类,实际方法可能兼具多重角色,边界非绝对
- 对‘有效支持’的操作化定义仍不完整,依赖pass@k等代理指标,缺乏细粒度状态-动作级测量
- 未深入探讨不同预训练基础模型对后训练阶段行为可塑性的影响
- 实验验证有限,主要基于文献分析与逻辑推演,缺乏系统性消融研究
适合沉淀的概念
trajectory-provenance, off-policy-learning, on-policy-learning, effective-support-expansion, policy-reshaping, behavioral-consolidation, occupancy-measure, prefix-reachability, supervision-interface, hybrid-post-training-pipeline, stage-handoff-fidelity, support-attrition
阅读注意
- 重点理解图1所示的三层框架结构及其交互关系
- 注意作者如何用‘占用度量’桥接序列生成与强化学习视角
- 关注第6节对混合流水线的合成分析,理解为何多阶段优于单阶段
- 思考第7节提出的开放问题,特别是关于瓶颈诊断与行为可迁移性的讨论
- 对比表1中本调查与其他综述在组织原则上的差异,体会其创新点
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.07941.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文为概念驱动型综述,材料完整,逻辑严密,引用充分,虽无新算法但提供了极具价值的统一分析框架。部分术语(如effective support)的操作化定义有待深化,但不影响整体贡献。