Self-Improving Pretraining: using post-trained models to pretrain better models
论文导读
提出一种新型预训练范式 Self-Improving Pretraining,利用强后训练模型作为重写器和判别器,在预训练阶段通过强化学习引导策略模型生成更安全、真实且高质量的文本。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
自我改进预训练:利用后训练模型提升预训练效果
一句话定位
提出一种新型预训练范式 Self-Improving Pretraining,利用强后训练模型作为重写器和判别器,在预训练阶段通过强化学习引导策略模型生成更安全、真实且高质量的文本。
小学生也能听懂
这篇论文像让一个已经学会很多知识的大哥哥(后训练模型)教小弟弟(预训练模型)写作业:大哥哥帮小弟弟改错句子,并打分,小弟弟通过不断练习,越写越好,变得更安全、真实和聪明。
为什么值得记录
- 传统预训练与后训练分离导致安全、事实性等关键能力只能在后期添加,难以修正预训练阶段形成的错误模式
- 该方法将后训练模型的知识反馈至预训练过程,实现早期行为塑造,提升模型基础能力
- 在安全、事实性和生成质量上分别获得18.5%、36.2%相对提升和最高86.3%的胜率提升
- 支持从零预训练和持续预训练两种设置,验证了方法的可扩展性和实用性
核心方法
- 将预训练任务重构为前缀条件下的后缀生成任务(prefix-conditioned suffix generation),以128 token为块进行序列生成
- 使用已有强后训练模型(如Llama3.1-8B-Instruct或GPT-OSS-120B)作为Suffix Rewriter,对低质量或不安全后缀进行重写,保留原始前缀以维持输入分布
- 同一后训练模型作为Suffix Judge,评估候选生成(原始后缀、重写后缀、策略模型rollouts)在质量、安全性和事实性上的表现
- 采用在线DPO(Direct Preference Optimization)或RF-NLL(Reward-Filtered Negative Log-Likelihood)进行策略模型训练,利用Judge提供的偏好信号优化生成
- 训练初期依赖原始和重写后缀提供监督信号,随着模型能力提升,逐步增加对高质量rollouts的奖励
- 在安全实验中,对重写器进行GRPO微调,使其对安全后缀保持原样,对不安全后缀输出安全版本
- 在事实性任务中,使用带参考答案的判别提示,判断生成是否包含幻觉
关键结果
- 在持续预训练设置下,生成质量胜率最高达86.3%(vs 标准预训练基线49.0%),相对提升显著
- 事实性评估平均得分从44.0提升至57.6(+36.2%相对提升),安全性从76.9提升至91.1(+18.5%相对提升)
- 从零预训练中,生成质量胜率提升31.1%,安全性相对提升14.4%
- 增加rollouts数量(2→16)持续提升性能,表明更多候选生成有助于强化学习优化
- 使用完整两两比较(full pairwise comparisons)比单枢轴(pivot)方法在质量和事实性上分别高12.2%和1.2%
局限与风险
- 依赖高质量的外部后训练模型作为重写器和判别器,存在模型偏差传递风险
- 训练开销较大,需多次调用大模型进行重写和判断,计算成本高
- 重写器在安全任务中需专门微调以避免拒绝生成,通用性受限
- 当前实验主要在1.4B参数模型上进行,更大规模模型的效果待验证
适合沉淀的概念
self-improving-pretraining, prefix-conditioned-suffix-generation, suffix-rewriter, suffix-judge, online-dpo, reward-filtered-nll, mid-training-reasoning, factuality-evaluation, safety-alignment, generation-quality
阅读注意
- 注意区分Suffix Rewriter和Suffix Judge在不同任务中的角色差异:重写器用于数据增强,判别器用于提供RL奖励信号
- Figure 1 是理解整体流程的关键,展示了前缀-后缀分割、重写、rollout生成与Judge评分的完整闭环
- Table 17 显示rollouts数量对性能的影响,建议关注8→16时的边际收益变化
- Appendix A 中对不同Judge prompt版本的对比(v1-v5)揭示了评估严格度对事实性判断的显著影响,v4被选为平衡点
- Section 2 提出的Thinking Mid-training虽为另一方法,但与Self-Improving Pretraining共享‘利用后训练模型指导早期训练’的核心思想
质量说明
- 采用来源:
raw,raw/papers/2026/01/2601.21343.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法细节、实验设置、消融研究和充分的结果分析。数据、模型和评估流程描述清晰,附录提供了关键提示模板和中间结果,支持复现与深入理解。