---
title: "Self-Improving Pretraining: using post-trained models to pretrain better models"
title_zh: "自我改进预训练：利用后训练模型提升预训练效果"
arxiv_id: "2601.21343"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/01/2601.21343.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 自我改进预训练：利用后训练模型提升预训练效果

## 一句话定位

提出一种新型预训练范式 Self-Improving Pretraining，利用强后训练模型作为重写器和判别器，在预训练阶段通过强化学习引导策略模型生成更安全、真实且高质量的文本。

## 小学生也能听懂

这篇论文像让一个已经学会很多知识的大哥哥（后训练模型）教小弟弟（预训练模型）写作业：大哥哥帮小弟弟改错句子，并打分，小弟弟通过不断练习，越写越好，变得更安全、真实和聪明。

## 为什么值得记录

- 传统预训练与后训练分离导致安全、事实性等关键能力只能在后期添加，难以修正预训练阶段形成的错误模式
- 该方法将后训练模型的知识反馈至预训练过程，实现早期行为塑造，提升模型基础能力
- 在安全、事实性和生成质量上分别获得18.5%、36.2%相对提升和最高86.3%的胜率提升
- 支持从零预训练和持续预训练两种设置，验证了方法的可扩展性和实用性

## 核心方法

- 将预训练任务重构为前缀条件下的后缀生成任务（prefix-conditioned suffix generation），以128 token为块进行序列生成
- 使用已有强后训练模型（如Llama3.1-8B-Instruct或GPT-OSS-120B）作为Suffix Rewriter，对低质量或不安全后缀进行重写，保留原始前缀以维持输入分布
- 同一后训练模型作为Suffix Judge，评估候选生成（原始后缀、重写后缀、策略模型rollouts）在质量、安全性和事实性上的表现
- 采用在线DPO（Direct Preference Optimization）或RF-NLL（Reward-Filtered Negative Log-Likelihood）进行策略模型训练，利用Judge提供的偏好信号优化生成
- 训练初期依赖原始和重写后缀提供监督信号，随着模型能力提升，逐步增加对高质量rollouts的奖励
- 在安全实验中，对重写器进行GRPO微调，使其对安全后缀保持原样，对不安全后缀输出安全版本
- 在事实性任务中，使用带参考答案的判别提示，判断生成是否包含幻觉

## 关键结果

- 在持续预训练设置下，生成质量胜率最高达86.3%（vs 标准预训练基线49.0%），相对提升显著
- 事实性评估平均得分从44.0提升至57.6（+36.2%相对提升），安全性从76.9提升至91.1（+18.5%相对提升）
- 从零预训练中，生成质量胜率提升31.1%，安全性相对提升14.4%
- 增加rollouts数量（2→16）持续提升性能，表明更多候选生成有助于强化学习优化
- 使用完整两两比较（full pairwise comparisons）比单枢轴（pivot）方法在质量和事实性上分别高12.2%和1.2%

## 局限与风险

- 依赖高质量的外部后训练模型作为重写器和判别器，存在模型偏差传递风险
- 训练开销较大，需多次调用大模型进行重写和判断，计算成本高
- 重写器在安全任务中需专门微调以避免拒绝生成，通用性受限
- 当前实验主要在1.4B参数模型上进行，更大规模模型的效果待验证

## 适合沉淀的概念

`self-improving-pretraining`, `prefix-conditioned-suffix-generation`, `suffix-rewriter`, `suffix-judge`, `online-dpo`, `reward-filtered-nll`, `mid-training-reasoning`, `factuality-evaluation`, `safety-alignment`, `generation-quality`

## 阅读注意

- 注意区分Suffix Rewriter和Suffix Judge在不同任务中的角色差异：重写器用于数据增强，判别器用于提供RL奖励信号
- Figure 1 是理解整体流程的关键，展示了前缀-后缀分割、重写、rollout生成与Judge评分的完整闭环
- Table 17 显示rollouts数量对性能的影响，建议关注8→16时的边际收益变化
- Appendix A 中对不同Judge prompt版本的对比（v1-v5）揭示了评估严格度对事实性判断的显著影响，v4被选为平衡点
- Section 2 提出的Thinking Mid-training虽为另一方法，但与Self-Improving Pretraining共享‘利用后训练模型指导早期训练’的核心思想

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/01/2601.21343.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、消融研究和充分的结果分析。数据、模型和评估流程描述清晰，附录提供了关键提示模板和中间结果，支持复现与深入理解。
