论文
arXiv2601.21343
时间2026-01
来源Markdown
页面质量中文卡片
阅读量级138 分钟

Self-Improving Pretraining: using post-trained models to pretrain better models

论文导读

提出一种新型预训练范式 Self-Improving Pretraining,利用强后训练模型作为重写器和判别器,在预训练阶段通过强化学习引导策略模型生成更安全、真实且高质量的文本。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

自我改进预训练:利用后训练模型提升预训练效果

一句话定位

提出一种新型预训练范式 Self-Improving Pretraining,利用强后训练模型作为重写器和判别器,在预训练阶段通过强化学习引导策略模型生成更安全、真实且高质量的文本。

小学生也能听懂

这篇论文像让一个已经学会很多知识的大哥哥(后训练模型)教小弟弟(预训练模型)写作业:大哥哥帮小弟弟改错句子,并打分,小弟弟通过不断练习,越写越好,变得更安全、真实和聪明。

为什么值得记录

  • 传统预训练与后训练分离导致安全、事实性等关键能力只能在后期添加,难以修正预训练阶段形成的错误模式
  • 该方法将后训练模型的知识反馈至预训练过程,实现早期行为塑造,提升模型基础能力
  • 在安全、事实性和生成质量上分别获得18.5%、36.2%相对提升和最高86.3%的胜率提升
  • 支持从零预训练和持续预训练两种设置,验证了方法的可扩展性和实用性

核心方法

  • 将预训练任务重构为前缀条件下的后缀生成任务(prefix-conditioned suffix generation),以128 token为块进行序列生成
  • 使用已有强后训练模型(如Llama3.1-8B-Instruct或GPT-OSS-120B)作为Suffix Rewriter,对低质量或不安全后缀进行重写,保留原始前缀以维持输入分布
  • 同一后训练模型作为Suffix Judge,评估候选生成(原始后缀、重写后缀、策略模型rollouts)在质量、安全性和事实性上的表现
  • 采用在线DPO(Direct Preference Optimization)或RF-NLL(Reward-Filtered Negative Log-Likelihood)进行策略模型训练,利用Judge提供的偏好信号优化生成
  • 训练初期依赖原始和重写后缀提供监督信号,随着模型能力提升,逐步增加对高质量rollouts的奖励
  • 在安全实验中,对重写器进行GRPO微调,使其对安全后缀保持原样,对不安全后缀输出安全版本
  • 在事实性任务中,使用带参考答案的判别提示,判断生成是否包含幻觉

关键结果

  • 在持续预训练设置下,生成质量胜率最高达86.3%(vs 标准预训练基线49.0%),相对提升显著
  • 事实性评估平均得分从44.0提升至57.6(+36.2%相对提升),安全性从76.9提升至91.1(+18.5%相对提升)
  • 从零预训练中,生成质量胜率提升31.1%,安全性相对提升14.4%
  • 增加rollouts数量(2→16)持续提升性能,表明更多候选生成有助于强化学习优化
  • 使用完整两两比较(full pairwise comparisons)比单枢轴(pivot)方法在质量和事实性上分别高12.2%和1.2%

局限与风险

  • 依赖高质量的外部后训练模型作为重写器和判别器,存在模型偏差传递风险
  • 训练开销较大,需多次调用大模型进行重写和判断,计算成本高
  • 重写器在安全任务中需专门微调以避免拒绝生成,通用性受限
  • 当前实验主要在1.4B参数模型上进行,更大规模模型的效果待验证

适合沉淀的概念

self-improving-pretraining, prefix-conditioned-suffix-generation, suffix-rewriter, suffix-judge, online-dpo, reward-filtered-nll, mid-training-reasoning, factuality-evaluation, safety-alignment, generation-quality

阅读注意

  • 注意区分Suffix Rewriter和Suffix Judge在不同任务中的角色差异:重写器用于数据增强,判别器用于提供RL奖励信号
  • Figure 1 是理解整体流程的关键,展示了前缀-后缀分割、重写、rollout生成与Judge评分的完整闭环
  • Table 17 显示rollouts数量对性能的影响,建议关注8→16时的边际收益变化
  • Appendix A 中对不同Judge prompt版本的对比(v1-v5)揭示了评估严格度对事实性判断的显著影响,v4被选为平衡点
  • Section 2 提出的Thinking Mid-training虽为另一方法,但与Self-Improving Pretraining共享‘利用后训练模型指导早期训练’的核心思想

质量说明

  • 采用来源:rawraw/papers/2026/01/2601.21343.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法细节、实验设置、消融研究和充分的结果分析。数据、模型和评估流程描述清晰,附录提供了关键提示模板和中间结果,支持复现与深入理解。