---
title: "To Memorize or to Retrieve: Scaling Laws for RAG-Considerate Pretraining"
title_zh: "记忆还是检索：RAG 感知预训练的缩放律"
arxiv_id: "2604.00715"
paper_type: "analysis"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.00715.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 记忆还是检索：RAG 感知预训练的缩放律

## 一句话定位

该论文系统研究了在固定数据预算下，预训练数据量与检索库大小之间的权衡关系，提出三维缩放律模型，揭示检索在不同模型规模和任务类型下的边际效用变化。

## 小学生也能听懂

这篇论文像研究“背课本”和“查字典”哪个更划算：发现小模型查字典进步最大，大模型背熟后查字典帮助变小，还找到了两者最佳搭配的比例。

## 为什么值得记录

- 首次将预训练与检索视为同一数据预算下的竞争资源，建立联合优化框架
- 提出可量化的检索-预训练替代率（σ）和边际收益（κ），为系统设计提供决策依据
- 发现小模型和欠训练 regime 下检索效益最高，大模型趋于饱和后收益递减
- 验证了 perplexity 比 accuracy 更适合作为缩放律分析中的连续性能指标
- 开源代码与数据，支持后续研究复现与扩展

## 核心方法

- 使用 OLMo-2 架构训练 30M–3B 参数模型，基于 DCLM 数据（最多 100B tokens）
- 构建多尺度 FAISS 检索索引（1B–20B tokens），采用 Qwen3-Embedding-8B 编码，IVFPQ 索引算法
- 评估涵盖 10 个基准（AI2-ARC、HellaSwag、SciQ、Natural Questions 等），覆盖推理、科学问答和开放域 QA
- 采用 RAG-Evaluation-Harness 框架，固定 top-k=5 检索，上下文拼接后输入模型
- 以 perplexity 为主要指标，因其连续平滑特性更适合拟合缩放律
- 建立三维缩放律模型：L(N,D,R) = A(N/1e9)^(-α) + B(D/1e9)^(-β) - C log(1+ηR/1e9) + L₀
- 通过交叉验证（CV ARE）和留一模型外推（LOMO ARE）评估拟合质量

## 关键结果

- 检索在多数任务上带来持续但递减的性能提升，提升幅度高度依赖任务类型
- 存在跨模型尺度的统一交叉点：当预训练 token/参数比 > ~4.14 时，检索开始高效替代预训练（σ > 1）
- 小模型（如 30M）从检索中获益最大（κ 高），大模型（如 3B）边际收益显著下降
- 知识密集型任务（如 CommonsenseQA）σ 可达数百，而推理任务（如 PIQA、GSM8K）增益微弱甚至为负
- 查询增强（如加入答案选项或 gold answer）可提升检索效果，但不改变整体缩放趋势
- 三维缩放律在多数基准上拟合良好（CV ARE < 10%），但外推至未见模型规模时误差增大（LOMO ARE 更高）

## 局限与风险

- 检索设置简化：固定 chunking 策略、单一 retriever 和 top-k 协议，可能低估先进检索 pipeline 的潜力
- 未探索检索与预训练的联合训练机制（如 REALM、RETRO），仅测试训练后静态检索
- 评估集中于英文文本任务，未涵盖多模态或代码生成等场景
- perplexity 虽平滑但非最终应用指标，部分任务仍需 accuracy 等离散指标补充
- 实验未考虑推理延迟、内存开销等部署成本，仅聚焦性能-数据分配关系

## 适合沉淀的概念

`scaling-laws`, `retrieval-augmented-generation`, `parametric-vs-nonparametric-knowledge`, `data-budget-allocation`, `pretraining-retrieval-tradeoff`, `perplexity-as-scaling-metric`, `model-saturation`, `task-dependent-retrieval-efficiency`

## 阅读注意

- 重点关注图 3：左侧展示 σ 随预训练饱和度的增长趋势，右侧显示 κ 随模型增大而衰减
- 表 2 和表 8 对比对数与幂律检索项的拟合效果，说明对数形式参数更稳定
- 附录 A.8 定性分析揭示检索在事实锚定（fact anchoring）上的作用机制，而非完整推理支持
- 注意 σ 是乘性指标（用几何平均汇总），κ 是加性指标（用中位数汇总）
- 稳定性分析（图 6）显示推理任务拟合方差大，说明其缩放行为更复杂

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.00715.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含详细实验设置、多维度结果、稳健性检验和定性分析。方法描述清晰，数据与代码已开源，结论有充分实验支撑。
