---
title: "WRAP++: Web Discovery Amplified Pretraining"
title_zh: "WRAP++：基于网页拓扑关系的跨文档联合问答预训练数据增强"
arxiv_id: "2604.06829"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.06829.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# WRAP++：基于网页拓扑关系的跨文档联合问答预训练数据增强

## 一句话定位

WRAP++ 通过从维基百科超链接中发现双链和共提关系，合成跨文档联合问答数据，显著提升大模型在 SimpleQA 上的知识可恢复性。

## 小学生也能听懂

这篇论文像用维基百科的“超链接地图”找关系紧密的两页，再用AI编出需要同时看两页才能回答的问题，让大模型学会跨文档找答案，效果比老方法好很多。

## 为什么值得记录

- 突破单文档合成范式瓶颈：传统方法受限于单文档内事实提取，无法建模跨文档关联知识。
- 利用网页拓扑结构实现高质量配对：基于双链（A↔B）和共提（A→E←B 且 A→B）关系发现语义强相关的文档对，避免随机配对导致的虚假关联。
- 数据规模放大近10倍：在相同8.4B词元的 Wikipedia 语料上，WRAP++ 生成80B词元合成数据，远超单文档方法的5.4–17.4B词元上限。
- 显著提升知识密集型任务性能：在 OLMo-3-7B 和 32B 模型上，WRAP++ 在 SimpleQA pass@128 上分别比最佳单文档基线高5.4和6.1个百分点。
- 支持无缝融入中期训练流程：将6B词元 WRAP++ 数据加入 OLMo-3 的100B词元中期训练，SimpleQA 性能提升2.9点，通用能力保持稳定。

## 核心方法

- 图抽象建模：将 Wikipedia 文档及其超链接构建为有向图 G=(V,E)，顶点代表文档，边代表引用关系。
- 拓扑关系发现：识别两类高置信度关系模式——双链（相互引用）和共提（两文档均引用同一中心实体且彼此引用）。
- 联合问答合成：使用 Qwen3-30B-A3B-Instruct 模型，基于结构化提示对发现的文档对生成 QA，强制满足三项约束：跨文档依赖、显式事实链、全知内化（禁止上下文归因）。
- 合成质量控制：通过 prompt 工程确保问题必须依赖双文档信息才能回答，答案需展示多跳推理路径，并以绝对事实形式输出。
- 数据放大机制：利用关系组合爆炸特性，从固定源语料生成远超单文档方法的数据量（82.7B vs ~17.4B 词元）。
- 训练设置：在 OLMo-3 第1阶段 checkpoint 上继续预训练1个 epoch，评估采用5-shot in-context learning 和 pass@128 指标。

## 关键结果

- 在 OLMo-3-7B 上，WRAP++ 达到 49.13% pass@128，显著优于 WRAP (39.55%) 和 Extended WRAP (43.69%)。
- 在 OLMo-3-32B 上，WRAP++ 达到 53.97% pass@128，同样大幅领先所有单文档基线。
- 在8B词元匹配预算下，WRAP++ 仍优于 Extended WRAP（+2.48 pp），证明其单位词元质量优势。
- 训练动态显示 WRAP++ 在80B词元内无饱和迹象，而单文档方法早期即达性能瓶颈。
- 消融实验证实拓扑发现（vs 随机配对）、联合 QA 格式（vs 文档拼接）和大规模合成模型均对性能至关重要。
- 三文档共提扩展（加入桥接页 E）反而轻微损害性能，说明双文档输入更聚焦。

## 局限与风险

- 依赖高质量超链接结构：当前实现基于 Wikipedia，推广至通用网页需处理噪声链接和稀疏连接问题。
- 合成模型成本较高：使用30B+参数模型生成数据，虽可通过小模型替代降低成本，但会牺牲部分质量。
- 评估集中于事实性任务：主要验证在 SimpleQA 等知识密集型 benchmark 上的效果，对推理、代码等任务影响需进一步研究。
- 未探索更多关系类型：目前仅使用双链和共提两种 motif，未来可引入更复杂的图结构模式。

## 适合沉淀的概念

`cross-document-synthesis`, `topological-relation-discovery`, `dual-link-motif`, `co-mention-motif`, `joint-qa-synthesis`, `knowledge-recoverability`, `synthetic-data-amplification`, `web-hyperlink-graph`

## 阅读注意

- 重点关注 §2.2 中双链与共提关系的定义及其语义含义，这是保证合成质量的核心。
- 注意 §2.3 中三项合成约束（跨文档依赖、显式事实链、全知内化）如何防止模型退化为浅层摘要或上下文依赖。
- 图2和图3揭示了 WRAP++ 的 scaling 优势：单文档方法存在数据耗尽瓶颈，而 WRAP++ 可持续扩展。
- 表2的消融实验验证了每个组件的必要性，尤其是随机配对性能下降说明拓扑发现不可替代。
- 附录H提供了合成数据的详细统计，包括长度分布和关系类型占比，有助于理解数据特性。

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.06829.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、消融分析、数据规模和统计信息，结果可复现性强，方法描述清晰，无明显信息缺失。
