概念导读
*从维基百科表格出发的全开源长上下文推理数据管线 (2026-04)*
- 概要
- Overview
- Key Contribution
- Experimental Results
- Related
π²: 基于结构化数据的推理数据改善长上下文推理
从维基百科表格出发的全开源长上下文推理数据管线 (2026-04)
概要
π² (PI-SQUARED) 提出了一种从结构化维基百科表格出发的推理数据管线,通过 QA 策展与回翻译(back-translation)生成高质量长上下文推理训练数据,用于提升 LLM 在长文本分析推理任务上的表现。
Overview
π² 的核心思想是利用表格作为中间结构化表征,将多文档中的分散信息聚合后,合成多样化且有挑战性的推理场景。管线包含三个阶段:
- 表格收集与扩展:从 6,614 个维基百科页面中提取 2,834 张合格表格,并用 LLM 扩展新列引入外部知识。
- QA 生成与双路径验证:为每张表格生成多跳分析推理问题 + SQL 查询,再由独立 Python 实现交叉验证答案一致性。
- 推理轨迹回翻译:将已验证的 QA 对在压缩至 96K token 的上下文中回翻译为结构化推理步骤。
最终数据集包含 922 个训练样本和 228 个评测样本(π²-Bench)。
Key Contribution
- 结构化起源的推理数据管线:首个完整的长上下文推理数据管线,涵盖全局信息聚合 + 结构化分析推理。
- 双路径自动验证:SQL + Python 双计算路径验证答案正确性,确保 83% 样本无需人工修订。
- 自蒸馏可行性:模型可用自身推理轨迹进行自蒸馏,gpt-oss-20b 自蒸馏后平均性能提升 +4.4%。
- 开源数据与模型:代码、数据和模型全部开源。
Experimental Results
在 gpt-oss-20b 和 Qwen3-4B-Instruct-2507 上用 LoRA SFT 训练:
| 模型 | 配置 | LongSeal | LongBenchV2 | Oolong | OfficeQA | π²-Bench | 平均 |
|---|---|---|---|---|---|---|---|
| gpt-oss-20b | base (low) | 34.65 | 39.53 | 31.03 | 21.63 | 62.92 | 37.95 |
| gpt-oss-20b | SFT (low) | 38.19 | 46.05 | 33.31 | 26.53 | 67.05 | 42.23 |
| gpt-oss-20b | base (high) | 52.17 | 46.07 | 35.86 | 37.84 | 72.57 | 48.90 |
| gpt-oss-20b | SFT (high) | 64.00 | 46.32 | 31.95 | 46.58 | 77.27 | 53.22 |
| Qwen3-4B | base | 33.07 | 37.56 | 29.67 | 14.88 | 56.18 | 34.27 |
| Qwen3-4B | SFT | 40.94 | 39.25 | 35.48 | 13.58 | 55.62 | 36.97 |
- gpt-oss-20b 高推理强度下平均 +4.32 点提升
- 仅 100 个高质量样本即可带来 +2.85 点提升
- SFT 模型在某些基准上逼近或超过更大模型(gpt-oss-120b)
Related
- chain-of-thought — π² 生成的推理轨迹本质上是一种结构化 CoT
- reasoning-distillation — π² 支持自蒸馏:模型可用自身推理轨迹训练
- on-policy-distillation — 自蒸馏结果与 on-policy 蒸馏思路一致
- long-context — 核心目标:提升长上下文推理能力