概念
reasoning data long-context dataset
创建2026-05-01
更新2026-05-01
阅读量级2 分钟
概念导读

*从维基百科表格出发的全开源长上下文推理数据管线 (2026-04)*

  1. 概要
  2. Overview
  3. Key Contribution
  4. Experimental Results
  5. Related

π²: 基于结构化数据的推理数据改善长上下文推理

从维基百科表格出发的全开源长上下文推理数据管线 (2026-04)

概要

π² (PI-SQUARED) 提出了一种从结构化维基百科表格出发的推理数据管线,通过 QA 策展与回翻译(back-translation)生成高质量长上下文推理训练数据,用于提升 LLM 在长文本分析推理任务上的表现。

Overview

π² 的核心思想是利用表格作为中间结构化表征,将多文档中的分散信息聚合后,合成多样化且有挑战性的推理场景。管线包含三个阶段:

  1. 表格收集与扩展:从 6,614 个维基百科页面中提取 2,834 张合格表格,并用 LLM 扩展新列引入外部知识。
  2. QA 生成与双路径验证:为每张表格生成多跳分析推理问题 + SQL 查询,再由独立 Python 实现交叉验证答案一致性。
  3. 推理轨迹回翻译:将已验证的 QA 对在压缩至 96K token 的上下文中回翻译为结构化推理步骤。

最终数据集包含 922 个训练样本和 228 个评测样本(π²-Bench)。

Key Contribution

  • 结构化起源的推理数据管线:首个完整的长上下文推理数据管线,涵盖全局信息聚合 + 结构化分析推理。
  • 双路径自动验证:SQL + Python 双计算路径验证答案正确性,确保 83% 样本无需人工修订。
  • 自蒸馏可行性:模型可用自身推理轨迹进行自蒸馏,gpt-oss-20b 自蒸馏后平均性能提升 +4.4%。
  • 开源数据与模型:代码、数据和模型全部开源。

Experimental Results

在 gpt-oss-20b 和 Qwen3-4B-Instruct-2507 上用 LoRA SFT 训练:

模型 配置 LongSeal LongBenchV2 Oolong OfficeQA π²-Bench 平均
gpt-oss-20b base (low) 34.65 39.53 31.03 21.63 62.92 37.95
gpt-oss-20b SFT (low) 38.19 46.05 33.31 26.53 67.05 42.23
gpt-oss-20b base (high) 52.17 46.07 35.86 37.84 72.57 48.90
gpt-oss-20b SFT (high) 64.00 46.32 31.95 46.58 77.27 53.22
Qwen3-4B base 33.07 37.56 29.67 14.88 56.18 34.27
Qwen3-4B SFT 40.94 39.25 35.48 13.58 55.62 36.97
  • gpt-oss-20b 高推理强度下平均 +4.32 点提升
  • 仅 100 个高质量样本即可带来 +2.85 点提升
  • SFT 模型在某些基准上逼近或超过更大模型(gpt-oss-120b)