---
title: "π²: Structure-Originated Reasoning Data Improves Long-Context Reasoning"
created: 2026-05-01
updated: 2026-05-01
type: concept
tags: [reasoning, data, long-context, dataset]
sources: [raw/papers/2026/04/2604.05114.md]
---

# π²: 基于结构化数据的推理数据改善长上下文推理

*从维基百科表格出发的全开源长上下文推理数据管线 (2026-04)*

## 概要

π² (PI-SQUARED) 提出了一种从结构化维基百科表格出发的推理数据管线，通过 QA 策展与回翻译（back-translation）生成高质量长上下文推理训练数据，用于提升 LLM 在长文本分析推理任务上的表现。

## Overview

π² 的核心思想是利用**表格作为中间结构化表征**，将多文档中的分散信息聚合后，合成多样化且有挑战性的推理场景。管线包含三个阶段：

1. **表格收集与扩展**：从 6,614 个维基百科页面中提取 2,834 张合格表格，并用 LLM 扩展新列引入外部知识。
2. **QA 生成与双路径验证**：为每张表格生成多跳分析推理问题 + SQL 查询，再由独立 Python 实现交叉验证答案一致性。
3. **推理轨迹回翻译**：将已验证的 QA 对在压缩至 96K token 的上下文中回翻译为结构化推理步骤。

最终数据集包含 922 个训练样本和 228 个评测样本（π²-Bench）。

## Key Contribution

- **结构化起源的推理数据管线**：首个完整的长上下文推理数据管线，涵盖全局信息聚合 + 结构化分析推理。
- **双路径自动验证**：SQL + Python 双计算路径验证答案正确性，确保 83% 样本无需人工修订。
- **自蒸馏可行性**：模型可用自身推理轨迹进行自蒸馏，gpt-oss-20b 自蒸馏后平均性能提升 +4.4%。
- **开源数据与模型**：代码、数据和模型全部开源。

## Experimental Results

在 gpt-oss-20b 和 Qwen3-4B-Instruct-2507 上用 LoRA SFT 训练：

| 模型 | 配置 | LongSeal | LongBenchV2 | Oolong | OfficeQA | π²-Bench | 平均 |
|------|------|----------|-------------|--------|----------|----------|------|
| gpt-oss-20b | base (low) | 34.65 | 39.53 | 31.03 | 21.63 | 62.92 | 37.95 |
| gpt-oss-20b | SFT (low) | 38.19 | 46.05 | 33.31 | 26.53 | 67.05 | **42.23** |
| gpt-oss-20b | base (high) | 52.17 | 46.07 | 35.86 | 37.84 | 72.57 | 48.90 |
| gpt-oss-20b | SFT (high) | 64.00 | 46.32 | 31.95 | 46.58 | 77.27 | **53.22** |
| Qwen3-4B | base | 33.07 | 37.56 | 29.67 | 14.88 | 56.18 | 34.27 |
| Qwen3-4B | SFT | 40.94 | 39.25 | 35.48 | 13.58 | 55.62 | **36.97** |

- gpt-oss-20b 高推理强度下平均 +4.32 点提升
- 仅 100 个高质量样本即可带来 +2.85 点提升
- SFT 模型在某些基准上逼近或超过更大模型（gpt-oss-120b）

## Related

- [[chain-of-thought]] — π² 生成的推理轨迹本质上是一种结构化 CoT
- [[reasoning-distillation]] — π² 支持自蒸馏：模型可用自身推理轨迹训练
- [[on-policy-distillation]] — 自蒸馏结果与 on-policy 蒸馏思路一致
- [[long-context]] — 核心目标：提升长上下文推理能力
