---
title: ""
title_zh: "基于思维轨迹的检索增强生成提升推理任务性能"
arxiv_id: "2605.03344"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/05/2605.03344.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 基于思维轨迹的检索增强生成提升推理任务性能

## 一句话定位

提出使用思维轨迹（thinking traces）作为检索语料，并设计 T³ 方法将其转化为结构化表示，显著提升数学、代码和科学推理任务的表现。

## 小学生也能听懂

这篇论文说：以前我们用网页或教科书给AI查资料，但对解数学题这类需要推理的任务帮助不大。现在我们让AI去‘看别人是怎么一步步思考解题的’，哪怕只是中间思路，也能帮它自己更好地推理。我们还把这些思考过程整理得更清楚、更简短，让AI更容易用上。

## 为什么值得记录

- 挑战了‘RAG 对推理任务无效’的普遍假设，证明问题不在 RAG 本身，而在于检索内容的选择
- 首次系统性地将思维轨迹作为独立检索语料，并验证其跨模型迁移能力
- 提出 T³ 离线转换方法，将冗长原始轨迹转化为结构化、紧凑、诊断性表示，提升可用性与效率
- 在 AIME、LiveCodeBench、GPQA-Diamond 等高标准基准上实现显著性能增益（如 AIME 上 +56.3% 相对提升）
- RAG over T³ 不仅提升准确率，还能降低最高达 15% 的推理成本，优化成本-性能权衡

## 核心方法

- 构建思维轨迹语料库：使用 Gemini-2-thinking 和 QwQ-32B 等强推理模型在辅助问题集上生成原始思维轨迹（raw thinking traces）
- 提出 T³（Transformation of Thinking Traces）框架：离线将原始轨迹转换为三种结构化表示形式
- Structural Normalization（Struct）：保留步骤结构，重写为干净、规范的程序化 scaffold
- Semantic Distillation（Semantic）：提取核心思想与关键决策，去除低层细节，提供多层级抽象
- Reflection（Reflect）：以对比形式重写，聚焦常见错误、误导直觉与关键检查点，提供‘避坑指南’
- 采用标准 retrieve-then-generate 流水线：用 e5-base 检索 top-3 相关轨迹片段，拼接至查询输入下游求解模型
- 强调轨迹与评估集去污染（13-gram Jaccard 阈值），确保泛化性

## 关键结果

- 原始思维轨迹已显著有效：在 AIME 2025–2026 上，Gemini-2-thinking 轨迹使 Gemini-2.5-Flash 准确率从 53.3 提升至 80.0（+50.1%）
- T³ 转换进一步解锁增益：在 GPQA-Diamond 上，Reflect 转换使 GPT-OSS-120B 从 70.7 提升至 74.7（+5.7%）；在 LiveCodeBench 上从 57.9 提升至 61.4（+6.0%）
- 跨模型迁移成功：较弱思维/转换模型（如 Gemini-2-Flash-Lite）生成的轨迹可显著提升更强求解模型（如 GPT-5）
- 优于通用语料 RAG：在所有基准上，思维轨迹语料 consistently 超越 OpenWebMath、StackExchange、Wikipedia、GitHub、ArXiv 及 CompactDS 等通用检索源
- k=3 为最优检索文档数，平衡信息覆盖与噪声控制
- T³ 显著压缩轨迹长度（如 Gemini 轨迹从 1641 词降至 239–454 词），提升检索效率并降低输入成本

## 局限与风险

- 仅研究 vanilla RAG 设置，未探索迭代、自适应或推理时检索等复杂机制
- 轨迹语料高度偏向数学领域（>90%），可能限制在科学问答等领域的泛化能力
- 未完全解耦‘思考者’模型的影响，缺乏同一问题集由不同思考者生成轨迹的对照实验
- 依赖外部强模型生成轨迹，存在计算成本与模型可用性限制

## 适合沉淀的概念

`retrieval-augmented-generation`, `thinking-traces`, `reasoning-intensive-tasks`, `t3-transformation`, `structural-normalization`, `semantic-distillation`, `reflection-based-guidance`, `offline-trajectory-processing`, `cross-model-reasoning-transfer`

## 阅读注意

- 关注图 2 的案例：Reflect 转换如何帮助模型避免错误路径并成功求解
- 注意表 1 中不同语料在多个模型上的对比，尤其是思维轨迹 vs. 通用语料的系统性优势
- 查看附录 B 的语料统计：轨迹长度分布与领域分布对结果的影响
- 理解 T³ 的三种转换策略差异：Struct 重结构，Semantic 重抽象，Reflect 重纠错
- 思考‘为何更小的转换模型能有效改写强模型轨迹’——因转换是轻量重写，非生成新推理

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/05/2605.03344.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、结果表格与关键案例分析。虽部分中间结果被截断，但核心结论、数据与图表均完整呈现，足以支撑研究复现与理解。
