论文
arXiv2605.03344
时间2026-05
来源Markdown
页面质量中文卡片
阅读量级116 分钟

论文导读

提出使用思维轨迹(thinking traces)作为检索语料,并设计 T³ 方法将其转化为结构化表示,显著提升数学、代码和科学推理任务的表现。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

基于思维轨迹的检索增强生成提升推理任务性能

一句话定位

提出使用思维轨迹(thinking traces)作为检索语料,并设计 T³ 方法将其转化为结构化表示,显著提升数学、代码和科学推理任务的表现。

小学生也能听懂

这篇论文说:以前我们用网页或教科书给AI查资料,但对解数学题这类需要推理的任务帮助不大。现在我们让AI去‘看别人是怎么一步步思考解题的’,哪怕只是中间思路,也能帮它自己更好地推理。我们还把这些思考过程整理得更清楚、更简短,让AI更容易用上。

为什么值得记录

  • 挑战了‘RAG 对推理任务无效’的普遍假设,证明问题不在 RAG 本身,而在于检索内容的选择
  • 首次系统性地将思维轨迹作为独立检索语料,并验证其跨模型迁移能力
  • 提出 T³ 离线转换方法,将冗长原始轨迹转化为结构化、紧凑、诊断性表示,提升可用性与效率
  • 在 AIME、LiveCodeBench、GPQA-Diamond 等高标准基准上实现显著性能增益(如 AIME 上 +56.3% 相对提升)
  • RAG over T³ 不仅提升准确率,还能降低最高达 15% 的推理成本,优化成本-性能权衡

核心方法

  • 构建思维轨迹语料库:使用 Gemini-2-thinking 和 QwQ-32B 等强推理模型在辅助问题集上生成原始思维轨迹(raw thinking traces)
  • 提出 T³(Transformation of Thinking Traces)框架:离线将原始轨迹转换为三种结构化表示形式
  • Structural Normalization(Struct):保留步骤结构,重写为干净、规范的程序化 scaffold
  • Semantic Distillation(Semantic):提取核心思想与关键决策,去除低层细节,提供多层级抽象
  • Reflection(Reflect):以对比形式重写,聚焦常见错误、误导直觉与关键检查点,提供‘避坑指南’
  • 采用标准 retrieve-then-generate 流水线:用 e5-base 检索 top-3 相关轨迹片段,拼接至查询输入下游求解模型
  • 强调轨迹与评估集去污染(13-gram Jaccard 阈值),确保泛化性

关键结果

  • 原始思维轨迹已显著有效:在 AIME 2025–2026 上,Gemini-2-thinking 轨迹使 Gemini-2.5-Flash 准确率从 53.3 提升至 80.0(+50.1%)
  • T³ 转换进一步解锁增益:在 GPQA-Diamond 上,Reflect 转换使 GPT-OSS-120B 从 70.7 提升至 74.7(+5.7%);在 LiveCodeBench 上从 57.9 提升至 61.4(+6.0%)
  • 跨模型迁移成功:较弱思维/转换模型(如 Gemini-2-Flash-Lite)生成的轨迹可显著提升更强求解模型(如 GPT-5)
  • 优于通用语料 RAG:在所有基准上,思维轨迹语料 consistently 超越 OpenWebMath、StackExchange、Wikipedia、GitHub、ArXiv 及 CompactDS 等通用检索源
  • k=3 为最优检索文档数,平衡信息覆盖与噪声控制
  • T³ 显著压缩轨迹长度(如 Gemini 轨迹从 1641 词降至 239–454 词),提升检索效率并降低输入成本

局限与风险

  • 仅研究 vanilla RAG 设置,未探索迭代、自适应或推理时检索等复杂机制
  • 轨迹语料高度偏向数学领域(>90%),可能限制在科学问答等领域的泛化能力
  • 未完全解耦‘思考者’模型的影响,缺乏同一问题集由不同思考者生成轨迹的对照实验
  • 依赖外部强模型生成轨迹,存在计算成本与模型可用性限制

适合沉淀的概念

retrieval-augmented-generation, thinking-traces, reasoning-intensive-tasks, t3-transformation, structural-normalization, semantic-distillation, reflection-based-guidance, offline-trajectory-processing, cross-model-reasoning-transfer

阅读注意

  • 关注图 2 的案例:Reflect 转换如何帮助模型避免错误路径并成功求解
  • 注意表 1 中不同语料在多个模型上的对比,尤其是思维轨迹 vs. 通用语料的系统性优势
  • 查看附录 B 的语料统计:轨迹长度分布与领域分布对结果的影响
  • 理解 T³ 的三种转换策略差异:Struct 重结构,Semantic 重抽象,Reflect 重纠错
  • 思考‘为何更小的转换模型能有效改写强模型轨迹’——因转换是轻量重写,非生成新推理

质量说明

  • 采用来源:rawraw/papers/2026/05/2605.03344.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法细节、实验设置、结果表格与关键案例分析。虽部分中间结果被截断,但核心结论、数据与图表均完整呈现,足以支撑研究复现与理解。