论文导读
提出使用思维轨迹(thinking traces)作为检索语料,并设计 T³ 方法将其转化为结构化表示,显著提升数学、代码和科学推理任务的表现。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
基于思维轨迹的检索增强生成提升推理任务性能
一句话定位
提出使用思维轨迹(thinking traces)作为检索语料,并设计 T³ 方法将其转化为结构化表示,显著提升数学、代码和科学推理任务的表现。
小学生也能听懂
这篇论文说:以前我们用网页或教科书给AI查资料,但对解数学题这类需要推理的任务帮助不大。现在我们让AI去‘看别人是怎么一步步思考解题的’,哪怕只是中间思路,也能帮它自己更好地推理。我们还把这些思考过程整理得更清楚、更简短,让AI更容易用上。
为什么值得记录
- 挑战了‘RAG 对推理任务无效’的普遍假设,证明问题不在 RAG 本身,而在于检索内容的选择
- 首次系统性地将思维轨迹作为独立检索语料,并验证其跨模型迁移能力
- 提出 T³ 离线转换方法,将冗长原始轨迹转化为结构化、紧凑、诊断性表示,提升可用性与效率
- 在 AIME、LiveCodeBench、GPQA-Diamond 等高标准基准上实现显著性能增益(如 AIME 上 +56.3% 相对提升)
- RAG over T³ 不仅提升准确率,还能降低最高达 15% 的推理成本,优化成本-性能权衡
核心方法
- 构建思维轨迹语料库:使用 Gemini-2-thinking 和 QwQ-32B 等强推理模型在辅助问题集上生成原始思维轨迹(raw thinking traces)
- 提出 T³(Transformation of Thinking Traces)框架:离线将原始轨迹转换为三种结构化表示形式
- Structural Normalization(Struct):保留步骤结构,重写为干净、规范的程序化 scaffold
- Semantic Distillation(Semantic):提取核心思想与关键决策,去除低层细节,提供多层级抽象
- Reflection(Reflect):以对比形式重写,聚焦常见错误、误导直觉与关键检查点,提供‘避坑指南’
- 采用标准 retrieve-then-generate 流水线:用 e5-base 检索 top-3 相关轨迹片段,拼接至查询输入下游求解模型
- 强调轨迹与评估集去污染(13-gram Jaccard 阈值),确保泛化性
关键结果
- 原始思维轨迹已显著有效:在 AIME 2025–2026 上,Gemini-2-thinking 轨迹使 Gemini-2.5-Flash 准确率从 53.3 提升至 80.0(+50.1%)
- T³ 转换进一步解锁增益:在 GPQA-Diamond 上,Reflect 转换使 GPT-OSS-120B 从 70.7 提升至 74.7(+5.7%);在 LiveCodeBench 上从 57.9 提升至 61.4(+6.0%)
- 跨模型迁移成功:较弱思维/转换模型(如 Gemini-2-Flash-Lite)生成的轨迹可显著提升更强求解模型(如 GPT-5)
- 优于通用语料 RAG:在所有基准上,思维轨迹语料 consistently 超越 OpenWebMath、StackExchange、Wikipedia、GitHub、ArXiv 及 CompactDS 等通用检索源
- k=3 为最优检索文档数,平衡信息覆盖与噪声控制
- T³ 显著压缩轨迹长度(如 Gemini 轨迹从 1641 词降至 239–454 词),提升检索效率并降低输入成本
局限与风险
- 仅研究 vanilla RAG 设置,未探索迭代、自适应或推理时检索等复杂机制
- 轨迹语料高度偏向数学领域(>90%),可能限制在科学问答等领域的泛化能力
- 未完全解耦‘思考者’模型的影响,缺乏同一问题集由不同思考者生成轨迹的对照实验
- 依赖外部强模型生成轨迹,存在计算成本与模型可用性限制
适合沉淀的概念
retrieval-augmented-generation, thinking-traces, reasoning-intensive-tasks, t3-transformation, structural-normalization, semantic-distillation, reflection-based-guidance, offline-trajectory-processing, cross-model-reasoning-transfer
阅读注意
- 关注图 2 的案例:Reflect 转换如何帮助模型避免错误路径并成功求解
- 注意表 1 中不同语料在多个模型上的对比,尤其是思维轨迹 vs. 通用语料的系统性优势
- 查看附录 B 的语料统计:轨迹长度分布与领域分布对结果的影响
- 理解 T³ 的三种转换策略差异:Struct 重结构,Semantic 重抽象,Reflect 重纠错
- 思考‘为何更小的转换模型能有效改写强模型轨迹’——因转换是轻量重写,非生成新推理
质量说明
- 采用来源:
raw,raw/papers/2026/05/2605.03344.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法细节、实验设置、结果表格与关键案例分析。虽部分中间结果被截断,但核心结论、数据与图表均完整呈现,足以支撑研究复现与理解。