论文
arXiv2410.09918
时间2024-10
来源Markdown
页面质量中文卡片
阅读量级166 分钟

2410.09918

论文导读

提出 Dualformer,一种在训练时引入结构化推理轨迹丢弃策略的单 Transformer 模型,支持在推理时灵活切换快(直接输出解)、慢(输出推理链+解)或自动模式,在迷宫导航和数学推理任务上均优于基线模型。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Dualformer:通过随机化推理轨迹实现可控快慢思维

一句话定位

提出 Dualformer,一种在训练时引入结构化推理轨迹丢弃策略的单 Transformer 模型,支持在推理时灵活切换快(直接输出解)、慢(输出推理链+解)或自动模式,在迷宫导航和数学推理任务上均优于基线模型。

小学生也能听懂

这篇论文造了一个叫 Dualformer 的聪明模型,它像有两个大脑:一个快(直接猜答案),一个慢(仔细想步骤)。训练时故意藏起部分思考过程,让它学会灵活切换,解迷宫和数学题都比以前的方法更快更准,还能自动选最好的方式。

为什么值得记录

  • 首次在单一模型中无缝集成 System 1(快)和 System 2(慢)两种推理模式,无需额外控制器或多网络
  • 通过简单的数据层面干预(随机丢弃推理轨迹中的子句或代价信息)实现模式可控性,训练高效且易于复现
  • 在 30×30 迷宫任务中,慢模式下最优率达 97.6%,比 Searchformer 高 4.3%,且推理步数减少 45.5%
  • 快模式下最优率达 80%,远超仅训练解序列的 Solution-Only 模型(30%),证明其具备强泛化能力
  • 自动模式下以 96.6% 最优率和 59.9% 更少步数超越 Searchformer,同时生成更多样化的可行路径

核心方法

  • 基于 Searchformer 框架,使用 A* 算法生成完整搜索轨迹作为训练数据基础
  • 设计四级结构化轨迹丢弃策略:D1 丢弃 close 子句;D2 丢弃代价 token;D3 随机丢弃 30% create 子句;D4 丢弃整个轨迹
  • 训练时对每个样本按概率分布 Cat(p0=0.45, p1=p2=p3=1/6, p4=0.05) 随机选择丢弃级别,使模型学习从完整推理到直接求解的连续表示
  • 推理时通过添加控制 token('plan' 触发快模式,'create' 触发慢模式)实现模式切换,无控制 token 时为自动模式
  • 采用 encoder-decoder Transformer 架构(T5 编码器 + GPT 风格解码器),参数量分别为 15M(迷宫)和 46M(Sokoban)
  • 在数学推理任务中扩展至 LLM 微调(Llama-3.1-8B/Mistral-7B),使用 MATH 数据集并合成含中间步骤的数据

关键结果

  • 慢模式:在 30×30 迷宫上达到 97.6% 最优率(Searchformer 为 93.3%),平均推理步数减少 45.5%(854 vs 1538)
  • 快模式:在 30×30 迷宫上最优率达 80%,是 Solution-Only 模型(30%)的 2.67 倍,SWC 分数达 0.906(基线 0.5)
  • 自动模式:在 30×30 迷宫上最优率 96.6%,比 Searchformer 高 3.3%,步数减少 59.9%,多样性提升 3 倍以上
  • 生成路径多样性显著增强:在 25×25 迷宫上,Dualformer 平均生成 25.05 条唯一正确路径,而 Searchformer 仅 18.85 条
  • 数学任务微调 Llama-3.1-8B 后,在保持准确率的同时减少冗余推理步骤,验证方法可迁移性

局限与风险

  • 当前控制机制依赖预定义 token('plan'/'create'),未探索更自然的语言指令控制方式
  • 实验集中于路径规划和数学题,尚未验证在开放域对话或代码生成等复杂任务上的表现
  • 自动模式决策逻辑未显式建模,其‘自适应’行为源于训练分布而非内部置信度评估
  • 轨迹丢弃策略针对 A* 结构设计,其他推理形式(如树搜索、回溯)需重新设计丢弃规则

适合沉淀的概念

system-1-system-2-reasoning, structured-trace-dropping, controllable-generation, dual-process-transformer, randomized-reasoning-traces, searchformer-baseline, maze-navigation-task, llm-finetuning-math

阅读注意

  • 重点关注图 3.1 中四级丢弃策略的具体实现及其对模型行为的影响
  • 注意比较表 4.1–4.3 中不同模式下 SWC 和多样性指标的变化趋势
  • 附录 I 展示了 o1-preview 在相同迷宫任务上的失败案例,突显专用推理模型的优势
  • 训练效率提升(30h vs 36h)源于序列长度缩短,值得在资源受限时考虑
  • 概率分布调优过程见 4.1 节,不同任务采用不同 p 配置,说明需针对领域调整

质量说明

  • 采用来源:rawraw/papers/2024/10/2410.09918.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的方法描述、详尽的实验结果和开源链接,关键数据均有量化支撑,实验设计合理,结论可信。