2410.09918
论文导读
提出 Dualformer,一种在训练时引入结构化推理轨迹丢弃策略的单 Transformer 模型,支持在推理时灵活切换快(直接输出解)、慢(输出推理链+解)或自动模式,在迷宫导航和数学推理任务上均优于基线模型。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Dualformer:通过随机化推理轨迹实现可控快慢思维
一句话定位
提出 Dualformer,一种在训练时引入结构化推理轨迹丢弃策略的单 Transformer 模型,支持在推理时灵活切换快(直接输出解)、慢(输出推理链+解)或自动模式,在迷宫导航和数学推理任务上均优于基线模型。
小学生也能听懂
这篇论文造了一个叫 Dualformer 的聪明模型,它像有两个大脑:一个快(直接猜答案),一个慢(仔细想步骤)。训练时故意藏起部分思考过程,让它学会灵活切换,解迷宫和数学题都比以前的方法更快更准,还能自动选最好的方式。
为什么值得记录
- 首次在单一模型中无缝集成 System 1(快)和 System 2(慢)两种推理模式,无需额外控制器或多网络
- 通过简单的数据层面干预(随机丢弃推理轨迹中的子句或代价信息)实现模式可控性,训练高效且易于复现
- 在 30×30 迷宫任务中,慢模式下最优率达 97.6%,比 Searchformer 高 4.3%,且推理步数减少 45.5%
- 快模式下最优率达 80%,远超仅训练解序列的 Solution-Only 模型(30%),证明其具备强泛化能力
- 自动模式下以 96.6% 最优率和 59.9% 更少步数超越 Searchformer,同时生成更多样化的可行路径
核心方法
- 基于 Searchformer 框架,使用 A* 算法生成完整搜索轨迹作为训练数据基础
- 设计四级结构化轨迹丢弃策略:D1 丢弃 close 子句;D2 丢弃代价 token;D3 随机丢弃 30% create 子句;D4 丢弃整个轨迹
- 训练时对每个样本按概率分布 Cat(p0=0.45, p1=p2=p3=1/6, p4=0.05) 随机选择丢弃级别,使模型学习从完整推理到直接求解的连续表示
- 推理时通过添加控制 token('plan' 触发快模式,'create' 触发慢模式)实现模式切换,无控制 token 时为自动模式
- 采用 encoder-decoder Transformer 架构(T5 编码器 + GPT 风格解码器),参数量分别为 15M(迷宫)和 46M(Sokoban)
- 在数学推理任务中扩展至 LLM 微调(Llama-3.1-8B/Mistral-7B),使用 MATH 数据集并合成含中间步骤的数据
关键结果
- 慢模式:在 30×30 迷宫上达到 97.6% 最优率(Searchformer 为 93.3%),平均推理步数减少 45.5%(854 vs 1538)
- 快模式:在 30×30 迷宫上最优率达 80%,是 Solution-Only 模型(30%)的 2.67 倍,SWC 分数达 0.906(基线 0.5)
- 自动模式:在 30×30 迷宫上最优率 96.6%,比 Searchformer 高 3.3%,步数减少 59.9%,多样性提升 3 倍以上
- 生成路径多样性显著增强:在 25×25 迷宫上,Dualformer 平均生成 25.05 条唯一正确路径,而 Searchformer 仅 18.85 条
- 数学任务微调 Llama-3.1-8B 后,在保持准确率的同时减少冗余推理步骤,验证方法可迁移性
局限与风险
- 当前控制机制依赖预定义 token('plan'/'create'),未探索更自然的语言指令控制方式
- 实验集中于路径规划和数学题,尚未验证在开放域对话或代码生成等复杂任务上的表现
- 自动模式决策逻辑未显式建模,其‘自适应’行为源于训练分布而非内部置信度评估
- 轨迹丢弃策略针对 A* 结构设计,其他推理形式(如树搜索、回溯)需重新设计丢弃规则
适合沉淀的概念
system-1-system-2-reasoning, structured-trace-dropping, controllable-generation, dual-process-transformer, randomized-reasoning-traces, searchformer-baseline, maze-navigation-task, llm-finetuning-math
阅读注意
- 重点关注图 3.1 中四级丢弃策略的具体实现及其对模型行为的影响
- 注意比较表 4.1–4.3 中不同模式下 SWC 和多样性指标的变化趋势
- 附录 I 展示了 o1-preview 在相同迷宫任务上的失败案例,突显专用推理模型的优势
- 训练效率提升(30h vs 36h)源于序列长度缩短,值得在资源受限时考虑
- 概率分布调优过程见 4.1 节,不同任务采用不同 p 配置,说明需针对领域调整
质量说明
- 采用来源:
raw,raw/papers/2024/10/2410.09918.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的方法描述、详尽的实验结果和开源链接,关键数据均有量化支撑,实验设计合理,结论可信。