---
title: "2410.09918"
title_zh: "Dualformer：通过随机化推理轨迹实现可控快慢思维"
arxiv_id: "2410.09918"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2024/10/2410.09918.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Dualformer：通过随机化推理轨迹实现可控快慢思维

## 一句话定位

提出 Dualformer，一种在训练时引入结构化推理轨迹丢弃策略的单 Transformer 模型，支持在推理时灵活切换快（直接输出解）、慢（输出推理链+解）或自动模式，在迷宫导航和数学推理任务上均优于基线模型。

## 小学生也能听懂

这篇论文造了一个叫 Dualformer 的聪明模型，它像有两个大脑：一个快（直接猜答案），一个慢（仔细想步骤）。训练时故意藏起部分思考过程，让它学会灵活切换，解迷宫和数学题都比以前的方法更快更准，还能自动选最好的方式。

## 为什么值得记录

- 首次在单一模型中无缝集成 System 1（快）和 System 2（慢）两种推理模式，无需额外控制器或多网络
- 通过简单的数据层面干预（随机丢弃推理轨迹中的子句或代价信息）实现模式可控性，训练高效且易于复现
- 在 30×30 迷宫任务中，慢模式下最优率达 97.6%，比 Searchformer 高 4.3%，且推理步数减少 45.5%
- 快模式下最优率达 80%，远超仅训练解序列的 Solution-Only 模型（30%），证明其具备强泛化能力
- 自动模式下以 96.6% 最优率和 59.9% 更少步数超越 Searchformer，同时生成更多样化的可行路径

## 核心方法

- 基于 Searchformer 框架，使用 A* 算法生成完整搜索轨迹作为训练数据基础
- 设计四级结构化轨迹丢弃策略：D1 丢弃 close 子句；D2 丢弃代价 token；D3 随机丢弃 30% create 子句；D4 丢弃整个轨迹
- 训练时对每个样本按概率分布 Cat(p0=0.45, p1=p2=p3=1/6, p4=0.05) 随机选择丢弃级别，使模型学习从完整推理到直接求解的连续表示
- 推理时通过添加控制 token（'plan' 触发快模式，'create' 触发慢模式）实现模式切换，无控制 token 时为自动模式
- 采用 encoder-decoder Transformer 架构（T5 编码器 + GPT 风格解码器），参数量分别为 15M（迷宫）和 46M（Sokoban）
- 在数学推理任务中扩展至 LLM 微调（Llama-3.1-8B/Mistral-7B），使用 MATH 数据集并合成含中间步骤的数据

## 关键结果

- 慢模式：在 30×30 迷宫上达到 97.6% 最优率（Searchformer 为 93.3%），平均推理步数减少 45.5%（854 vs 1538）
- 快模式：在 30×30 迷宫上最优率达 80%，是 Solution-Only 模型（30%）的 2.67 倍，SWC 分数达 0.906（基线 0.5）
- 自动模式：在 30×30 迷宫上最优率 96.6%，比 Searchformer 高 3.3%，步数减少 59.9%，多样性提升 3 倍以上
- 生成路径多样性显著增强：在 25×25 迷宫上，Dualformer 平均生成 25.05 条唯一正确路径，而 Searchformer 仅 18.85 条
- 数学任务微调 Llama-3.1-8B 后，在保持准确率的同时减少冗余推理步骤，验证方法可迁移性

## 局限与风险

- 当前控制机制依赖预定义 token（'plan'/'create'），未探索更自然的语言指令控制方式
- 实验集中于路径规划和数学题，尚未验证在开放域对话或代码生成等复杂任务上的表现
- 自动模式决策逻辑未显式建模，其‘自适应’行为源于训练分布而非内部置信度评估
- 轨迹丢弃策略针对 A* 结构设计，其他推理形式（如树搜索、回溯）需重新设计丢弃规则

## 适合沉淀的概念

`system-1-system-2-reasoning`, `structured-trace-dropping`, `controllable-generation`, `dual-process-transformer`, `randomized-reasoning-traces`, `searchformer-baseline`, `maze-navigation-task`, `llm-finetuning-math`

## 阅读注意

- 重点关注图 3.1 中四级丢弃策略的具体实现及其对模型行为的影响
- 注意比较表 4.1–4.3 中不同模式下 SWC 和多样性指标的变化趋势
- 附录 I 展示了 o1-preview 在相同迷宫任务上的失败案例，突显专用推理模型的优势
- 训练效率提升（30h vs 36h）源于序列长度缩短，值得在资源受限时考虑
- 概率分布调优过程见 4.1 节，不同任务采用不同 p 配置，说明需针对领域调整

## 质量说明

- 采用来源：`raw`，`raw/papers/2024/10/2410.09918.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法描述、详尽的实验结果和开源链接，关键数据均有量化支撑，实验设计合理，结论可信。
