---
title: "ComboStoc: Combinatorial Stochasticity for Diffusion Generative Models"
title_zh: "ComboStoc：扩散生成模型的组合随机性"
arxiv_id: "2405.13729"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2024/05/2405.13729.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# ComboStoc：扩散生成模型的组合随机性

## 一句话定位

提出 ComboStoc 方法，通过在训练中引入异步时间步长采样高维数据的组合结构，提升扩散模型性能并支持细粒度生成控制。

## 小学生也能听懂

想象你要画一幅拼图，但每次只能同时移动所有碎片。ComboStoc 让你可以单独移动每个碎片，这样模型能更好地学习它们之间的关系，最终画出更完整、更准确的图像，还能让你指定哪些部分保留原样、哪些部分重新生成。

## 为什么值得记录

- 揭示了现有扩散模型在训练时对高维组合空间采样不足的问题
- 通过简单修改时间步调度，显著提升图像和结构化 3D 形状的生成质量与训练收敛速度
- 支持新型测试时控制：可对不同维度/属性设置不同程度的保留权重，实现灵活的条件生成

## 核心方法

- 将标准同步插值时间 t 扩展为与数据同形状的 tensor t，允许不同维度/属性使用不同时间步
- 训练网络 f_θ(x_t, t) 预测目标速度或样本，并引入补偿漂移项 v_cmpn 以修正非对角路径上的轨迹偏移
- 在图像生成中，对 SiT 模型适配 patch-wise 时间步嵌入；在 3D 形状中，对部件存在性、包围盒、形状编码等属性独立调度
- 训练时混合同步与非同步样本（ImageNet）或全量使用异步调度（PartNet）
- 测试时支持从 x₀ = (1−t₀)⊙z + t₀⊙x 开始，按不同速率推进各维度时间步

## 关键结果

- 在 ImageNet 上，ComboStoc-XL/2 在 800K 步时 FID 达 11.41，优于 SiT-XL（12.6）和 DiT-XL（14.3）
- 在结构化 3D 形状（PartNet 椅子类）上，insync_all 配置 FPD=4.04，显著优于无组合采样的 insync_none（FPD=7.99）
- 训练收敛加速：ComboStoc-TB 变体使 SiT 收敛速度提升约 1.75 倍
- 支持空间/通道级图像修复（如四象限不同保留权重）和 3D 形状补全/部件组装等新型应用

## 局限与风险

- 未量化传统方法在密集数据分布下组合欠采样的严重程度
- 时间步嵌入模块设计可能影响基线对齐（如 insync_none 略差于 SiT）
- 当前 3D 形状生成未利用部件层次结构，多样性虽高但规则性弱于 StructRe 等方法

## 适合沉淀的概念

`combinatorial-stochasticity`, `asynchronous-time-steps`, `stochastic-interpolants`, `diffusion-training-acceleration`, `structured-3d-shape-generation`, `flexible-conditioning`, `compensation-drift`, `tensorized-time-schedule`

## 阅读注意

- 关注 Fig. 2 如何可视化同步 vs 异步采样对路径空间覆盖的影响
- 注意 Eq. (2) 和补偿漂移公式如何实现非对角点上的稳定训练
- Table 2 和 Table 4 列出了图像与 3D 形状的所有配置细节，是理解实验设计的关键
- Fig. 12 展示了 VAE 潜在空间中不同通道对应结构与颜色信息，值得深入分析

## 质量说明

- 采用来源：`raw`，`raw/papers/2024/05/2405.13729.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的理论推导、多模态实验、消融配置和新型应用示例，附录包含实现细节与额外结果，材料充分可信。
