---
title: "Continuous Latent Diffusion Language Model"
title_zh: "连续隐变量扩散语言模型 Cola DLM"
arxiv_id: "2605.06548"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2026/05/2605.06548.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 连续隐变量扩散语言模型 Cola DLM

## 一句话定位

提出一种分层隐变量扩散语言模型 Cola DLM，通过在连续隐空间中建模全局语义先验，实现高效、非自回归的高质量文本生成。

## 小学生也能听懂

这个模型先把文字压缩成一个连续的‘想法向量’，然后用扩散模型学习这些想法的分布规律，最后根据这个想法生成文字。就像先想清楚要说什么，再组织语言表达出来，而不是一个字一个字地猜。

## 为什么值得记录

- 突破了传统自回归模型必须从左到右生成的限制，支持更灵活的非自回归生成
- 在连续隐空间中建模语义先验，有利于语义压缩和跨模态统一建模
- 通过分层信息分解，将全局语义组织与局部文本实现解耦，提升生成效率
- 实验验证了在 ~2B 参数规模下与自回归和 LLaDA 基线相当的性能，并展现出良好的扩展性

## 核心方法

- 使用 Text VAE 学习文本与连续隐变量之间的稳定映射关系
- 采用 block-causal DiT（Diffusion Transformer）在隐空间中建模分块因果先验分布
- 通过 Flow Matching 方法学习从标准正态分布到真实隐变量分布的向量场
- 训练分为两个阶段：先独立预训练 VAE，再联合优化 VAE 和 DiT 以保持表示稳定性
- 推理时先编码前缀得到条件隐变量，再逐块生成响应隐变量，最后通过条件解码器输出文本

## 关键结果

- 在 8 个基准测试中，Cola DLM 在严格匹配的 ~2B 参数下达到与自回归模型和 LLaDA 相当或更优的生成质量
- 展现出良好的扩展行为，在高达约 2000 EFLOPs 的计算预算下仍保持性能增长趋势
- 隐变量压缩有效降低了信息冗余，同时保持了语义完整性
- 块因果结构在保持跨块依赖的同时提升了并行计算效率

## 局限与风险

- 依赖高质量的 Text VAE 来建立稳定的文本-隐变量映射，VAE 的训练稳定性直接影响整体性能
- 当前实现未压缩序列长度，隐变量维度仍与输入长度相关，可能限制长文本建模效率
- Flow Matching 中的散度估计使用 Hutchinson 迹估计器，在高维情况下可能存在数值不稳定性
- 条件概率估计采用 plug-in 方法，可能引入偏差，尤其在低资源场景下

## 适合沉淀的概念

`hierarchical-latent-variable-modeling`, `continuous-latent-diffusion`, `block-causal-transformer`, `flow-matching`, `text-vae`, `non-autoregressive-generation`, `semantic-compression`, `unified-generative-modeling`

## 阅读注意

- 关注第 3.1 节对 Cola DLM 的概率形式化定义，特别是式 (3.1) 和 (3.5) 的信息分解
- 注意图 1 展示的两阶段训练流程：VAE 预训练 + 联合 DiT 训练，以及梯度控制机制
- 理解表 1 中从统一马尔可夫路径视角对比不同生成范式的关键差异
- 留意第 3.3.2 节提出的三个决定 Cola DLM 适用性的理论曲线：率失真曲线、先验逼近曲线和推断间隙曲线
- 查看附录中的 ELBO 分解证明和 Flow Matching 实现细节

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/05/2605.06548.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的理论框架、算法描述和实验验证，包含数学推导、训练流程和定量结果。虽然部分实验细节（如具体超参数）未完全展开，但核心方法、创新点和主要结论均有充分支撑。
