---
title: "LongCat-Next: Lexicalizing Modalities as Discrete Tokens"
title_zh: "LongCat-Next：将多模态信息词汇化为离散令牌"
arxiv_id: "2603.27538"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2026/03/2603.27538.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# LongCat-Next：将多模态信息词汇化为离散令牌

## 一句话定位

提出离散原生自回归（DiNA）范式，通过统一离散令牌空间实现文本、视觉和音频的原生多模态建模，并设计dNaViT视觉令牌器解决离散视觉建模的性能瓶颈。

## 小学生也能听懂

这篇论文像教电脑用同一种“积木”拼出文字、图片和声音，让它们能一起工作。它发明了一种新方法，把图片和声音变成小积木（离散令牌），和文字积木放在同一个盒子里，这样电脑就能同时“看、画、说”，而且做得比以前的专用工具还好。

## 为什么值得记录

- 突破传统语言中心的多模态架构，将非语言模态作为语言的自然延伸进行统一建模
- 提出DiNA范式，使视觉和音频能在共享离散空间中实现与文本一致的自回归训练
- dNaViT实现任意分辨率下的高保真图像理解与生成，压缩比达28×仍保持强性能
- LongCat-Next在统一框架下同时实现‘看、画、说’，在多个基准测试中超越专用模型

## 核心方法

- 采用Discrete Native Autoregression（DiNA）范式，将所有模态映射到统一离散令牌空间
- 设计Semantic-and-Aligned Encoder（SAE）作为预量化表示，确保语义完整性
- 使用Residual Vector Quantization（RVQ）构建分层离散令牌，保留高低层视觉信息
- 提出dNaViT：支持任意分辨率的离散原生视觉Transformer，实现双向图像-令牌转换
- 音频端采用基于Whisper编码器和RVQ的令牌化方案，支持并行与串行文本引导语音生成
- 使用MoE骨干网络（A3B，68.5B参数）进行多任务自回归训练，总训练量超2T令牌
- 引入DepthTransformer实现多层令牌的高效解码，单步自回归完成多模态生成

## 关键结果

- 在MMMU、MathVista等视觉理解基准上超越Qwen3VL-A3B等专业模型
- 图像生成质量与Flux-dev相当，尤其在文本渲染任务表现突出
- 语音相关任务优于同规模Gemini 3.1 Flash-Lite和MiMo-Audio模型
- OCR任务如ChartQA准确率提升3.5%，GenEval计数准确率提升7.5%
- 在28倍压缩比下仍保持高保真重建与强理解能力

## 局限与风险

- SAE依赖外部预训练视觉-语言模型，可能引入领域偏差
- RVQ八级残差量化虽有效但增加训练复杂度与推理延迟
- 未充分验证极端低资源场景下的泛化能力
- 音频生成中的随机延迟对齐策略需精细调参以避免模式崩溃

## 适合沉淀的概念

`discrete-native-autoregression`, `dnavit`, `semantic-and-aligned-encoder`, `residual-vector-quantization`, `multimodal-tokenization`, `any-resolution-generation`, `modality-agnostic-moe`, `intrinsic-information-recovery`

## 阅读注意

- 重点关注dNaViT如何利用SAE和RVQ解决离散视觉建模的信息损失问题
- 注意DiNA如何将理解与生成统一为同一预测过程的不同条件先验
- 分析附录中关于训练-推理不匹配导致序列崩溃的机制及缓解策略
- 观察视觉去令牌器中像素解码器与细化模块的协同作用
- 留意多模态数据采样与去重策略对最终性能的影响

## 质量说明

- 采用来源：`clean`，`papers/2026/03/2603.27538.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验结果与实现分析，数据充分且逻辑自洽，具备可复现性基础。
