LongCat-Next: Lexicalizing Modalities as Discrete Tokens
论文导读
提出离散原生自回归(DiNA)范式,通过统一离散令牌空间实现文本、视觉和音频的原生多模态建模,并设计dNaViT视觉令牌器解决离散视觉建模的性能瓶颈。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
LongCat-Next:将多模态信息词汇化为离散令牌
一句话定位
提出离散原生自回归(DiNA)范式,通过统一离散令牌空间实现文本、视觉和音频的原生多模态建模,并设计dNaViT视觉令牌器解决离散视觉建模的性能瓶颈。
小学生也能听懂
这篇论文像教电脑用同一种“积木”拼出文字、图片和声音,让它们能一起工作。它发明了一种新方法,把图片和声音变成小积木(离散令牌),和文字积木放在同一个盒子里,这样电脑就能同时“看、画、说”,而且做得比以前的专用工具还好。
为什么值得记录
- 突破传统语言中心的多模态架构,将非语言模态作为语言的自然延伸进行统一建模
- 提出DiNA范式,使视觉和音频能在共享离散空间中实现与文本一致的自回归训练
- dNaViT实现任意分辨率下的高保真图像理解与生成,压缩比达28×仍保持强性能
- LongCat-Next在统一框架下同时实现‘看、画、说’,在多个基准测试中超越专用模型
核心方法
- 采用Discrete Native Autoregression(DiNA)范式,将所有模态映射到统一离散令牌空间
- 设计Semantic-and-Aligned Encoder(SAE)作为预量化表示,确保语义完整性
- 使用Residual Vector Quantization(RVQ)构建分层离散令牌,保留高低层视觉信息
- 提出dNaViT:支持任意分辨率的离散原生视觉Transformer,实现双向图像-令牌转换
- 音频端采用基于Whisper编码器和RVQ的令牌化方案,支持并行与串行文本引导语音生成
- 使用MoE骨干网络(A3B,68.5B参数)进行多任务自回归训练,总训练量超2T令牌
- 引入DepthTransformer实现多层令牌的高效解码,单步自回归完成多模态生成
关键结果
- 在MMMU、MathVista等视觉理解基准上超越Qwen3VL-A3B等专业模型
- 图像生成质量与Flux-dev相当,尤其在文本渲染任务表现突出
- 语音相关任务优于同规模Gemini 3.1 Flash-Lite和MiMo-Audio模型
- OCR任务如ChartQA准确率提升3.5%,GenEval计数准确率提升7.5%
- 在28倍压缩比下仍保持高保真重建与强理解能力
局限与风险
- SAE依赖外部预训练视觉-语言模型,可能引入领域偏差
- RVQ八级残差量化虽有效但增加训练复杂度与推理延迟
- 未充分验证极端低资源场景下的泛化能力
- 音频生成中的随机延迟对齐策略需精细调参以避免模式崩溃
适合沉淀的概念
discrete-native-autoregression, dnavit, semantic-and-aligned-encoder, residual-vector-quantization, multimodal-tokenization, any-resolution-generation, modality-agnostic-moe, intrinsic-information-recovery
阅读注意
- 重点关注dNaViT如何利用SAE和RVQ解决离散视觉建模的信息损失问题
- 注意DiNA如何将理解与生成统一为同一预测过程的不同条件先验
- 分析附录中关于训练-推理不匹配导致序列崩溃的机制及缓解策略
- 观察视觉去令牌器中像素解码器与细化模块的协同作用
- 留意多模态数据采样与去重策略对最终性能的影响
质量说明
- 采用来源:
clean,papers/2026/03/2603.27538.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法细节、实验结果与实现分析,数据充分且逻辑自洽,具备可复现性基础。