论文
arXiv2603.27538
时间2026-03
来源Markdown
页面质量中文卡片
阅读量级235 分钟

LongCat-Next: Lexicalizing Modalities as Discrete Tokens

论文导读

提出离散原生自回归(DiNA)范式,通过统一离散令牌空间实现文本、视觉和音频的原生多模态建模,并设计dNaViT视觉令牌器解决离散视觉建模的性能瓶颈。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

LongCat-Next:将多模态信息词汇化为离散令牌

一句话定位

提出离散原生自回归(DiNA)范式,通过统一离散令牌空间实现文本、视觉和音频的原生多模态建模,并设计dNaViT视觉令牌器解决离散视觉建模的性能瓶颈。

小学生也能听懂

这篇论文像教电脑用同一种“积木”拼出文字、图片和声音,让它们能一起工作。它发明了一种新方法,把图片和声音变成小积木(离散令牌),和文字积木放在同一个盒子里,这样电脑就能同时“看、画、说”,而且做得比以前的专用工具还好。

为什么值得记录

  • 突破传统语言中心的多模态架构,将非语言模态作为语言的自然延伸进行统一建模
  • 提出DiNA范式,使视觉和音频能在共享离散空间中实现与文本一致的自回归训练
  • dNaViT实现任意分辨率下的高保真图像理解与生成,压缩比达28×仍保持强性能
  • LongCat-Next在统一框架下同时实现‘看、画、说’,在多个基准测试中超越专用模型

核心方法

  • 采用Discrete Native Autoregression(DiNA)范式,将所有模态映射到统一离散令牌空间
  • 设计Semantic-and-Aligned Encoder(SAE)作为预量化表示,确保语义完整性
  • 使用Residual Vector Quantization(RVQ)构建分层离散令牌,保留高低层视觉信息
  • 提出dNaViT:支持任意分辨率的离散原生视觉Transformer,实现双向图像-令牌转换
  • 音频端采用基于Whisper编码器和RVQ的令牌化方案,支持并行与串行文本引导语音生成
  • 使用MoE骨干网络(A3B,68.5B参数)进行多任务自回归训练,总训练量超2T令牌
  • 引入DepthTransformer实现多层令牌的高效解码,单步自回归完成多模态生成

关键结果

  • 在MMMU、MathVista等视觉理解基准上超越Qwen3VL-A3B等专业模型
  • 图像生成质量与Flux-dev相当,尤其在文本渲染任务表现突出
  • 语音相关任务优于同规模Gemini 3.1 Flash-Lite和MiMo-Audio模型
  • OCR任务如ChartQA准确率提升3.5%,GenEval计数准确率提升7.5%
  • 在28倍压缩比下仍保持高保真重建与强理解能力

局限与风险

  • SAE依赖外部预训练视觉-语言模型,可能引入领域偏差
  • RVQ八级残差量化虽有效但增加训练复杂度与推理延迟
  • 未充分验证极端低资源场景下的泛化能力
  • 音频生成中的随机延迟对齐策略需精细调参以避免模式崩溃

适合沉淀的概念

discrete-native-autoregression, dnavit, semantic-and-aligned-encoder, residual-vector-quantization, multimodal-tokenization, any-resolution-generation, modality-agnostic-moe, intrinsic-information-recovery

阅读注意

  • 重点关注dNaViT如何利用SAE和RVQ解决离散视觉建模的信息损失问题
  • 注意DiNA如何将理解与生成统一为同一预测过程的不同条件先验
  • 分析附录中关于训练-推理不匹配导致序列崩溃的机制及缓解策略
  • 观察视觉去令牌器中像素解码器与细化模块的协同作用
  • 留意多模态数据采样与去重策略对最终性能的影响

质量说明

  • 采用来源:cleanpapers/2026/03/2603.27538.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法细节、实验结果与实现分析,数据充分且逻辑自洽,具备可复现性基础。