---
title: "LongCat-Flash-Omni Technical Report"
title_zh: "LongCat-Flash-Omni 技术报告"
arxiv_id: "2511.00279"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2025/11/2511.00279.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# LongCat-Flash-Omni 技术报告

## 一句话定位

提出 LongCat-Flash-Omni，一个 560B 参数的端到端开源全模态模型，支持低延迟实时音视频交互，采用渐进式训练策略与模态解耦并行架构实现高效多模态融合。

## 小学生也能听懂

这篇论文造了一个能听、能看、能聊天的超级大脑，像真人一样实时回应你说话和画面，它用特别聪明的方法把文字、图像、声音和视频合在一起训练，又快又准，还开源给大家用。

## 为什么值得记录

- 首个在开源社区中实现 560B 参数规模且支持毫秒级响应实时音视频交互的全模态模型
- 提出模态解耦并行（MDP）训练策略，在多模态异构数据下仍保持 >90% 的文本训练吞吐量
- 采用早期融合与课程式渐进训练，兼顾强单模态性能与跨模态理解能力
- 支持 128K 上下文窗口，具备长期记忆与多轮对话能力，适用于复杂交互场景
- 开源模型权重与完整技术方案，推动全模态智能研究社区发展

## 核心方法

- 基于 LongCat-Flash 的 ScMoE 架构（Shortcut-connected MoE + zero-computation experts），平均激活 27B 参数
- 视觉编码器 LongCat-ViT 支持原生分辨率输入与任意宽高比，使用 2D-RoPE 与像素解 shuffle 降低计算复杂度
- 音频处理采用四码本 tokenizer（LongCat-Audio-Codec）与流式音频解码器，实现仅 3 帧前瞻的低延迟语音重建
- 流式音视频特征采用时间对齐的块级交错机制（chunk-wise interleaving）输入 LLM，支持实时交互
- 视频处理引入动态帧采样（默认 2 FPS）、文本时间戳标记与三级 token 压缩（3D 卷积 + 插值下采样）
- 训练采用五阶段渐进策略：从文本 → 图像-文本 → 音频-文本 → 视频 → 全模态交互数据，逐步引入模态
- 提出模态解耦并行（MDP）策略，独立优化 LLM、视觉编码器与音频编码器的并行配置与内存使用

## 关键结果

- 在 Omni-Bench 和 WorldSense 等全模态基准测试中达到开源模型 SOTA 水平
- 在 MMLU-Pro、CMMLU、C-Eval 等文本任务上表现与同规模模型相当，未出现模态退化
- 在图像理解（如 OCRBench）、视频理解（如 MVBench）、音频理解（如 Clotho-AQA）等单模态任务中均具竞争力
- 主观评估显示其支持高质量、低延迟的实时音视频交互，端到端响应时间达毫秒级
- 训练系统效率：MDP 策略使多模态训练吞吐量维持在纯文本训练的 90% 以上

## 局限与风险

- 未公开具体训练数据规模与来源细节，部分数据依赖内部专有数据集
- 音频编码器仅在预训练后期（阶段 5）引入，早期依赖离散 token 可能限制细粒度声学建模
- 视频处理中最大帧数限制与 token 压缩可能损失长视频中的细节信息
- 未报告模型在极端低资源设备上的部署性能与量化方案

## 适合沉淀的概念

`全模态模型`, `模态解耦并行`, `早期融合训练`, `流式音视频交互`, `ScMoE 架构`, `LongCat-ViT`, `音频 tokenizer`, `动态帧采样`, `文本时间戳`, `课程式渐进训练`

## 阅读注意

- 关注 Section 2.4.2 中流式特征交错机制的具体实现格式与时间同步策略
- 注意 Section 3.2.6 提到的五阶段训练流程及各阶段数据组成变化
- Section 5 中 MDP 策略如何解耦不同模块的并行方式（如张量并行、流水线并行）是关键创新点
- 音频解码器采用 GAN 训练框架，需结合 LongCat-Audio-Codec 原论文理解其结构
- 评估部分应对比其与 Gemini-2.5、GPT-4o 等闭源模型在相同任务上的差距

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/11/2511.00279.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文为完整技术报告，涵盖架构、数据、训练、部署与评估全流程，信息充分且自洽，但未提供部分实验细节（如具体超参、消融实验），属合理范围。
