---
title: "Qwen3.5-Omni Technical Report"
title_zh: "Qwen3.5-Omni 技术报告"
arxiv_id: "2604.15804"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.15804.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Qwen3.5-Omni 技术报告

## 一句话定位

Qwen3.5-Omni 是一个支持文本、图像、音频和音视频多模态理解与生成的原生全模态大模型，采用 Thinker-Talker 架构，引入 ARIA 对齐机制提升流式语音合成稳定性，并在 215 项评测中达到 SOTA 水平。

## 小学生也能听懂

这篇论文造了一个像“万能小助理”的AI，它能同时看懂文字、图片、听清声音和视频，还能边想边说，像人一样流畅对话，听得懂113种语言，说话像真人，又快又准。

## 为什么值得记录

- 首次在数百亿参数规模上实现原生全模态建模，支持长达 256k token 上下文，可处理超过 10 小时音频或 400 秒 720P 视频（1 FPS）
- 提出 ARIA（Adaptive Rate Interleave Alignment）机制，解决文本与语音 tokenizer 编码效率差异导致的流式语音生成不稳定问题
- 在 215 个音频与音视频理解、推理和交互子任务中全面超越 Gemini-3.1 Pro，尤其在 ASR 和多语言翻译任务中表现突出
- 支持零样本语音克隆、情感可控语音生成、实时打断交互以及新兴的 Audio-Visual Vibe Coding 能力
- 提供 Plus 和 Flash 双版本，兼顾高性能与低延迟部署需求

## 核心方法

- 采用 Thinker-Talker 双模块架构：Thinker 负责多模态理解与文本生成，Talker 基于 Thinker 输出进行流式语音生成
- Thinker 和 Talker 均使用 Hybrid MoE 结构，结合 Gated Delta Net 模块优化长序列 KV-cache I/O，提升并发与吞吐
- 音频编码使用自研 AuT 模型，基于 4000 万小时监督数据训练，输出 6.25Hz 音频 token，支持 113 种语言和方言
- 引入显式时间戳文本标记替代纯位置 ID，增强长音视频输入下的时序感知能力
- Talker 使用 RVQ 多码本编码 + MTP 模块实现帧级流式语音合成，配合因果 ConvNet 实现低延迟波形重建
- 提出 ARIA 机制，在生成过程中动态约束文本与语音 token 比例，避免跳词、发音错误等问题
- 后训练分三阶段：专家蒸馏 → 在线蒸馏对齐音频响应质量 → 交互对齐强化学习优化多轮对话体验

## 关键结果

- Qwen3.5-Omni-Plus 在 FLEURS 多语言 ASR 任务上平均 WER 为 6.6%，优于 Gemini-3.1-Pro（7.3%）和 GPT-4o-Transcribe（10.4%）
- 在 FLEURS 多语言翻译任务中，en2xx 平均 BLEU 达 33.8，zh2xx 达 21.4，显著领先 Gemini-3.1-Pro
- 在 Cantonese ASR 任务中，WER 低至 2.2%，相比 Gemini-3.1-Pro 的 6.3% 提升明显
- 支持 113 种语音输入语言和 36 种语音输出语言，涵盖 39 种中文方言
- 端到端首包延迟：音频输入下 Plus 版为 435ms，Flash 版为 235ms；视频输入下分别为 651ms 和 426ms
- 在 215 项评测中综合表现达到 SOTA，音频理解与 Gemini-3.1-Pro 相当，部分任务超越

## 局限与风险

- 视频编码仍为非流式（SigLIP2），无法实现真正端到端视频流处理
- 显式时间戳策略增加上下文长度，可能影响长输入下的效率
- ARIA 虽改善对齐，但在极低资源语言或极端语速场景下仍可能存在同步偏差
- 语音生成依赖预训练 tokenizer，对非训练分布外声音（如重度口音、儿童语音）泛化能力有限

## 适合沉淀的概念

`thinker-talker-architecture`, `hybrid-moe-transformer`, `aria-alignment`, `audio-visual-vibe-coding`, `multimodal-streaming-generation`, `rvq-codec`, `gated-delta-net`, `explicit-timestamp-encoding`

## 阅读注意

- 重点关注 ARIA 如何统一双通道生成范式为单流交错生成，及其数学约束形式
- 注意 Thinker 与 Talker 在 Hybrid MoE 设计上的共享与差异
- 评估部分需区分 X→Text 与 X→Speech 两类任务，后者包含零样本语音克隆等新兴能力
- 附录中的多语言 ASR 与翻译结果揭示模型在亚洲语言（如粤语、泰语）上的优势
- Latency 表格显示 Flash 版本通过资源分配优化实现更低延迟，但非单纯模型缩小

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.15804.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含架构图、训练策略、详细评测数据及消融设计，技术细节充分，实验覆盖全面，具备可复现性与工程参考价值。
