论文
arXiv2604.15804
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级127 分钟

Qwen3.5-Omni Technical Report

论文导读

Qwen3.5-Omni 是一个支持文本、图像、音频和音视频多模态理解与生成的原生全模态大模型,采用 Thinker-Talker 架构,引入 ARIA 对齐机制提升流式语音合成稳定性,并在 215 项评测中达到 SOTA 水平。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Qwen3.5-Omni 技术报告

一句话定位

Qwen3.5-Omni 是一个支持文本、图像、音频和音视频多模态理解与生成的原生全模态大模型,采用 Thinker-Talker 架构,引入 ARIA 对齐机制提升流式语音合成稳定性,并在 215 项评测中达到 SOTA 水平。

小学生也能听懂

这篇论文造了一个像“万能小助理”的AI,它能同时看懂文字、图片、听清声音和视频,还能边想边说,像人一样流畅对话,听得懂113种语言,说话像真人,又快又准。

为什么值得记录

  • 首次在数百亿参数规模上实现原生全模态建模,支持长达 256k token 上下文,可处理超过 10 小时音频或 400 秒 720P 视频(1 FPS)
  • 提出 ARIA(Adaptive Rate Interleave Alignment)机制,解决文本与语音 tokenizer 编码效率差异导致的流式语音生成不稳定问题
  • 在 215 个音频与音视频理解、推理和交互子任务中全面超越 Gemini-3.1 Pro,尤其在 ASR 和多语言翻译任务中表现突出
  • 支持零样本语音克隆、情感可控语音生成、实时打断交互以及新兴的 Audio-Visual Vibe Coding 能力
  • 提供 Plus 和 Flash 双版本,兼顾高性能与低延迟部署需求

核心方法

  • 采用 Thinker-Talker 双模块架构:Thinker 负责多模态理解与文本生成,Talker 基于 Thinker 输出进行流式语音生成
  • Thinker 和 Talker 均使用 Hybrid MoE 结构,结合 Gated Delta Net 模块优化长序列 KV-cache I/O,提升并发与吞吐
  • 音频编码使用自研 AuT 模型,基于 4000 万小时监督数据训练,输出 6.25Hz 音频 token,支持 113 种语言和方言
  • 引入显式时间戳文本标记替代纯位置 ID,增强长音视频输入下的时序感知能力
  • Talker 使用 RVQ 多码本编码 + MTP 模块实现帧级流式语音合成,配合因果 ConvNet 实现低延迟波形重建
  • 提出 ARIA 机制,在生成过程中动态约束文本与语音 token 比例,避免跳词、发音错误等问题
  • 后训练分三阶段:专家蒸馏 → 在线蒸馏对齐音频响应质量 → 交互对齐强化学习优化多轮对话体验

关键结果

  • Qwen3.5-Omni-Plus 在 FLEURS 多语言 ASR 任务上平均 WER 为 6.6%,优于 Gemini-3.1-Pro(7.3%)和 GPT-4o-Transcribe(10.4%)
  • 在 FLEURS 多语言翻译任务中,en2xx 平均 BLEU 达 33.8,zh2xx 达 21.4,显著领先 Gemini-3.1-Pro
  • 在 Cantonese ASR 任务中,WER 低至 2.2%,相比 Gemini-3.1-Pro 的 6.3% 提升明显
  • 支持 113 种语音输入语言和 36 种语音输出语言,涵盖 39 种中文方言
  • 端到端首包延迟:音频输入下 Plus 版为 435ms,Flash 版为 235ms;视频输入下分别为 651ms 和 426ms
  • 在 215 项评测中综合表现达到 SOTA,音频理解与 Gemini-3.1-Pro 相当,部分任务超越

局限与风险

  • 视频编码仍为非流式(SigLIP2),无法实现真正端到端视频流处理
  • 显式时间戳策略增加上下文长度,可能影响长输入下的效率
  • ARIA 虽改善对齐,但在极低资源语言或极端语速场景下仍可能存在同步偏差
  • 语音生成依赖预训练 tokenizer,对非训练分布外声音(如重度口音、儿童语音)泛化能力有限

适合沉淀的概念

thinker-talker-architecture, hybrid-moe-transformer, aria-alignment, audio-visual-vibe-coding, multimodal-streaming-generation, rvq-codec, gated-delta-net, explicit-timestamp-encoding

阅读注意

  • 重点关注 ARIA 如何统一双通道生成范式为单流交错生成,及其数学约束形式
  • 注意 Thinker 与 Talker 在 Hybrid MoE 设计上的共享与差异
  • 评估部分需区分 X→Text 与 X→Speech 两类任务,后者包含零样本语音克隆等新兴能力
  • 附录中的多语言 ASR 与翻译结果揭示模型在亚洲语言(如粤语、泰语)上的优势
  • Latency 表格显示 Flash 版本通过资源分配优化实现更低延迟,但非单纯模型缩小

质量说明

  • 采用来源:cleanpapers/2026/04/2604.15804.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含架构图、训练策略、详细评测数据及消融设计,技术细节充分,实验覆盖全面,具备可复现性与工程参考价值。