---
title: "Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing"
title_zh: "Audio-Omni：面向通用音频生成与编辑的多模态统一框架"
arxiv_id: "2604.10708"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2026/04/2604.10708.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Audio-Omni：面向通用音频生成与编辑的多模态统一框架

## 一句话定位

提出首个端到端统一框架 Audio-Omni，通过冻结 MLLM 与可训练 DiT 的解耦架构，结合双路条件注入机制，实现跨通用声音、音乐和语音领域的多模态理解、生成与编辑，并构建超百万样本的 AudioEdit 数据集解决编辑任务数据稀缺问题。

## 小学生也能听懂

这篇论文发明了一个叫Audio-Omni的“万能耳朵和嘴巴”，它能听懂、生成和编辑各种声音、音乐和说话声，就像用一套积木同时搭房子、画画和讲故事，还用超百万条新数据帮它学得更好，效果比以前的工具都强。

## 为什么值得记录

- 首次实现音频理解、生成与编辑三大任务在通用声音、音乐和语音三个域的全覆盖统一建模
- 提出混合条件注入机制（高层语义+低层信号），有效协调 MLLM 的推理能力与 DiT 的高保真合成能力
- 构建 AudioEdit 数据集（>1M 样本），填补指令引导音频编辑领域大规模公开数据的空白
- 模型展现出知识增强生成、上下文学习、零样本跨语言控制等涌现能力，推动通用音频智能发展

## 核心方法

- 采用解耦架构：冻结预训练 MLLM（Qwen2.5-Omni-3B）作为理解与推理核心，可训练 Diffusion Transformer（DiT）作为生成主干
- 设计双路条件注入机制：高层语义流（MLLM 特征 + 字符级文本嵌入）通过交叉注意力提供指令指导；低层信号流（梅尔谱 + 视频同步特征）拼接至噪声输入实现精确时序控制
- 基于 Rectified Flow 训练目标，使用单一均方误差损失端到端优化整个系统
- 构建 AudioEdit 数据集：结合真实数据挖掘（VGGSound + SAM-Audio 分割）与程序化合成（Scaper 工具包），覆盖添加、移除、提取和风格迁移四类编辑任务
- 训练策略：对语音提示采用 20%-75% 随机掩码，增强零样本语音克隆和内容编辑鲁棒性

## 关键结果

- 在 MMSU 和 MMAU 理解基准上，性能接近专用理解模型，显著优于其他统一模型
- 生成任务全面领先：T2A FAD=1.86（媲美 AudioX），T2M FAD=1.41（优于 MusicGen），TTS WER=1.77（优于 F5-TTS）
- 编辑任务 SOTA：平均 FAD=3.27，LSD=2.27，CLAP=0.32，全面超越 ZETA、SDEdit 等专用编辑模型
- 零样本跨语言生成：在未训练中文、西语等情况下，生成质量与英文专用模型相当
- 人类评估：在 T2M、V2M 和编辑任务中 OVL 和 REL 评分均达 80+，主观质量获专业认可

## 局限与风险

- 模型参数量大（7.9B，其中 3.05B 可训练），对部署资源要求较高
- 风格迁移依赖外部模型 ZETA 进行变换，存在误差传递风险
- 跨语言能力虽强，但非英语生成质量仍有下降（如 FAD 上升），表明语言迁移不完全均衡
- 伦理风险未完全解决，需依赖后续水印与检测技术防范滥用

## 适合沉淀的概念

`audio-understanding-generation-editing-unification`, `multimodal-large-language-model`, `diffusion-transformer`, `rectified-flow`, `hybrid-conditioning-mechanism`, `audio-editing-dataset`, `zero-shot-cross-lingual-generation`, `knowledge-augmented-generation`, `in-context-audio-generation`, `speech-masking-strategy`

## 阅读注意

- 重点关注双路条件注入机制如何分别处理语义指令与信号级控制，这是实现多域统一的关键创新
- 注意 AudioEdit 数据集的构建流程：真实分支使用 MLLM + SAM-Audio 实现语义感知分离，合成分支用 Scaper 保证规模与多样性
- 消融实验显示混合数据训练最优，说明真实数据保真度与合成数据覆盖率缺一不可
- MLLM 使用倒数第二层特征优于最后一层，提示深层语义表示对生成任务更具泛化性
- 人类评估中 V2A 任务得分相对较低，可能反映视频-音频对齐仍是挑战

## 质量说明

- 采用来源：`clean`，`papers/2026/04/2604.10708.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、详细结果、消融分析和人类评估，数据充分，方法描述清晰，具备可复现性基础。
