2604.10708
论文导读
提出首个端到端统一框架 Audio-Omni,通过冻结 MLLM 与可训练 DiT 的解耦架构,结合双路条件注入机制,实现跨通用声音、音乐和语音领域的多模态理解、生成与编辑,并构建超百万样本的 AudioEdit 数据集解决编辑任务数据稀缺问题。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Audio-Omni:面向通用音频生成与编辑的多模态统一框架
一句话定位
提出首个端到端统一框架 Audio-Omni,通过冻结 MLLM 与可训练 DiT 的解耦架构,结合双路条件注入机制,实现跨通用声音、音乐和语音领域的多模态理解、生成与编辑,并构建超百万样本的 AudioEdit 数据集解决编辑任务数据稀缺问题。
小学生也能听懂
这篇论文发明了一个叫Audio-Omni的“万能耳朵和嘴巴”,它能听懂、生成和编辑各种声音、音乐和说话声,就像用一套积木同时搭房子、画画和讲故事,还用超百万条新数据帮它学得更好,效果比以前的工具都强。
为什么值得记录
- 首次实现音频理解、生成与编辑三大任务在通用声音、音乐和语音三个域的全覆盖统一建模
- 提出混合条件注入机制(高层语义+低层信号),有效协调 MLLM 的推理能力与 DiT 的高保真合成能力
- 构建 AudioEdit 数据集(>1M 样本),填补指令引导音频编辑领域大规模公开数据的空白
- 模型展现出知识增强生成、上下文学习、零样本跨语言控制等涌现能力,推动通用音频智能发展
核心方法
- 采用解耦架构:冻结预训练 MLLM(Qwen2.5-Omni-3B)作为理解与推理核心,可训练 Diffusion Transformer(DiT)作为生成主干
- 设计双路条件注入机制:高层语义流(MLLM 特征 + 字符级文本嵌入)通过交叉注意力提供指令指导;低层信号流(梅尔谱 + 视频同步特征)拼接至噪声输入实现精确时序控制
- 基于 Rectified Flow 训练目标,使用单一均方误差损失端到端优化整个系统
- 构建 AudioEdit 数据集:结合真实数据挖掘(VGGSound + SAM-Audio 分割)与程序化合成(Scaper 工具包),覆盖添加、移除、提取和风格迁移四类编辑任务
- 训练策略:对语音提示采用 20%-75% 随机掩码,增强零样本语音克隆和内容编辑鲁棒性
关键结果
- 在 MMSU 和 MMAU 理解基准上,性能接近专用理解模型,显著优于其他统一模型
- 生成任务全面领先:T2A FAD=1.86(媲美 AudioX),T2M FAD=1.41(优于 MusicGen),TTS WER=1.77(优于 F5-TTS)
- 编辑任务 SOTA:平均 FAD=3.27,LSD=2.27,CLAP=0.32,全面超越 ZETA、SDEdit 等专用编辑模型
- 零样本跨语言生成:在未训练中文、西语等情况下,生成质量与英文专用模型相当
- 人类评估:在 T2M、V2M 和编辑任务中 OVL 和 REL 评分均达 80+,主观质量获专业认可
局限与风险
- 模型参数量大(7.9B,其中 3.05B 可训练),对部署资源要求较高
- 风格迁移依赖外部模型 ZETA 进行变换,存在误差传递风险
- 跨语言能力虽强,但非英语生成质量仍有下降(如 FAD 上升),表明语言迁移不完全均衡
- 伦理风险未完全解决,需依赖后续水印与检测技术防范滥用
适合沉淀的概念
audio-understanding-generation-editing-unification, multimodal-large-language-model, diffusion-transformer, rectified-flow, hybrid-conditioning-mechanism, audio-editing-dataset, zero-shot-cross-lingual-generation, knowledge-augmented-generation, in-context-audio-generation, speech-masking-strategy
阅读注意
- 重点关注双路条件注入机制如何分别处理语义指令与信号级控制,这是实现多域统一的关键创新
- 注意 AudioEdit 数据集的构建流程:真实分支使用 MLLM + SAM-Audio 实现语义感知分离,合成分支用 Scaper 保证规模与多样性
- 消融实验显示混合数据训练最优,说明真实数据保真度与合成数据覆盖率缺一不可
- MLLM 使用倒数第二层特征优于最后一层,提示深层语义表示对生成任务更具泛化性
- 人类评估中 V2A 任务得分相对较低,可能反映视频-音频对齐仍是挑战
质量说明
- 采用来源:
clean,papers/2026/04/2604.10708.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的实验设置、详细结果、消融分析和人类评估,数据充分,方法描述清晰,具备可复现性基础。