论文
arXiv2604.10708
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级87 分钟

2604.10708

论文导读

提出首个端到端统一框架 Audio-Omni,通过冻结 MLLM 与可训练 DiT 的解耦架构,结合双路条件注入机制,实现跨通用声音、音乐和语音领域的多模态理解、生成与编辑,并构建超百万样本的 AudioEdit 数据集解决编辑任务数据稀缺问题。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Audio-Omni:面向通用音频生成与编辑的多模态统一框架

一句话定位

提出首个端到端统一框架 Audio-Omni,通过冻结 MLLM 与可训练 DiT 的解耦架构,结合双路条件注入机制,实现跨通用声音、音乐和语音领域的多模态理解、生成与编辑,并构建超百万样本的 AudioEdit 数据集解决编辑任务数据稀缺问题。

小学生也能听懂

这篇论文发明了一个叫Audio-Omni的“万能耳朵和嘴巴”,它能听懂、生成和编辑各种声音、音乐和说话声,就像用一套积木同时搭房子、画画和讲故事,还用超百万条新数据帮它学得更好,效果比以前的工具都强。

为什么值得记录

  • 首次实现音频理解、生成与编辑三大任务在通用声音、音乐和语音三个域的全覆盖统一建模
  • 提出混合条件注入机制(高层语义+低层信号),有效协调 MLLM 的推理能力与 DiT 的高保真合成能力
  • 构建 AudioEdit 数据集(>1M 样本),填补指令引导音频编辑领域大规模公开数据的空白
  • 模型展现出知识增强生成、上下文学习、零样本跨语言控制等涌现能力,推动通用音频智能发展

核心方法

  • 采用解耦架构:冻结预训练 MLLM(Qwen2.5-Omni-3B)作为理解与推理核心,可训练 Diffusion Transformer(DiT)作为生成主干
  • 设计双路条件注入机制:高层语义流(MLLM 特征 + 字符级文本嵌入)通过交叉注意力提供指令指导;低层信号流(梅尔谱 + 视频同步特征)拼接至噪声输入实现精确时序控制
  • 基于 Rectified Flow 训练目标,使用单一均方误差损失端到端优化整个系统
  • 构建 AudioEdit 数据集:结合真实数据挖掘(VGGSound + SAM-Audio 分割)与程序化合成(Scaper 工具包),覆盖添加、移除、提取和风格迁移四类编辑任务
  • 训练策略:对语音提示采用 20%-75% 随机掩码,增强零样本语音克隆和内容编辑鲁棒性

关键结果

  • 在 MMSU 和 MMAU 理解基准上,性能接近专用理解模型,显著优于其他统一模型
  • 生成任务全面领先:T2A FAD=1.86(媲美 AudioX),T2M FAD=1.41(优于 MusicGen),TTS WER=1.77(优于 F5-TTS)
  • 编辑任务 SOTA:平均 FAD=3.27,LSD=2.27,CLAP=0.32,全面超越 ZETA、SDEdit 等专用编辑模型
  • 零样本跨语言生成:在未训练中文、西语等情况下,生成质量与英文专用模型相当
  • 人类评估:在 T2M、V2M 和编辑任务中 OVL 和 REL 评分均达 80+,主观质量获专业认可

局限与风险

  • 模型参数量大(7.9B,其中 3.05B 可训练),对部署资源要求较高
  • 风格迁移依赖外部模型 ZETA 进行变换,存在误差传递风险
  • 跨语言能力虽强,但非英语生成质量仍有下降(如 FAD 上升),表明语言迁移不完全均衡
  • 伦理风险未完全解决,需依赖后续水印与检测技术防范滥用

适合沉淀的概念

audio-understanding-generation-editing-unification, multimodal-large-language-model, diffusion-transformer, rectified-flow, hybrid-conditioning-mechanism, audio-editing-dataset, zero-shot-cross-lingual-generation, knowledge-augmented-generation, in-context-audio-generation, speech-masking-strategy

阅读注意

  • 重点关注双路条件注入机制如何分别处理语义指令与信号级控制,这是实现多域统一的关键创新
  • 注意 AudioEdit 数据集的构建流程:真实分支使用 MLLM + SAM-Audio 实现语义感知分离,合成分支用 Scaper 保证规模与多样性
  • 消融实验显示混合数据训练最优,说明真实数据保真度与合成数据覆盖率缺一不可
  • MLLM 使用倒数第二层特征优于最后一层,提示深层语义表示对生成任务更具泛化性
  • 人类评估中 V2A 任务得分相对较低,可能反映视频-音频对齐仍是挑战

质量说明

  • 采用来源:cleanpapers/2026/04/2604.10708.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的实验设置、详细结果、消融分析和人类评估,数据充分,方法描述清晰,具备可复现性基础。