论文
arXiv2311.07919
时间2023-11
来源Markdown
页面质量中文卡片
阅读量级73 分钟

Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

论文导读

提出 Qwen-Audio 和 Qwen-Audio-Chat 模型,通过多任务预训练与分层标签框架实现跨30+任务、多语言和多种音频类型(语音、自然音、音乐等)的统一音频理解,无需任务特定微调即达 SOTA 性能。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Qwen-Audio:基于统一大规模音频-语言模型的通用音频理解

一句话定位

提出 Qwen-Audio 和 Qwen-Audio-Chat 模型,通过多任务预训练与分层标签框架实现跨30+任务、多语言和多种音频类型(语音、自然音、音乐等)的统一音频理解,无需任务特定微调即达 SOTA 性能。

小学生也能听懂

这篇论文造了一个能听懂各种声音的“超级耳朵”,像老师一样能同时做听写、翻译、描述音乐和回答问题,不用特别教就能在30多种任务上表现最好,还能和人对话。

为什么值得记录

  • 首次实现覆盖人类语音、自然声音、音乐、歌曲等多种音频类型的统一多任务建模,突破以往模型仅支持单一音频类型的限制
  • 提出分层标签机制解决多数据集联合训练中的一对多干扰问题,提升知识共享与任务区分能力
  • 引入词级时间戳预测任务(SRWT),显著提升语音识别、音频定位及问答任务性能
  • 在 Aishell1、cochlscene、ClothoAQA、VocalSound 等基准测试上取得 SOTA 结果,验证通用音频理解能力
  • 开源模型与代码,推动音频-语言多模态社区发展

核心方法

  • 模型架构:采用 Whisper-large-v2 作为音频编码器(640M 参数),Qwen-7B 作为语言模型(7.7B 参数),通过端到端训练连接音频与文本模态
  • 多任务训练格式:设计分层标签系统,包括转录/分析起始标签、音频语言标签、任务类型标签(<|transcribe|>, <|caption|>, <|question-answer|> 等)、输出语言标签、时间戳标签(<|timestamps|>)和输出指令
  • 词级时间戳预测(SRWT):在语音识别中同步预测每个词的起止时间,增强音频信号对齐能力,提升 grounding 与 QA 任务表现
  • 两阶段训练:第一阶段冻结 LLM 仅训练音频编码器;第二阶段冻结编码器,对 LLM 进行监督微调以构建 Qwen-Audio-Chat 对话模型
  • 数据覆盖:整合超过30个任务、8种语言、总计数万小时的多类型音频数据,涵盖 ASR、翻译、音频描述、情感识别、音乐分析等
  • 对话支持:Qwen-Audio-Chat 支持多轮对话、多音频输入(通过 'Audio id:' 标识)和混合文本-音频交互,使用 ChatML 格式进行指令微调

关键结果

  • ASR 任务:在 LibriSpeech test-clean/test-other 上 WER 达 2.0%/4.2%,Aishell1 test 集 WER 1.3%,优于 SpeechT5、SALMONN 等基线
  • 语音翻译:在 CoVoST2 多方向翻译任务中 BLEU 分数显著领先,如 en-zh 达 41.5,de-en 达 33.9
  • 音频描述(AAC):在 Clotho 数据集上 CIDEr 分数达 0.441,SPIDEr 达 0.288,优于 Pengi
  • 声学场景分类:在 CochlScene 上准确率 79.5%,TUT2017 上 64.9%,远超 Pengi(35.3%)
  • 音频问答(AQA):在 ClothoAQA 上二分类准确率达 74.9%,优于 Pengi(64.5%)
  • 人声分类(VSC):在 VocalSound 上准确率达 92.89%,显著高于 CLAP(49.45%)和 Pengi(60.35%)
  • 音乐音符分析:在 NSynth Instrument 分类上准确率 78.82%,高于 Pengi(50.07%)

局限与风险

  • 未报告模型在低资源语言或长尾任务上的泛化能力细节
  • SRWT 任务依赖高质量词级标注数据,工业数据集中可能存在标注偏差
  • 多任务训练虽避免任务特定微调,但整体训练成本较高(50万步预训练)
  • 对话能力评估缺乏定量指标,主要依赖案例展示

适合沉淀的概念

audio-language-model, multitask-learning, hierarchical-task-tagging, word-level-timestamp-prediction, speech-recognition-with-timestamps, universal-audio-understanding, qwen-audio-chat, end-to-end-audio-processing

阅读注意

  • 重点关注分层标签设计如何缓解多任务干扰,特别是 <|timestamps|> 标签对 grounding 能力的提升机制
  • 注意 SRWT 任务虽与 ASR 共享数据,但其训练目标不同,需理解其对模型内部表示的影响
  • 对比 Qwen-Audio(仅预训练)与 Qwen-Audio-Chat(加 SFT)的应用场景差异
  • 附录中的超参数设置对复现至关重要,尤其是两阶段学习率与 batch size 配置

质量说明

  • 采用来源:cleanpapers/2023/11/2311.07919.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文结构完整,实验充分,数据详实,方法描述清晰,结果可验证,具备高质量研究特征。