---
title: "Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models"
title_zh: "Qwen-Audio：基于统一大规模音频-语言模型的通用音频理解"
arxiv_id: "2311.07919"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2023/11/2311.07919.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Qwen-Audio：基于统一大规模音频-语言模型的通用音频理解

## 一句话定位

提出 Qwen-Audio 和 Qwen-Audio-Chat 模型，通过多任务预训练与分层标签框架实现跨30+任务、多语言和多种音频类型（语音、自然音、音乐等）的统一音频理解，无需任务特定微调即达 SOTA 性能。

## 小学生也能听懂

这篇论文造了一个能听懂各种声音的“超级耳朵”，像老师一样能同时做听写、翻译、描述音乐和回答问题，不用特别教就能在30多种任务上表现最好，还能和人对话。

## 为什么值得记录

- 首次实现覆盖人类语音、自然声音、音乐、歌曲等多种音频类型的统一多任务建模，突破以往模型仅支持单一音频类型的限制
- 提出分层标签机制解决多数据集联合训练中的一对多干扰问题，提升知识共享与任务区分能力
- 引入词级时间戳预测任务（SRWT），显著提升语音识别、音频定位及问答任务性能
- 在 Aishell1、cochlscene、ClothoAQA、VocalSound 等基准测试上取得 SOTA 结果，验证通用音频理解能力
- 开源模型与代码，推动音频-语言多模态社区发展

## 核心方法

- 模型架构：采用 Whisper-large-v2 作为音频编码器（640M 参数），Qwen-7B 作为语言模型（7.7B 参数），通过端到端训练连接音频与文本模态
- 多任务训练格式：设计分层标签系统，包括转录/分析起始标签、音频语言标签、任务类型标签（<|transcribe|>, <|caption|>, <|question-answer|> 等）、输出语言标签、时间戳标签（<|timestamps|>）和输出指令
- 词级时间戳预测（SRWT）：在语音识别中同步预测每个词的起止时间，增强音频信号对齐能力，提升 grounding 与 QA 任务表现
- 两阶段训练：第一阶段冻结 LLM 仅训练音频编码器；第二阶段冻结编码器，对 LLM 进行监督微调以构建 Qwen-Audio-Chat 对话模型
- 数据覆盖：整合超过30个任务、8种语言、总计数万小时的多类型音频数据，涵盖 ASR、翻译、音频描述、情感识别、音乐分析等
- 对话支持：Qwen-Audio-Chat 支持多轮对话、多音频输入（通过 'Audio id:' 标识）和混合文本-音频交互，使用 ChatML 格式进行指令微调

## 关键结果

- ASR 任务：在 LibriSpeech test-clean/test-other 上 WER 达 2.0%/4.2%，Aishell1 test 集 WER 1.3%，优于 SpeechT5、SALMONN 等基线
- 语音翻译：在 CoVoST2 多方向翻译任务中 BLEU 分数显著领先，如 en-zh 达 41.5，de-en 达 33.9
- 音频描述（AAC）：在 Clotho 数据集上 CIDEr 分数达 0.441，SPIDEr 达 0.288，优于 Pengi
- 声学场景分类：在 CochlScene 上准确率 79.5%，TUT2017 上 64.9%，远超 Pengi（35.3%）
- 音频问答（AQA）：在 ClothoAQA 上二分类准确率达 74.9%，优于 Pengi（64.5%）
- 人声分类（VSC）：在 VocalSound 上准确率达 92.89%，显著高于 CLAP（49.45%）和 Pengi（60.35%）
- 音乐音符分析：在 NSynth Instrument 分类上准确率 78.82%，高于 Pengi（50.07%）

## 局限与风险

- 未报告模型在低资源语言或长尾任务上的泛化能力细节
- SRWT 任务依赖高质量词级标注数据，工业数据集中可能存在标注偏差
- 多任务训练虽避免任务特定微调，但整体训练成本较高（50万步预训练）
- 对话能力评估缺乏定量指标，主要依赖案例展示

## 适合沉淀的概念

`audio-language-model`, `multitask-learning`, `hierarchical-task-tagging`, `word-level-timestamp-prediction`, `speech-recognition-with-timestamps`, `universal-audio-understanding`, `qwen-audio-chat`, `end-to-end-audio-processing`

## 阅读注意

- 重点关注分层标签设计如何缓解多任务干扰，特别是 <|timestamps|> 标签对 grounding 能力的提升机制
- 注意 SRWT 任务虽与 ASR 共享数据，但其训练目标不同，需理解其对模型内部表示的影响
- 对比 Qwen-Audio（仅预训练）与 Qwen-Audio-Chat（加 SFT）的应用场景差异
- 附录中的超参数设置对复现至关重要，尤其是两阶段学习率与 batch size 配置

## 质量说明

- 采用来源：`clean`，`papers/2023/11/2311.07919.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，实验充分，数据详实，方法描述清晰，结果可验证，具备高质量研究特征。
