---
title: "Paper: 2603.11089"
title_zh: "V2A-DPO：面向视频到音频生成的全偏好优化"
arxiv_id: "2603.11089"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/03/2603.11089.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# V2A-DPO：面向视频到音频生成的全偏好优化

## 一句话定位

提出 V2A-DPO 框架，通过 AudioScore 评分系统、自动化偏好对生成和课程学习策略，优化流模型在视频到音频生成任务中对人类偏好的对齐能力。

## 小学生也能听懂

这篇论文教电脑看视频时，能自动配出更好听、更合适的背景音乐或声音，就像给动画片配音效一样，它用打分系统和“先易后难”的学习方法，让电脑越来越懂人类喜欢什么样的声音。

## 为什么值得记录

- 首次将 Direct Preference Optimization (DPO) 成功适配于基于流的视频到音频生成模型，解决了传统方法在风格控制、美学质量和综合评估方面的不足。
- 提出 AudioScore 多维度评分系统，整合语义一致性、时间对齐、感知质量和美学吸引力，实现与人类偏好高度对齐的自动化评估。
- 构建首个面向 V2A 任务的大规模高质量视频-文本-音频偏好对数据集（约 48K 对），支持细粒度人类偏好学习。
- 在 VGGSound 基准上，DPO 优化的 MMAudio 模型在 IS、IB-score 和 DeSync 等指标上显著优于 DDPO 和预训练基线，达到 SOTA 性能。

## 核心方法

- AudioScore：融合 ImageBind（视频-音频语义相似度）、CLAP（文本-音频语义一致性）、Synchformer（时间对齐误差 DeSync）、PANNs Inception Score 和 PESQ 五个维度得分，通过 MLP 和 Softmax 对齐人类标注的 Good/Medium/Bad 分类。
- 偏好对生成：对每个视频-文本提示生成多个音频样本，使用 AudioScore 预测概率，选择“Good”概率最高者为胜者，“Bad”概率最高者为败者，构建自动偏好对。
- 课程学习增强 DPO：根据偏好对复杂度分数（score_c）划分训练阶段，先学习差异明显的简单对，再学习差异细微的复杂对，提升优化稳定性。
- Flow-DPO 目标函数：将 DPO 应用于流匹配模型，通过最小化胜者与败者在向量场预测误差上的差异，引导策略模型逼近偏好样本的生成路径。
- 混合数据集训练：结合 46K 自动生成的偏好对与 2K 人工标注对，兼顾可量化指标与主观美学偏好。

## 关键结果

- MMAudio-DPO 相比预训练基线，IS 提升 1.81（+10.4%），IB-score 提升 0.86（+2.6%），DeSync 降低 0.09（-20.5%）。
- MMAudio-DPO 在 FD_PaSST、IS、DeSync 等多个指标上超越所有已发表 V2A 模型，达到当前最优性能。
- Frieren 模型经 V2A-DPO 优化后，在 IS 和 IB-score 上同样显著优于 DDPO 优化版本和原始模型。
- 消融实验表明，β=600 和 score_Δ=0.7 为最优超参组合；移除课程学习会导致性能下降，验证其必要性。

## 局限与风险

- AudioScore 虽整合多维度指标，但对‘美学吸引力’的建模仍依赖有限的人工标注，自动化评估存在局限。
- 实验仅在 VGGSound 数据集和两个流模型（MMAudio、Frieren）上验证，泛化性需进一步测试。
- 偏好对生成依赖预训练模型采样，若初始生成质量差，可能影响偏好对的有效性。
- 未与更多 RL-based 方法（如 PPO）对比，DDPO 作为唯一基线可能不足以全面证明 DPO 优势。

## 适合沉淀的概念

`video-to-audio-generation`, `direct-preference-optimization-dpo`, `flow-matching`, `human-preference-alignment`, `audio-quality-assessment`, `curriculum-learning`, `multimodal-alignment`, `vgssound-dataset`

## 阅读注意

- 重点关注 AudioScore 如何融合多模态特征并实现对齐，尤其是其训练过程与损失设计。
- 注意 Flow-DPO 如何将传统 DPO 的 log-ratio 形式转化为流模型中的向量场误差比较。
- 课程学习的复杂度分数 score_c 计算方式及其在训练调度中的作用值得深入分析。
- 实验部分需对比 DDPO 与 DPO 在相同奖励信号下的表现差异，理解 DPO 在稳定性与效率上的优势。
- 查看项目网站 demo 以直观感受生成音频在时间对齐和语义一致性上的改进。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/03/2603.11089.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，方法描述清晰，实验充分，包含消融研究与可视化示例，数据与代码未提及但提供 demo 链接，整体信息可信且可复现性强。
