---
title: "2507.05911"
title_zh: "基于可微奖励优化的神经编解码器语言模型语音合成系统"
arxiv_id: "2507.05911"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/07/2507.05911.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 基于可微奖励优化的神经编解码器语言模型语音合成系统

## 一句话定位

提出一种可微奖励优化（DiffRO）方法，直接基于神经编解码器 token 预测奖励，避免传统 RLHF 中合成音频的计算开销，并结合多任务奖励模型实现发音准确性与情感属性的零样本控制。

## 小学生也能听懂

这篇论文发明了一种新方法，让电脑学说话时不用反复播放声音来打分，而是直接看文字预测的好坏来学习，就像老师直接改作文不用录音，还能让电脑说出开心、难过等不同情绪，而且说得特别清楚。

## 为什么值得记录

- 解决了传统 TTS 中 RLHF 依赖后端声码器生成音频导致计算成本高的问题
- 通过 Gumbel-Softmax 实现奖励函数对语言模型输入的可微性，简化训练流程
- 引入多任务奖励模型（MTR），支持从 ASR、情感识别、音质评估等多个维度提供反馈
- 在 seed-tts-eval 基准上实现 SOTA 的 WER 表现，并展示零样本情感与属性控制能力

## 核心方法

- DiffRO 直接从神经编解码器 token 序列预测奖励，而非通过合成音频，减少 FM 和 vocoder 的计算负担
- 使用 Gumbel-Softmax 替代 argmax 操作，使 token 采样过程可微，从而支持端到端反向传播优化
- 构建多任务奖励模型（MTR），集成 ASR、SER、SQA、年龄性别预测等下游任务，提供多维度反馈信号
- 将 MTR 输出的后验概率作为奖励函数，指导语言模型生成符合目标属性（如情感、音质）的 token 序列
- 在 CosyVoice2.0 基础上进行 SFT 和 DiffRO 微调，采用 4×A800 GPU 训练，学习率 1e-5，β=0.1

## 关键结果

- DiffRO-ASR 在 seed-tts-eval 中文子集上 WER 降至 0.78%，英文为 1.89%，显著优于基线 CosyVoice2.0 和 DPO 方法
- 在 CV3-Eval 日语和韩语测试中，DiffRO-ASR 的 WER 分别为 6.36% 和 5.41%，优于未见过该语言的基线模型
- DiffRO-MTR 在情感控制任务中，HAPPY、SAD、ANGRY 三类情感识别准确率分别达 100%、96%、92%（中文），优于 F5-TTS 和 GPT-SoVITS
- MTR 模型在 SQA、年龄性别预测任务上表现优于参考模型（如 DNSMOS、Qwen-Audio），证明编解码器 token 包含丰富声学信息

## 局限与风险

- DiffRO 对 MOS、年龄、性别等属性的控制受限于 FM 和 vocoder 的降噪能力，无法完全决定最终音频质量
- MTR 奖励可能引入与 ASR 无关的信息，导致发音准确性略有下降（如 DiffRO-MTR 在 hard 子集 WER 高于 DiffRO-ASR）
- 实验仅基于 CosyVoice2.0 架构，未验证在其他神经编解码器 LLM 上的通用性
- 情感控制依赖预训练 SER 模型的质量，未见真实人类主观评价（如 MOS）

## 适合沉淀的概念

`differentiable-reward-optimization`, `neural-codec-language-model`, `gumbel-softmax`, `multi-task-reward-model`, `reinforcement-learning-from-human-feedback`, `speech-emotion-recognition`, `zero-shot-tts`, `token2reward-prediction`

## 阅读注意

- 关注 DiffRO 如何绕过音频合成直接优化 token 序列，对比 DPO 的 preference pair 构造难点
- 注意 MTR 模型的结构设计：前端嵌入层 + 多任务注意力池化，支持 codec token 输入
- 分析表 4 中 MOS-Codec 与 MOS-Audio 的差异，理解前端 LM 与后端 FM/vocoder 的解耦影响
- 图 3 展示 laughter 和 breath 等副语言现象的生成，体现 MTR 对非文本信息的建模能力

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/07/2507.05911.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、基线对比和定量结果，方法描述清晰，图表辅助说明充分，具备可复现性。
