---
title: "X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs"
title_zh: "X-OPD：面向语音大模型能力对齐的跨模态同策略蒸馏"
arxiv_id: "2603.24596"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/03/2603.24596.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# X-OPD：面向语音大模型能力对齐的跨模态同策略蒸馏

## 一句话定位

提出 X-OPD 框架，通过同策略采样与文本教师模型的 token 级反馈，实现语音 LLM 与文本 LLM 的能力对齐，显著缩小性能差距并缓解灾难性遗忘。

## 小学生也能听懂

这篇论文像教一个会听声音的学生，向只会看文字的老师学习，用“边试边改”的方法，让学生的语音理解和推理能力尽量接近老师，同时不忘自己原来的本领，效果比老方法好很多。

## 为什么值得记录

- 端到端语音 LLM 在复杂推理任务上普遍存在相比文本版本的性能退化问题，X-OPD 提供了一种有效对齐机制
- 传统 SFT 和离线蒸馏方法会加剧性能下降，而 X-OPD 在同策略范式下实现更稳定的优化
- 方法无需依赖人工标注数据，仅需 2.7 万样本即可实现高效对齐，具备强可扩展性
- 双目标设计（模态内+跨模态优势函数）兼顾能力迁移与原始能力保留，优于单一目标策略

## 核心方法

- 构建语音-文本对齐数据集：使用 Tulu 3 和 NaturalReasoning 文本提示，经 Gemini 改写为口语风格后合成语音，并通过 ASR 回译过滤 WER > 5% 的样本
- 采用多采样同策略回滚（n=4）：学生模型对每个提示生成多个响应轨迹，降低梯度估计方差
- 定义双优势函数：模态内优势（A_im）衡量学生与教师在文本输入下的 log-prob 差异；跨模态优势（A_cm）衡量学生在语音输入下与教师文本逻辑的偏差
- 优化目标为加权策略梯度损失：L(θ) = λ·L_im + (1−λ)·L_cm，其中 λ=0.5 为默认平衡参数
- 训练仅更新语言模型主干参数，音频编码器和模态适配器冻结，使用 Adam 优化器（lr=2e-6）和 batch size 256

## 关键结果

- 在 Qwen3-Omni-A3B 上，X-OPD 将语音模态平均性能下降从 11.29% 降至 3.43%，文本模态从 5.51% 降至 0.97%
- 在 BIG Bench Audio 上，X-OPD 达到 93.41% 准确率，显著优于 SFT（87.52%）、离线 KD（87.08%）和 GKD（84.26%）
- 在 MMAR 灾难性遗忘测试中，X-OPD（λ=0.5）仅下降 2.0%，而 SFT 和离线 KD 下降超 11%

## 局限与风险

- 依赖高质量语音合成与 ASR 系统构建对齐数据，合成偏差可能影响蒸馏效果
- 教师模型与学生模型规模差异过大时（如 A22B vs A3B），对齐效率可能受限
- 当前实验仅基于 Qwen3-Omni 架构，未验证在其他语音 LLM 上的通用性

## 适合沉淀的概念

`cross-modal-on-policy-distillation`, `speech-llm-alignment`, `dual-advantage-function`, `catastrophic-forgetting-mitigation`, `on-policy-reinforcement-learning`, `knowledge-distillation-speech-models`, `modality-gap-reduction`, `token-level-feedback-distillation`

## 阅读注意

- 重点关注 3.3 节中 A_im 和 A_cm 的数学定义，理解双优势函数如何分别稳定文本能力和对齐语音输出
- Table 1 中 'Avg. Drop (%)' 指标揭示了当前主流语音 LLM 普遍存在的模态退化问题，是 X-OPD 要解决的核心问题
- Table 3 的 MMAR 结果证明 X-OPD 在保留预训练知识方面远优于传统方法，尤其 λ=1 时几乎无遗忘
- 消融实验显示 λ=0.5 最优，说明模态内与跨模态目标需协同优化，单一目标无法最大化性能

## 质量说明

- 采用来源：`clean`，`papers/2026/03/2603.24596.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，实验设计严谨，包含多基准测试、消融研究和灾难性遗忘分析，数据充分支持结论。
