论文
arXiv2603.09627
时间2026-03
来源Markdown
页面质量中文卡片
阅读量级75 分钟

Speech-Omni-Lite : Portable Speech Interfaces for Vision–Language Models

论文导读

提出一种低成本、可移植的语音理解与生成框架,通过冻结视觉-语言主干并插入轻量模块,实现语音模态扩展,避免灾难性遗忘。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Speech-Omni-Lite:面向视觉-语言模型的轻量级语音接口

一句话定位

提出一种低成本、可移植的语音理解与生成框架,通过冻结视觉-语言主干并插入轻量模块,实现语音模态扩展,避免灾难性遗忘。

小学生也能听懂

这篇论文像给一个只会看图说话的机器人加了个“耳朵”和“嘴巴”,让它能听懂和说出语音,而且不用重新训练整个大脑,只加几个小零件,省时间又省钱,还能在不同机器人身上通用。

为什么值得记录

  • 解决了大规模全模态模型训练成本高、数据需求大的问题,仅需数千小时语音数据即可达到百万小时训练模型的性能
  • 提出QTATS数据构造策略,利用ASR语料通过LLM反向生成问答对,显著降低语音生成训练的数据依赖
  • 设计模块化架构,语音投影器和生成器可跨不同VL主干迁移,提升部署灵活性
  • 保持主干模型完全冻结,有效防止灾难性遗忘,保留原有视觉-语言能力

核心方法

  • 采用Thinker-Talker范式:VL主干作为Thinker处理语义,轻量模块负责语音输入输出
  • 语音输入:使用流式离散语音 tokenizer(HuBERT + FSQ)将语音转为离散 token,经 speech projector 映射至VL输入空间
  • 语音输出:speech token generator 将VL隐藏状态转为离散语音 token,再经 CA-DiT 结构的 de-tokenizer 合成波形
  • 训练分两阶段:先训 speech projector(ASR + QA 数据),再训 speech token generator(QTATS 数据)
  • 引入辅助 text projector 实现文本条件监督,使QTATS数据可用于语音生成训练
  • 所有主干参数冻结,仅优化约415M参数的 speech projector 和 encoder-decoder 结构的 token generator

关键结果

  • 在8B规模下,Speech-Omni-Lite 的 spoken QA 准确率达85.00%(LLaMA Questions)和76.26%(AlpacaEval),接近 Qwen2.5-Omni-7B 等百万小时训练模型
  • 内容一致性(WER)平均为18.46%,虽低于最优模型,但显著优于部分参数量更大的系统(如 Baichuan-Omni-1.5)
  • 语音投影器在不同规模VL主干间表现出强迁移性:32B版本在 TriviaQA 上准确率达85.86%,优于8B版本的71.80%
  • 端到端延迟为1345.79ms(生成1秒语音),其中 de-tokenizer 占84.7%(1139ms)
  • 仅用4,128小时ASR数据训练 tokenizer 和 projector,QTATS生成145万问答对,训练成本约为传统方法的1/10

局限与风险

  • ASR性能(CER/WER)落后于大规模omni模型,因训练数据量较少且 tokenizer 未充分优化
  • de-tokenizer 延迟过高,占整体响应时间的84%以上,影响实时交互体验
  • QTATS依赖LLM生成问题,可能存在语义偏差或低质量问题,影响生成语音的准确性
  • 未在视频或多轮对话场景验证,泛化能力有待进一步测试

适合沉淀的概念

speech-omni-lite, qtats-data-construction, speech-projector, speech-token-generator, frozen-vl-backbone, streaming-speech-tokenizer, ca-dit-detokenizer, thinker-talker-architecture

阅读注意

  • 重点关注3.2.1节QTATS构造流程:如何利用ASR语料和LLM生成训练数据
  • 对比Table 2中ASR与QA性能差异,理解轻量模块在理解vs生成任务上的表现权衡
  • Appendix C的延迟分析揭示系统瓶颈在de-tokenizer,提示后续优化方向
  • Appendix D/E提供模块结构消融实验,有助于理解设计选择依据

质量说明

  • 采用来源:cleanpapers/2026/03/2603.09627.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文结构完整,方法描述清晰,实验充分,包含消融研究和迁移性验证,数据与结论一致。