---
title: "Speech-Omni-Lite : Portable Speech Interfaces for Vision–Language Models"
title_zh: "Speech-Omni-Lite：面向视觉-语言模型的轻量级语音接口"
arxiv_id: "2603.09627"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2026/03/2603.09627.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Speech-Omni-Lite：面向视觉-语言模型的轻量级语音接口

## 一句话定位

提出一种低成本、可移植的语音理解与生成框架，通过冻结视觉-语言主干并插入轻量模块，实现语音模态扩展，避免灾难性遗忘。

## 小学生也能听懂

这篇论文像给一个只会看图说话的机器人加了个“耳朵”和“嘴巴”，让它能听懂和说出语音，而且不用重新训练整个大脑，只加几个小零件，省时间又省钱，还能在不同机器人身上通用。

## 为什么值得记录

- 解决了大规模全模态模型训练成本高、数据需求大的问题，仅需数千小时语音数据即可达到百万小时训练模型的性能
- 提出QTATS数据构造策略，利用ASR语料通过LLM反向生成问答对，显著降低语音生成训练的数据依赖
- 设计模块化架构，语音投影器和生成器可跨不同VL主干迁移，提升部署灵活性
- 保持主干模型完全冻结，有效防止灾难性遗忘，保留原有视觉-语言能力

## 核心方法

- 采用Thinker-Talker范式：VL主干作为Thinker处理语义，轻量模块负责语音输入输出
- 语音输入：使用流式离散语音 tokenizer（HuBERT + FSQ）将语音转为离散 token，经 speech projector 映射至VL输入空间
- 语音输出：speech token generator 将VL隐藏状态转为离散语音 token，再经 CA-DiT 结构的 de-tokenizer 合成波形
- 训练分两阶段：先训 speech projector（ASR + QA 数据），再训 speech token generator（QTATS 数据）
- 引入辅助 text projector 实现文本条件监督，使QTATS数据可用于语音生成训练
- 所有主干参数冻结，仅优化约415M参数的 speech projector 和 encoder-decoder 结构的 token generator

## 关键结果

- 在8B规模下，Speech-Omni-Lite 的 spoken QA 准确率达85.00%（LLaMA Questions）和76.26%（AlpacaEval），接近 Qwen2.5-Omni-7B 等百万小时训练模型
- 内容一致性（WER）平均为18.46%，虽低于最优模型，但显著优于部分参数量更大的系统（如 Baichuan-Omni-1.5）
- 语音投影器在不同规模VL主干间表现出强迁移性：32B版本在 TriviaQA 上准确率达85.86%，优于8B版本的71.80%
- 端到端延迟为1345.79ms（生成1秒语音），其中 de-tokenizer 占84.7%（1139ms）
- 仅用4,128小时ASR数据训练 tokenizer 和 projector，QTATS生成145万问答对，训练成本约为传统方法的1/10

## 局限与风险

- ASR性能（CER/WER）落后于大规模omni模型，因训练数据量较少且 tokenizer 未充分优化
- de-tokenizer 延迟过高，占整体响应时间的84%以上，影响实时交互体验
- QTATS依赖LLM生成问题，可能存在语义偏差或低质量问题，影响生成语音的准确性
- 未在视频或多轮对话场景验证，泛化能力有待进一步测试

## 适合沉淀的概念

`speech-omni-lite`, `qtats-data-construction`, `speech-projector`, `speech-token-generator`, `frozen-vl-backbone`, `streaming-speech-tokenizer`, `ca-dit-detokenizer`, `thinker-talker-architecture`

## 阅读注意

- 重点关注3.2.1节QTATS构造流程：如何利用ASR语料和LLM生成训练数据
- 对比Table 2中ASR与QA性能差异，理解轻量模块在理解vs生成任务上的表现权衡
- Appendix C的延迟分析揭示系统瓶颈在de-tokenizer，提示后续优化方向
- Appendix D/E提供模块结构消融实验，有助于理解设计选择依据

## 质量说明

- 采用来源：`clean`，`papers/2026/03/2603.09627.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，方法描述清晰，实验充分，包含消融研究和迁移性验证，数据与结论一致。
