---
title: "Spirit-LM"
title_zh: "Spirit-LM：交错语音与文本的多模态语言模型"
arxiv_id: "2402.05755"
paper_type: "model"
source_kind: "raw"
raw_path: "raw/papers/2024/02/2402.05755.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Spirit-LM：交错语音与文本的多模态语言模型

## 一句话定位

提出 Spirit LM，一种基于 Llama 2 持续训练的 7B 参数多模态语言模型，支持语音与文本的自由交错生成，并通过少量样本实现跨模态任务学习。

## 小学生也能听懂

这篇论文造了一个叫 Spirit LM 的聪明机器人，它能像人一样边听边说，还能把说的话和写的字混在一起理解与生成，比如先说“你好”，再写“今天天气”，它都能接得上，而且只用很少的例子就能学会新任务。

## 为什么值得记录

- 首次将大规模文本 LLM（Llama 2）扩展为可同时生成和理解语音与文本的统一模型
- 引入词级交错训练策略，显著提升语音-文本对齐能力与跨模态生成质量
- 提出 Speech-Text Sentiment Preservation (STSP) 基准，用于评估生成模型在跨模态情感保持方面的表现
- 展示 Spirit LM 在 ASR、TTS 和语音分类等任务上的少样本学习能力，无需任务特定微调
- 开源模型权重与推理代码，推动语音-文本统一建模研究

## 核心方法

- 基于 Llama 2-7B 进行持续预训练，融合文本（BPE）、语音（HuBERT 单元）及交错语音-文本数据
- 采用词级交错策略：在语音-文本对齐数据中，于词边界随机切换模态，形成如 '[Text] the cat [Speech] [Hu3]...[Hu200]' 的输入序列
- Base 版使用 HuBERT 语音单元；Expressive 版额外引入 pitch tokens（64 类 VQ-VAE 编码 F0）和 style tokens（100 类 k-means 聚类自 speechprop 特征）
- 三种数据类型混合训练：纯文本（300B tokens）、纯语音（458K 小时）、对齐语音-文本（111K 小时），采样比例各占 33.3%
- 语音合成采用 HifiGAN 声码器，配合时长预测模块，输入为去重后的 HuBERT/pitch/style tokens
- 训练共 100k 步（约 100B tokens），使用 AdamW 优化器，学习率余弦退火
- 通过特殊 token [Text]/[Speech] 控制生成模态，支持 S→T、T→S、S→S、T→T 四种生成方向

## 关键结果

- 在 Speech-Text Sentiment Preservation (STSP) 基准上，Spirit LM Expressive 在 S→T 方向达到 54% 准确率，显著优于随机基线（33%）
- 少样本 ASR（LibriSpeech clean）WER 达 21.9%（10-shot），TTS CER 为 45.5%，接近级联系统性能
- 跨模态 StoryCloze 任务中，S→T 准确率比纯语音任务高 5 点，表明文本生成能力更强
- 交错训练使语音-文本特征对齐度显著提升：中间层相似度比非交错模型高 20% 以上
- Expressive 版本在情感保持任务上优于 Base 版（如 EMO 指标提升约 20 点），但语义任务略有下降（如 StoryCloze 降 4 点）
- MMLU（5-shot）准确率保持在 33% 以上，证明文本知识未因语音训练而严重退化

## 局限与风险

- 语音生成质量仍低于级联系统（ASR + Llama 2 + TTS），尤其在低资源场景下
- Expressive 版本因引入额外 token 导致序列变长，带来约 4-5 点的语义理解性能下降
- 依赖自动对齐的语音-文本数据，对齐错误可能影响模型鲁棒性
- 未进行安全对齐训练，生成内容可能存在毒性风险（文中已量化分析）
- 声码器仅支持 4 个 Expresso 说话人，限制了语音多样性

## 适合沉淀的概念

`speech-text-interleaving`, `multimodal-language-model`, `few-shot-speech-generation`, `expressive-speech-tokens`, `hubert-tokenization`, `speech-sentiment-preservation`, `cross-modal-alignment`, `llama2-fine-tuning`

## 阅读注意

- 重点关注 3.1 节中的交错机制设计：为何在词边界切换模态？如何保证因果性？
- 对比 Table 4 与 Table 10：Accuracy-token 归一化对语音任务影响更大，需注意指标差异
- Figure 6 展示了模态对齐的内部机制，是理解跨模态能力的关键
- Appendix C 详细描述了 STSP 少样本示例构造流程，涉及情感一致性过滤
- Table 9 显示 Spirit LM Expressive 的 bitrate 为 307 bps，高于 Base 版（225 bps），反映表达性代价

## 质量说明

- 采用来源：`raw`，`raw/papers/2024/02/2402.05755.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的训练细节、消融实验、生成示例和开源链接，数据充分，方法可复现。
