---
title: "VITA: Towards Open-Source Interactive Omni Multimodal LLM"
title_zh: "VITA：迈向开源交互式全模态大语言模型"
arxiv_id: "2408.05211"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2024/08/2408.05211.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# VITA：迈向开源交互式全模态大语言模型

## 一句话定位

提出首个开源全模态（视频、图像、文本、音频）大语言模型 VITA，支持无需唤醒词和音频打断交互，采用双工部署架构实现自然人机交互。

## 小学生也能听懂

这篇论文造了一个叫VITA的机器人，它能同时看懂图片、视频、听懂声音和文字，不用喊“嘿”就能对话，还能一边听一边回答，像真人聊天一样，而且把全部技术都公开给大家用。

## 为什么值得记录

- 填补开源社区在全模态理解与交互能力上的空白，对标 GPT-4o 等闭源模型
- 首次实现非唤醒交互与音频打断交互的开源方案，推动交互式 MLLM 研究
- 完整开源模型、训练代码与部署框架，促进社区协作与复现
- 支持中英双语，扩展 Mixtral 8x7B 的中文能力，提升多语言实用性

## 核心方法

- 以 Mixtral 8x7B 为基座，扩展中文词汇至 51,747，并进行双语指令微调
- 采用三阶段训练流程：LLM 指令调优 → 多模态对齐 → 多模态指令调优
- 视觉使用 InternViT-300M + 动态分块策略，音频使用 341M 参数 Transformer 编码器 + Mel 滤波器
- 引入状态标记 <1>/<2>/<3> 区分有效音频查询、噪声音频和文本查询，实现端到端输入类型识别
- 构建含 474K 噪声音频样本的数据集，用于训练模型过滤非查询语音
- 部署采用双工架构：一个模型生成响应，另一个持续监听环境，检测到新查询时切换角色
- 使用 SileroVAD 进行语音活动检测，结合状态标记实现非唤醒交互

## 关键结果

- 在 C-EVAL 和 AGIEVAL 中文基准上分别提升 3.38 和 4.45 分，数学推理 GSM8K 提升 11.67 分
- ASR 任务中，Wenetspeech Test_Net CER 为 12.15，Librispeech Test_clean WER 为 8.14
- 图像理解性能接近 LLaVA-Next 和 Gemini 1.5 Pro，视频理解略低于 LLaVA-Next-Video 但支持更广泛模态
- 在 MME、MMBench、OCRBench 等 10 个多模态基准上表现稳健，达到当前开源领先水平

## 局限与风险

- 基础能力仍落后于 GPT-4o 等闭源模型，尤其在复杂推理与跨模态一致性方面
- 噪声音频构造依赖现有数据答案合成，存在误判为有效查询的情况，需更精细设计
- TTS 依赖外部工具（如 GPT-SoVITS），未实现端到端语音输出，影响实时性
- 视频处理未使用动态分块，长视频 token 效率有待优化

## 适合沉淀的概念

`multimodal-llm`, `audio-interrupt-interaction`, `non-awakening-interaction`, `duplex-deployment`, `state-token`, `mixtral-8x7b`, `internvit-300m`, `silero-vad`, `end-to-end-multimodal`, `chinese-vocabulary-expansion`

## 阅读注意

- 关注状态标记 <1>/<2>/<3> 的设计如何使模型区分有效与无效音频输入
- 注意双工部署中两个模型角色切换的具体机制与上下文继承方式
- 观察训练数据拼接策略（如 6K token 拼接）对 batch 效率与多图上下文的支持
- 留意系统提示（system prompt）如何显式区分图像、视频与纯文本输入以避免冲突
- 思考噪声音频构造方法的局限性及其对实际交互体验的影响

## 质量说明

- 采用来源：`clean`，`papers/2024/08/2408.05211.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的架构设计、训练流程、实验结果与部署方案，数据详实，方法可复现，但部分实现细节（如音频编码器具体结构、双工通信协议）未完全公开。
