VITA
论文导读
提出首个开源全模态(视频、图像、文本、音频)大语言模型 VITA,支持无需唤醒词和音频打断交互,采用双工部署架构实现自然人机交互。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
VITA:迈向开源交互式全模态大语言模型
一句话定位
提出首个开源全模态(视频、图像、文本、音频)大语言模型 VITA,支持无需唤醒词和音频打断交互,采用双工部署架构实现自然人机交互。
小学生也能听懂
这篇论文造了一个叫VITA的机器人,它能同时看懂图片、视频、听懂声音和文字,不用喊“嘿”就能对话,还能一边听一边回答,像真人聊天一样,而且把全部技术都公开给大家用。
为什么值得记录
- 填补开源社区在全模态理解与交互能力上的空白,对标 GPT-4o 等闭源模型
- 首次实现非唤醒交互与音频打断交互的开源方案,推动交互式 MLLM 研究
- 完整开源模型、训练代码与部署框架,促进社区协作与复现
- 支持中英双语,扩展 Mixtral 8x7B 的中文能力,提升多语言实用性
核心方法
- 以 Mixtral 8x7B 为基座,扩展中文词汇至 51,747,并进行双语指令微调
- 采用三阶段训练流程:LLM 指令调优 → 多模态对齐 → 多模态指令调优
- 视觉使用 InternViT-300M + 动态分块策略,音频使用 341M 参数 Transformer 编码器 + Mel 滤波器
- 引入状态标记 <1>/<2>/<3> 区分有效音频查询、噪声音频和文本查询,实现端到端输入类型识别
- 构建含 474K 噪声音频样本的数据集,用于训练模型过滤非查询语音
- 部署采用双工架构:一个模型生成响应,另一个持续监听环境,检测到新查询时切换角色
- 使用 SileroVAD 进行语音活动检测,结合状态标记实现非唤醒交互
关键结果
- 在 C-EVAL 和 AGIEVAL 中文基准上分别提升 3.38 和 4.45 分,数学推理 GSM8K 提升 11.67 分
- ASR 任务中,Wenetspeech Test_Net CER 为 12.15,Librispeech Test_clean WER 为 8.14
- 图像理解性能接近 LLaVA-Next 和 Gemini 1.5 Pro,视频理解略低于 LLaVA-Next-Video 但支持更广泛模态
- 在 MME、MMBench、OCRBench 等 10 个多模态基准上表现稳健,达到当前开源领先水平
局限与风险
- 基础能力仍落后于 GPT-4o 等闭源模型,尤其在复杂推理与跨模态一致性方面
- 噪声音频构造依赖现有数据答案合成,存在误判为有效查询的情况,需更精细设计
- TTS 依赖外部工具(如 GPT-SoVITS),未实现端到端语音输出,影响实时性
- 视频处理未使用动态分块,长视频 token 效率有待优化
适合沉淀的概念
multimodal-llm, audio-interrupt-interaction, non-awakening-interaction, duplex-deployment, state-token, mixtral-8x7b, internvit-300m, silero-vad, end-to-end-multimodal, chinese-vocabulary-expansion
阅读注意
- 关注状态标记 <1>/<2>/<3> 的设计如何使模型区分有效与无效音频输入
- 注意双工部署中两个模型角色切换的具体机制与上下文继承方式
- 观察训练数据拼接策略(如 6K token 拼接)对 batch 效率与多图上下文的支持
- 留意系统提示(system prompt)如何显式区分图像、视频与纯文本输入以避免冲突
- 思考噪声音频构造方法的局限性及其对实际交互体验的影响
质量说明
- 采用来源:
clean,papers/2024/08/2408.05211.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的架构设计、训练流程、实验结果与部署方案,数据详实,方法可复现,但部分实现细节(如音频编码器具体结构、双工通信协议)未完全公开。