---
title: "Baichuan-Omni Technical Report"
title_zh: "Baichuan-Omni 技术报告"
arxiv_id: "2410.08565"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2024/10/2410.08565.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Baichuan-Omni 技术报告

## 一句话定位

提出首个开源 7B 全模态大模型 Baichuan-Omni，支持图像、视频、音频和文本的并发处理与交互，采用两阶段对齐与多任务微调训练框架。

## 小学生也能听懂

这篇论文造了一个能同时看懂图片、视频、听懂声音和读懂文字的小机器人，就像给手机加了“眼睛”和“耳朵”，还能用中文聊天，而且把方法公开让大家一起改进。

## 为什么值得记录

- 填补了开源社区在高性能全模态模型方面的空白，尤其在中文多模态理解任务中表现突出
- 提出创新的 Conv-GMLP 音频投影结构，在保持音频信息完整性的同时实现高效下采样
- 设计流式多模态交互机制，支持音频边界预测与视觉特征实时编码，提升人机交互体验
- 开源模型、训练代码与评估脚本，推动全模态研究社区发展

## 核心方法

- 构建高质量全模态数据集：整合开源、合成与内部标注数据，涵盖图像-文本、视频-文本、音频-文本及其跨模态交互数据
- 三阶段视觉-语言对齐：冻结 LLM 训练视觉投影器 → 解冻视觉编码器联合训练 → 全参数微调以维持语言能力
- 基于 Siglip-384px 的视觉编码器 + AnyRes 方法支持任意分辨率输入，保留高分辨率细节
- 视频对齐采用渐进式策略：先利用图像-文本数据增强视觉理解，再混合视频-文本数据进行训练
- 音频模块使用 Whisper-large-v3 编码器 + Conv-GMLP 投影器，替代传统池化以保留更多音频信息
- 全模态对齐阶段联合训练图像、视频、音频与文本模态，建立统一表示空间
- 多任务监督微调覆盖超 200 项任务、60 万样本，采用样本打包（packing）技术提升训练效率

## 关键结果

- 语言能力：在 CMMLU（72.2%）和 C-Eval（68.9%）上显著优于 VITA-8x7B，体现强中文理解能力
- 图像理解：在 MMBench-CN（74.9%）、SEED-IMG（74.1%）、MMMU（47.3%）等基准上全面超越 VITA，接近 Qwen2-VL 水平
- 音频理解：在 AIR-Bench 等生成式音频理解任务中表现稳健，验证 Conv-GMLP 结构有效性
- 跨模态交互：支持图像-音频-文本联合推理任务，如听音频描述后补充图像信息

## 局限与风险

- 图像任务性能仍落后于专用视觉模型 Qwen2-VL，表明全模态集成带来一定性能折衷
- 未公开具体训练计算成本与硬件配置，影响复现可行性评估
- 流式交互机制虽被提出，但缺乏端到端延迟与实时性指标验证

## 适合沉淀的概念

`multimodal-large-language-model`, `audio-visual-language-alignment`, `conv-gmlp`, `anyres-image-encoding`, `streaming-multimodal-interaction`, `cross-modal-fine-tuning`, `omni-modal-dataset-construction`, `loss-based-data-filtering`

## 阅读注意

- 关注 3.2.3 节中 Conv-GMLP 的结构设计及其对音频信息保留的作用
- 注意 3.3 节中基于损失分布的数据清洗策略（μ±σ 过滤）如何提升 SFT 数据质量
- 对比 Table 2 与 Table 3 可发现模型在 MCQ 与 VQA 任务上的表现差异，反映推理能力边界
- Section 4.5 的消融实验验证了各模态分支与全模态对齐的必要性

## 质量说明

- 采用来源：`clean`，`papers/2024/10/2410.08565.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的训练流程、数据构成、模型架构与实验结果，关键创新点清晰，实验设计合理，具备可验证性与技术深度。
