MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
论文导读
提出 MiniCPM-o 4.5,首个支持实时全双工全模态交互的 9B 参数开源模型,通过 Omni-Flow 框架实现视觉、听觉与语音输出的时间对齐流式处理,在边缘设备上实现低延迟主动交互。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
MiniCPM-o 4.5:迈向实时全双工全模态交互
一句话定位
提出 MiniCPM-o 4.5,首个支持实时全双工全模态交互的 9B 参数开源模型,通过 Omni-Flow 框架实现视觉、听觉与语音输出的时间对齐流式处理,在边缘设备上实现低延迟主动交互。
小学生也能听懂
这篇论文造了一个叫MiniCPM-o 4.5的小模型,它像个小助手,能一边听你说话、一边看画面,还能马上开口回应,就像真人聊天一样快,而且能在手机或平板上运行。
为什么值得记录
- 首次实现端到端全双工全模态交互,突破传统轮询式交互范式,支持模型在持续感知环境的同时生成响应并主动发起行为
- 在 9B 参数规模下达到接近 Gemini 2.5 Flash 的视觉语言能力,并在全模态理解上超越 Qwen3-Omni-30B-A3B,展现高效架构设计优势
- 提出 Omni-Flow 统一流式框架和 TAIL 时间对齐交织策略,解决多模态输入输出在时间轴上的同步难题
- 可在 <12GB RAM 的边缘设备上运行,推动实时多模态 AI 在移动端和嵌入式场景的应用落地
核心方法
- 采用端到端全模态架构,包含 SigLIP ViT 视觉编码器、Whisper Medium 音频编码器、Qwen3-8B LLM 主干及轻量级 Llama 语音 token 解码器,所有组件通过 token 级隐藏状态可微连接
- 提出 Omni-Flow 框架,将交互划分为细粒度时间窗口(默认 1.0s),在每个窗口内并行处理新输入并生成输出,实现感知与响应的时间对齐
- 设计 Listen-Speak (LS) 控制机制,分离‘是否说话’与‘说什么’的决策,提升全双工交互稳定性
- 引入 Time-Aligned Interleaving (TAIL) 策略,根据累计播放进度动态调整每块生成的文本量,确保语音输出与当前环境上下文同步
- 训练流程分四阶段:语音预训练 → 联合预训练 → 联合监督微调 → 强化学习(GRPO + RLAIF-V),逐步融合多模态能力并抑制幻觉
- 数据层面构建大规模网络音视频数据与高质量人工标注全双工任务数据,支持连续场景描述与主动提醒等高级能力
关键结果
- 视觉语言能力接近 Gemini 2.5 Flash:在 MMBench EN v1.1 上达 87.6,OCRBench 达 876,DocVQA 达 94.7,优于同规模开源模型
- 全模态理解超越 Qwen3-Omni-30B-A3B,在 OmniDocBench 中英文错误率分别低至 0.109 和 0.162
- 语音生成质量显著提升,在 Expresso 基准测试中表现优于对比模型,且计算效率更高
- 支持实时全双工交互,延迟控制在秒级以下,可在配备 <12GB RAM 的边缘设备上流畅运行
局限与风险
- 时间块大小存在权衡:过小(如 0.1s)会导致建模预算不足,影响输出稳定性;当前最优设置为 1.0s,可能限制极高实时性场景
- 依赖高质量对齐的多模态训练数据,尤其是带精确时间戳的全双工交互样本,数据构建成本较高
- 语音生成仍采用有损压缩的离散 token 表示(S3),可能损失部分声学细节
适合沉淀的概念
全双工多模态交互, omni-flow 框架, time-aligned interleaving, 端到端多模态架构, 实时语音生成, 主动式交互行为, 流式多模态处理, 边缘设备部署
阅读注意
- 重点关注第 3 节 Omni-Flow 的设计选择消融实验(表 1),理解时间粒度、边界显式性和控制机制对性能的影响
- 注意 TAIL 策略如何解决文本生成与语音播放之间的时间错位问题(图 5 对比)
- 评估部分需区分 turn-based 与 full-duplex 两种模式的结果,后者体现真实交互能力
- 附录 A 提供完整模型配置,有助于复现或二次开发
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.27393.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法细节、实验结果、消融分析和模型配置,数据充分支持结论。