实体
model speech-model multimodal company
创建2026-04-09
更新2026-04-09
阅读量级1 分钟
实体导读

阿里团队于 2025 年 1 月发布的无缝语音交互多模态大模型。

  1. 基本信息
  2. 贡献
  3. 相关页面

MinMo

阿里团队于 2025 年 1 月发布的无缝语音交互多模态大模型。

基本信息

属性
arXiv 2501.06282
团队 阿里巴巴
发布 2025-01-10
全双工延迟(理论) ~600ms
全双工延迟(实际) ~800ms
Speech-to-Text 延迟 ~100ms

贡献

  • 面向无缝语音交互的多模态 LLM
  • 将语音交互模型分为 native 和 aligned 两大类
  • 实时、自然、类人对话能力

相关页面