实体
model speech-model architecture full-duplex streaming open-source
创建2026-04-15
更新2026-04-15
阅读量级1 分钟
实体导读

Tsinghua 提出的 Codec-free 全双工语音理解与生成模型。

  1. 核心创新
  2. 能力
  3. 与其他模型对比
  4. 关联

SALMONN-omni

Tsinghua 提出的 Codec-free 全双工语音理解与生成模型。

核心创新

  1. Codec-free 架构: 不使用语音 codec(量化 token),直接用 embedding 处理输入/输出语音
  2. Thinking 机制: <start_speak> / <end_speak> token 管理对话状态
  3. 全双工: 能同时听自己生成的语音和背景声音
  4. 异步文本/语音生成: 依赖 embedding 而非 codec

能力

  • 流式语音识别
  • 语音增强
  • 口语问答
  • Turn-taking / Barge-in / Echo Cancellation

与其他模型对比

维度 SALMONN-omni qwen3-omni emova
Codec 无 (embedding-based) Multi-codebook AR S2U 分离
全双工 半双工(Thinker-Talker)
延迟 未公布 234ms 未公布
视觉

关联