实体
model speech-model end-to-end open-source
创建2026-04-09
更新2026-04-09
阅读量级1 分钟
实体导读

中科院团队基于 LLaMA-3.1-8B 构建的语音交互模型,发表于 ICLR 2025。

  1. 基本信息
  2. 架构
  3. 贡献
  4. 相关页面

LLaMA-Omni

中科院团队基于 LLaMA-3.1-8B 构建的语音交互模型,发表于 ICLR 2025。

基本信息

属性
arXiv 2409.06666
团队 中科院(CAS)
发布 2024-09-10
会议 ICLR 2025
底座 LLaMA-3.1-8B-Instruct

架构

  • 语音编码器 + LLM + 语音解码器
  • 流式语音输出
  • 低延迟推理

贡献

  • 早期探索如何基于开源 LLM 构建语音交互模型
  • 验证了 speech adapter 方案的可行性
  • ICLR 2025 接收,影响力较大

相关页面