概念
inference kv-cache audio efficiency long-context
创建2026-04-15
更新2026-04-15
阅读量级1 分钟
概念导读

Large Audio-Language Models 在长音频推理时 KV cache 占用巨大。

  1. 核心问题
  2. 方法
  3. 意义
  4. Related

AudioKV: 音频 LLM 的 KV Cache 驱逐策略

核心问题

Large Audio-Language Models 在长音频推理时 KV cache 占用巨大。

方法

针对音频 token 的 KV cache eviction 策略,在保持质量的同时降低显存占用。

意义

长音频推理(如 40 分钟音频)的工程优化,与 qwen3-omni 的长音频处理能力相关。