概念导读
Large Audio-Language Models 在长音频推理时 KV cache 占用巨大。
- 核心问题
- 方法
- 意义
- Related
AudioKV: 音频 LLM 的 KV Cache 驱逐策略
核心问题
Large Audio-Language Models 在长音频推理时 KV cache 占用巨大。
方法
针对音频 token 的 KV cache eviction 策略,在保持质量的同时降低显存占用。
意义
长音频推理(如 40 分钟音频)的工程优化,与 qwen3-omni 的长音频处理能力相关。