---
title: "LLM Inference Optimization"
created: 2026-05-10
updated: 2026-05-10
type: concept
tags: [inference, inference-optimization, acceleration, stub]
sources: []
---

# LLM Inference Optimization

LLM inference optimization covers methods that reduce latency, memory, or cost during model serving, including speculative decoding, KV-cache optimization, routing, and compression.

## Related

- [[speculative-decoding]] — Draft-and-verify acceleration.
- [[audio-kv-cache]] — KV-cache pressure in audio-language models.
- [[dflash]] — Diffusion-based decoding acceleration.
