7/23/2026
What this post added
This post details techniques to optimize LLM inference speed and reduce costs in production, including continuous batching, speculative decoding (draft-target, Medusa, EAGLE-3, N-gram speculation), KV cache optimizations (KV cache-aware routing, CPU offloading), quantization (mixed-precision, rotation-based, curvature-based), kernel optimizations (kernel fusion, attention kernels, asynchronous compute, PDL), intelligent request routing (geo-aware load balancing, LoRA-aware routing), and topology-aware parallelism (Tensor Parallelism, Expert Parallelism).