Most LLM inference spend is idle GPU capacity. This guide covers five concrete optimization levers – GPU sharing, continuous batching, quantization, right-sizing, and autoscaling – with specific configs, tools, and metrics for each. Includes a working KEDA ScaledObject for vLLM queue-depth autoscaling.