# KV Cache + Paged Attention: Inference Serving Optimization — vLLM Paged Attention ve Continuous Batching

> Source: https://sukruyusufkaya.com/learn/llm-muhendisligi/kv-cache-paged-attention-vllm-continuous-batching
> Updated: 2026-08-17T20:55:19.437Z
> Category: LLM Mühendisliği
> Module: Modül 8: Attention Mathematics — Transformer'ın Kalbi
**TLDR:** LLM inference serving optimization: KV cache anatomy (prefill vs decode phases), memory fragmentation problem, paged attention (vLLM 2023 Kwon), continuous batching, dynamic memory allocation. Llama-3 production serving math: throughput, latency trade-offs, multi-tenancy.

