# CUDA Graph Capture: Static-Shape Inference Graph + Latency Tail Bitirme

> Source: https://sukruyusufkaya.com/learn/fine-tuning-cookbook/ftc-cuda-graph-capture
> Updated: 2026-08-15T22:47:02.135Z
> Category: Fine-Tuning Cookbook (Model-by-Model)
> Module: Part XIII — Custom Kernels & Performance Surgery
**TLDR:** CUDA Graph — kernel launch overhead'ini eliminating teknik. Bir compute graph'i tek seferlik 'capture' et, sonra 'replay' et — her replay 5-10 µs (kernel launch'un 30-50 µs'sinden çok daha az). Inference latency için kritik (özellikle decoded tokens fast-path). vLLM kullanır. Static-shape gerek (shape değişirse re-capture).

