# TensorRT-LLM: NVIDIA Native Engine — INT8 SmoothQuant + FP8 + In-Flight Batching

> Source: https://sukruyusufkaya.com/learn/fine-tuning-cookbook/ftc-tensorrt-llm-engine-build
> Updated: 2026-08-15T18:44:00.877Z
> Category: Fine-Tuning Cookbook (Model-by-Model)
> Module: Part XV — Serving Engineering
**TLDR:** TensorRT-LLM — NVIDIA'nın LLM-spesifik TensorRT engine'i. CUDA kernel'lar Hopper/Ada native, en hızlı inference (vLLM'den +%15-30 throughput). Engine build process, INT8 SmoothQuant, FP8 quantization, multi-LoRA. RTX 4090'da Llama 3.1 8B TRT-LLM engine build (1 saat) + inference.

