# FP8 Inference: vLLM SmoothQuant + TensorRT-LLM — RTX 4090'da Production-Ready

> Source: https://sukruyusufkaya.com/learn/fine-tuning-cookbook/ftc-fp8-inference-vllm-smoothquant
> Updated: 2026-08-20T14:57:02.097Z
> Category: Fine-Tuning Cookbook (Model-by-Model)
> Module: Part X — Quantization Engineering
**TLDR:** FP8 training prematur olsa da FP8 inference 2026'da production-grade. vLLM'in native FP8 (Llama 3.1+/Qwen 2.5+ destek), TensorRT-LLM SmoothQuant, AWQ-marlin INT4 vs FP8 karşılaştırma. RTX 4090'da Llama 3.1 8B FP8 dönüşüm + serving (~120 tok/s vs bf16 95).

