# Quantization Derinlemesine: INT4'ten FP8'e — Modelinizi 4× Küçültmek, 2× Hızlandırmak

> Source: https://sukruyusufkaya.com/learn/llm-muhendisligi/quantization-derinlemesine-int4-fp8
> Updated: 2026-08-22T16:45:39.354Z
> Category: LLM Mühendisliği
> Module: Modül 16: Üretim Mühendisliği — Self-Host, Quantization, Sunum, İzleme
**TLDR:** LLM quantization'ın matematiksel ve mühendislik anatomi: INT8, INT4, FP8 formatları, GPTQ (Frantar 2022) vs AWQ (Lin 2023) vs GGUF (Gerganov) algoritmaları, kalite-boyut-hız trade-off'ları. Llama-3-8B Türkçe DPO model'ini 4-bit AWQ ile quantize etme, kalite kaybı ölçümü, RTX 4090'da Llama-3-70B çalıştırma, mobil cihaz deployment'ı.

