# GGUF K-Quants Block Structure: Q2_K → Q8_K + llama-quantize Perplexity Tablosu

> Source: https://sukruyusufkaya.com/learn/fine-tuning-cookbook/ftc-gguf-k-quants-block-structure
> Updated: 2026-08-22T07:45:51.853Z
> Category: Fine-Tuning Cookbook (Model-by-Model)
> Module: Part X — Quantization Engineering
**TLDR:** GGUF — llama.cpp'nin native format'ı, CPU/edge inference için yaygın. K-quants block structure (Q2_K → Q8_K), her bit-width için ayrı struct, llama-quantize ile dönüşüm, perplexity-vs-size eğrisi. RTX 4090'da bf16 → Q4_K_M conversion 5 dakika, Q4 GGUF 4.6 GB → CPU/Pi/iPhone deploy.

