5 yazı
Model servis etme nedir? Yönetilen API'den vLLM/TGI/Ollama gibi self-host inference sunucu seçeneklerine; batching, streaming, eşzamanlı istek, verim ve gecikme dengesine kadar sunum katmanı rehberi.
Self-hosted LLM'de fatura ve gecikme servis katmanından gelir. PagedAttention, sürekli gruplama, speculative decoding ve niceleme ile kat kat verim; sahadan.
Self-hosted LLM ile API arasındaki kurumsal karar matrisi: ~500M token/gün break-even hesabı, H100/H200/B200 GPU maliyeti, quantization etkisi, KVKK + BDDK + ITAR/EAR kısıtları, AI sovereignty stratejisi ve 3 anonim Türk sektör vakası (bankacılık, sağlık, KOBİ) ile hibrit yaklaşımın tasarımı. Türk şirketleri için 2026 referans rehberi.
Türkçe açık kaynak LLM ekosisteminin 2026 fotoğrafı: Trendyol-LLM, Cosmos-Llama, KanarYa, Kumru AI, TÜBİTAK BİLGEM yerli model ve T3 AI Baykar savunma modeli. MMLU-TR, TUMLU benchmarkları, lisans, tokenization farkı, VRAM ihtiyacı, self-host gereksinimleri ve hangi modeli hangi use-case için seçmeniz gerektiğine dair detaylı karar rehberi.
2026 itibarıyla en güçlü üç açık ağırlık LLM ailesi — DeepSeek (V3 + R1), Qwen (2.5 + 3) ve Meta Llama (4) — detaylı karşılaştırma. Mimari (MoE vs dense), benchmark (MMLU, HumanEval, GSM8K), Türkçe performans, lisans (MIT vs Apache vs Llama Community), maliyet (self-hosted vs API), donanım (VRAM, GPU), fine-tune dostluğu, ekosistem (Hugging Face, vLLM, Ollama), KVKK / veri egemenliği için avantajlar. Türk şirketleri için kullanım senaryoları.