9 yazı
SFT, DPO ve RFT arasındaki farkları ve her birini ne zaman kullanacağınızı sahadan anlatıyorum: gösterimden ödüle uzanan ince ayar kararı ve KVKK notları.
DPO, LLM'leri insan tercihlerine ayrı ödül modeli ve RL olmadan hizalar. Kayıp sezgisi, beta, tercih verisi, RLHF karşılaştırması, KVKK ve Türkçe örnek.
SFT, DPO/ORPO/KTO ve RFT/GRPO'yu elinizdeki veriye göre seçin. 2026 ince ayar rehberi: yöntem tablosu, RAG karşılaştırması, KVKK ve proje kontrol listesi.
RLHF nedir? RLHF (Reinforcement Learning from Human Feedback, insan geri bildiriminden pekiştirmeli öğrenme), bir dil modelinin çıktılarını insanların tercihlerine göre puanlayıp bu tercihleri öğreten bir ödül modeliyle modeli yeniden eğiten hizalama yöntemidir. Bu rehber: net tanım, RLHF nasıl çalışır, SFT ile ödül modeli farkı, DPO karşılaştırması, Türkiye ve sektör örnekleri, sınırlar ve sık sorulan sorular.
LLM nedir? Büyük Dil Modelleri (LLM) nasıl çalışır, Transformer mimarisi neyi çözer, token / embedding / context window ne demek, GPT-5 / Claude Opus 4.7 / Gemini 3 / Llama 4 hangisi hangi göreve uygundur? Türkçe LLM performansı, eğitim aşamaları, hallucination kontrolü ve maliyet modeliyle kapsamlı 2026 referansı.
2026'nın fine-tuning yığını: base → SFT → DPO. Tercih optimizasyonu, LoRA/QLoRA ve fine-tuning'i ne zaman RAG yerine seçeceğinizi sahadan anlatıyorum.
KVKK'nın 12 Mart 2026'da yayımladığı Etken Yapay Zeka rehberi, agentic AI sistemlerinde çok-adımlı veri işleme, kara-kutu derinleşmesi ve sorumluluk dağılımını yeniden tanımlıyor. 15 soruluk değerlendirme çerçevesi + 7 adımlı DPIA şablonu + üretken AI özel riskleri + bankacılık ve e-ticaret vakaları ile DPO'lar için tam uygulama rehberi.
AI etik ve güvenliğinin felsefi temelinden üretim kontrollerine kapsamlı Türkçe rehber. Sorumlu AI prensipleri (FAT - Fairness, Accountability, Transparency, Privacy, Safety), bias kaynakları ve azaltma, hallucination kontrolü, alignment teknikleri (Constitutional AI, RLHF, RLAIF), prompt injection ve jailbreak savunması, deepfake tespiti, red teaming, EU AI Act + ISO 42001 entegrasyonu, sorumlu AI olgunluk modeli ve 3 anonim Türk şirketi vaka çalışması.
Bir LLM'i kendi domain'inize uyarlamanın 2026 itibarıyla en güncel ve detaylı Türkçe rehberi. Fine-tuning ne zaman gerekli, LoRA'nın matematiksel temeli, QLoRA ile 4-bit eğitim, DPO'nun PPO'ya üstünlüğü, ORPO/KTO/IPO modern alternatifleri, Türkçe veri seti kaynakları, GPU/bulut maliyet hesabı, üretim pipeline'ı, 3 anonim Türk şirketi vaka çalışması ve KVKK uyumlu eğitim. Geliştiriciler, MLOps mühendisleri ve AI mimarları için.