# LLM Fine-Tuning: LoRA, QLoRA, DPO ve Modern Hizalama Teknikleri — Kapsamlı Türkçe Rehber 2026

> Source: https://sukruyusufkaya.com/blog/llm-fine-tuning-lora-qlora-dpo
> Updated: 2026-08-23T23:53:22.453Z
> Type: blog
> Category: yapay-zeka
**TLDR:** Bir LLM'i kendi domain'inize uyarlamanın 2026 itibarıyla en güncel ve detaylı Türkçe rehberi. Fine-tuning ne zaman gerekli, LoRA'nın matematiksel temeli, QLoRA ile 4-bit eğitim, DPO'nun PPO'ya üstünlüğü, ORPO/KTO/IPO modern alternatifleri, Türkçe veri seti kaynakları, GPU/bulut maliyet hesabı, üretim pipeline'ı, 3 anonim Türk şirketi vaka çalışması ve KVKK uyumlu eğitim. Geliştiriciler, MLOps mühendisleri ve AI mimarları için.

<tldr data-summary="[&#34;Fine-tuning bir LLM\&#39;in mevcut yeteneklerini değiştirmeden — stil, format, davranış, domain bilgisi gibi belirli boyutları kilitlemek için yapılan ek eğitimdir; tüm ihtiyaçların yaklaşık %5\&#39;i için doğru çözümdür.&#34;,&#34;LoRA (Low-Rank Adaptation), model ağırlıklarının tamamını değil küçük adapter matrislerini eğitir; %0.1-1 parametre değişikliğiyle tam fine-tuning kalitesinin %90-95\&#39;ini sunar.&#34;,&#34;QLoRA, LoRA\&#39;yı 4-bit quantization ile birleştirerek 70B parametreli bir modeli tek bir A100 GPU üzerinde fine-tune edilebilir hale getirir — 2023 sonrası kişisel/küçük ekip fine-tuning patlamasının ana motoru.&#34;,&#34;DPO (Direct Preference Optimization), klasik RLHF\&#39;in PPO ile reward modelinin yerini doğrudan tercih veri seti üzerinde supervised loss ile değiştiren basit ama etkili yöntem; 2024-2026 modern alignment standardı.&#34;,&#34;Türk şirketleri için fine-tuning maliyeti tipik olarak $200-$5.000 arası; veri hazırlığı maliyet ve kalitenin %70\&#39;ini belirler — eğitim sadece son adımdır.&#34;]" data-one-line="Fine-tuning, doğru durumda — RAG ve prompt engineering yeterli olmadığında — bir LLM'in davranışını kalıcı olarak şirketinizin DNA'sına yakınlaştıran ileri seviye AI mühendisliği disiplinidir."></tldr>

## 1. Fine-Tuning Nedir? Niye Gerekir?

LLM'leri kendi kullanım amacınıza uyarlamak için üç ana strateji vardır: **prompt engineering**, **RAG** ve **fine-tuning**. İlk ikisi modeli değiştirmeden çalışırken, fine-tuning **model ağırlıklarını ek eğitim ile günceller**. Doğru durumda muazzam değer üretir; yanlış durumda boşa para harcanmıştır.

<definition-box data-term="Fine-Tuning (İnce Ayar)" data-definition="Önceden eğitilmiş bir dil modelinin (foundation model) ağırlıklarını, özel bir veri seti ve görev üzerinde ek eğitim yaparak güncelleyen süreç. Modelin mevcut bilgi tabanını koruyarak belirli bir domain, stil, format veya davranışa hizalanmasını sağlar. Tam fine-tuning, LoRA, QLoRA, DPO, ORPO gibi farklı yöntemleri kapsar." data-also="Fine Tuning, Model Adaptation"></definition-box>

### Ne Zaman Fine-Tuning?

Pratik karar çerçevesi:

<comparison-table data-caption="Fine-Tuning vs Diğer Adapte Yöntemleri" data-headers="[&#34;İhtiyaç&#34;,&#34;Prompt Eng&#34;,&#34;RAG&#34;,&#34;Fine-tuning&#34;]" data-rows="[{&#34;feature&#34;:&#34;Stil/format kilitleme&#34;,&#34;values&#34;:[&#34;Kısmi&#34;,&#34;-&#34;,&#34;✓ İdeal&#34;]},{&#34;feature&#34;:&#34;Domain bilgisi ekleme&#34;,&#34;values&#34;:[&#34;-&#34;,&#34;✓ İdeal&#34;,&#34;Sınırlı&#34;]},{&#34;feature&#34;:&#34;Güncel veriye erişim&#34;,&#34;values&#34;:[&#34;-&#34;,&#34;✓ İdeal&#34;,&#34;-&#34;]},{&#34;feature&#34;:&#34;Yeni davranış öğretme&#34;,&#34;values&#34;:[&#34;Kısmi&#34;,&#34;-&#34;,&#34;✓ İdeal&#34;]},{&#34;feature&#34;:&#34;Latency azaltma&#34;,&#34;values&#34;:[&#34;-&#34;,&#34;-&#34;,&#34;✓ (küçük modelle)&#34;]},{&#34;feature&#34;:&#34;Token tasarrufu&#34;,&#34;values&#34;:[&#34;-&#34;,&#34;-&#34;,&#34;✓ İdeal&#34;]},{&#34;feature&#34;:&#34;Kurulum süresi&#34;,&#34;values&#34;:[&#34;Saatler&#34;,&#34;Haftalar&#34;,&#34;Hafta-ay&#34;]},{&#34;feature&#34;:&#34;Maliyet&#34;,&#34;values&#34;:[&#34;Çok düşük&#34;,&#34;Orta&#34;,&#34;Yüksek (tek seferlik)&#34;]}]"></comparison-table>

**Pratik kural.** İhtiyaçların %70'i prompt engineering ile, %25'i prompt + RAG ile çözülür. Geri kalan **%5 durumda** fine-tuning gerçek değer üretir:

- **Stil/format sabitleme** — marka sesi, hukuki/tıbbi formatlar
- **Yapılandırılmış çıktı garantili** — her zaman geçerli JSON, XML, SQL üretmek
- **Düşük gecikme + maliyet** — küçük bir modeli büyük modelin davranışına yaklaştırmak (distillation)
- **Domain-spesifik dil** — Türkçe hukuki terminoloji, tıbbi raporlama
- **Yeni davranış** — agent görevleri, tool kullanımı, refleksiyon

<stat-callout data-value="%5" data-context="Üretim LLM uygulamalarında gerçek fine-tuning ihtiyacı —" data-outcome="kalan %95 prompt engineering + RAG kombinasyonu ile çözülür. Fine-tuning'e koşmadan önce bu iki katmanı tükettiğinden emin ol." data-source="{&#34;label&#34;:&#34;OpenAI Cookbook + Anthropic Best Practices&#34;,&#34;url&#34;:&#34;https://platform.openai.com/docs/guides/fine-tuning&#34;,&#34;date&#34;:&#34;2025&#34;}"></stat-callout>

### Niye Önce RAG ve Prompt Engineering?

Fine-tuning beş yan-etkiye sahiptir:

1. **Yüksek başlangıç maliyeti** — GPU saatleri, veri hazırlama, eval setleri
2. **Modelin "donması"** — yeni model çıktığında fine-tune'unuzu yeniden yapmanız gerekir
3. **Catastrophic forgetting** — yanlış yapılan fine-tune, modelin başka yetkinliklerini bozabilir
4. **Veri yönetimi karmaşıklığı** — KVKK + telif + kalite kontrolleri
5. **Eval zorluğu** — fine-tune kalitesini ölçmek prompt eval'inden çok daha zor

Bu nedenle Anthropic, OpenAI ve Google'ın hepsi resmî dokümanlarında **önce prompt + RAG, sonra fine-tuning** sıralamasını öneriyor.

## 2. LLM Eğitim Aşamalarının Tam Resmi

Modern bir LLM'in hayatında dört eğitim aşaması var. Her birinin amacı, veri seti tipi ve hesaplama maliyeti farklı.

<comparison-table data-caption="LLM Eğitim Aşamaları (Tam Resim)" data-headers="[&#34;Aşama&#34;,&#34;Amacı&#34;,&#34;Veri Tipi&#34;,&#34;Süre/Maliyet&#34;]" data-rows='[{"feature":"1. Pretraining","values":["Genel dil yetkinliği","Trilyonlarca token (internet, kitaplar, kod)","Aylar, milyonlarca $"]},{"feature":"2. Supervised Fine-Tuning (SFT)","values":["Talimatları takip","Binlerce yüksek-kalite soru-cevap çifti","Günler, binlerce $"]},{"feature":"3. Preference Optimization (RLHF/DPO/ORPO)","values":["İnsan tercihleri","Tercih çiftleri (A > B)","Günler, binlerce $"]},{"feature":"4. Continued Fine-tuning (sizin yaptığınız)","values":["Domain/stil hizalama","Yüzlerce-binlerce örnek","Saatler-günler, $50-5.000"]}]'></comparison-table>

Kurumsal fine-tuning genelde **4. aşamada** gerçekleşir; bazen 2 + 3'ün eş zamanlı yapıldığı varyasyonlar da var (Constitutional AI, ORPO).

### Supervised Fine-Tuning (SFT)

En temel form — talimat-cevap çiftleri üzerinde standart "next-token prediction" eğitimi. Çoğu kurumsal fine-tune SFT'tir; özellikle stil/format/domain bilgisi için.

### Preference Optimization (Tercih Hizalama)

İnsan değerlendiriciler aynı prompt için iki cevap (A, B) görür ve hangisinin daha iyi olduğunu işaretler. Bu **tercih çiftleri** üzerinde model "iyi cevap" yönüne itilir. Üç ana yöntem:

- **RLHF (PPO):** Klasik. Bir reward model eğitilir, sonra PPO ile policy optimize edilir. Karmaşık, kaynak-yoğun.
- **DPO:** Reward model'i atlar; tercih çiftleri üzerinde doğrudan supervised loss. Basit, etkili, 2024'ten beri standart.
- **ORPO/KTO/IPO:** DPO'nun türevleri ve alternatifleri (aşağıda detaylı).

## 3. PEFT (Parameter-Efficient Fine-Tuning) — Kavramsal Temel

70 milyar parametreli bir modeli tam fine-tune etmek için tüm 70B ağırlığı güncellemek gerekir. Bu **800GB+ VRAM** demek — yalnızca büyük araştırma laboratuvarları ulaşabilir. **PEFT** bu sorunu çözer: sadece **küçük bir parametre kümesini** günceller.

<definition-box data-term="PEFT (Parameter-Efficient Fine-Tuning)" data-definition="Önceden eğitilmiş büyük modellerin tam ağırlıkları yerine küçük bir parametre alt-kümesini eğiterek fine-tuning yapan teknikler ailesi. LoRA, QLoRA, AdaLoRA, IA-3, Prefix Tuning, Prompt Tuning bu aileye dahildir. Hesaplama maliyetini 10-100x azaltır, kalite kaybı genelde %5-10 düzeyinde kalır." data-also="Parameter-Efficient Fine-Tuning"></definition-box>

PEFT ailesinin üyeleri:

- **LoRA** (Low-Rank Adaptation) — en yaygın
- **QLoRA** — LoRA + quantization
- **AdaLoRA** — uyarlanabilir LoRA rank
- **IA-3** — sadece bias terimleri
- **Prefix Tuning** — input embed'lerine prefix ekler
- **Prompt Tuning** — sadece soft prompt eğitir
- **DoRA** (Weight-Decomposed LoRA) — 2024 yeni
- **MoRA** (High-Rank Updating) — 2024 yeni

## 4. LoRA — Düşük Ranklı Adaptasyon

2021'de Microsoft araştırmacılarının (Hu et al.) yayınladığı LoRA, **modern fine-tuning'in altın standardı** haline geldi.

### 4.1. Matematiksel Temel (Kısa)

Tam fine-tuning'de bir weight matrisi <code>W</code> (örn. 4096×4096) doğrudan güncellenir: <code>W_new = W + ΔW</code>. LoRA varsayımı: <code>ΔW</code> aslında **düşük-ranklı** olabilir.

LoRA, <code>ΔW</code>'yi iki küçük matrisin çarpımı olarak ifade eder:

<pre><code>ΔW ≈ B × A
B: 4096 × r
A: r × 4096
r &lt;&lt; 4096 (genelde 4, 8, 16, 32, 64)</code></pre>

Eğitim sırasında **sadece A ve B güncellenir** — orijinal <code>W</code> dondurulur. Inference'ta <code>W + B × A</code> hesaplanır (veya merge edilir).

### 4.2. LoRA Hiperparametreleri

**Rank (r)** — LoRA matrislerinin boyutu. Yaygın değerler: 8 (varsayılan), 16, 32, 64. Daha yüksek rank = daha çok parametre, daha fazla kapasite, ama overfitting riski.

**Alpha (α)** — scaling factor. <code>ΔW_effective = (α/r) × B × A</code>. Pratik tavsiye: <code>α = 2r</code> (örn. r=16 ise α=32).

**Target modülleri** — Hangi katmanlarda LoRA uygulanacak? Yaygın seçenekler:

- <code>q_proj, v_proj</code> — sadece attention sorgu ve değer (en minimal)
- <code>q_proj, k_proj, v_proj, o_proj</code> — tüm attention
- <code>q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj</code> — attention + MLP (en kapsamlı)

**Pratik tavsiye.** Tüm linear katmanlar (attention + MLP) en iyi sonucu verir. Sadece attention'da LoRA, çoğu görevde %5-10 kalite kaybına neden olur.

### 4.3. Tam Fine-Tuning ile Karşılaştırma

<comparison-table data-caption="Tam Fine-Tuning vs LoRA (Llama 3 70B Örneği)" data-headers="[&#34;Boyut&#34;,&#34;Tam Fine-tuning&#34;,&#34;LoRA&#34;]" data-rows="[{&#34;feature&#34;:&#34;Eğitilen parametre&#34;,&#34;values&#34;:[&#34;70B (tam)&#34;,&#34;~0.5B (%0.7)&#34;]},{&#34;feature&#34;:&#34;VRAM ihtiyacı&#34;,&#34;values&#34;:[&#34;800GB+&#34;,&#34;48-80GB&#34;]},{&#34;feature&#34;:&#34;Eğitim süresi&#34;,&#34;values&#34;:[&#34;1x&#34;,&#34;0.5-0.7x&#34;]},{&#34;feature&#34;:&#34;Kalite&#34;,&#34;values&#34;:[&#34;%100 (referans)&#34;,&#34;%90-95&#34;]},{&#34;feature&#34;:&#34;Veri ihtiyacı&#34;,&#34;values&#34;:[&#34;Daha çok&#34;,&#34;Daha az (1K-10K örnek)&#34;]},{&#34;feature&#34;:&#34;Çıktı boyutu&#34;,&#34;values&#34;:[&#34;~140GB&#34;,&#34;~50MB-1GB (sadece adapter)&#34;]},{&#34;feature&#34;:&#34;Multi-task&#34;,&#34;values&#34;:[&#34;Zor&#34;,&#34;Çoklu adapter swap&#34;]}]"></comparison-table>

LoRA'nın **küçük çıktısı** (50MB-1GB) özellikle değerli — bir model üzerinde 10 farklı LoRA adapter çalıştırabilir, runtime'da hızla geçiş yapabilirsiniz.

## 5. QLoRA — 4-bit Quantization + LoRA

2023'te Dettmers ve arkadaşlarının yayınladığı QLoRA, LoRA'yı **quantization** ile birleştirerek 70B modelleri **tek bir A100 GPU**'da eğitilebilir hale getirdi. Kişisel ve küçük ekip fine-tuning ekosisteminin patlamasının ana motoru.

### 5.1. Üç Ana Bileşen

**4-bit NF4 (Normal Float 4) quantization.** Model ağırlıkları 16-bit yerine 4-bit'te saklanır. NF4, standart 4-bit'ten daha doğru — normal dağılımlı verilere optimize.

**Double Quantization (DQ).** Quantization sabitlerini de quantize ederek ek bellek tasarrufu.

**Paged Optimizers.** Optimizer state'i RAM ile GPU arasında sayfa-sayfa hareket ettirir; OOM (out of memory) hatalarını azaltır.

### 5.2. QLoRA ile Pratik Maliyet (2026)

<comparison-table data-caption="QLoRA Maliyet Tahminleri (2026)" data-headers="[&#34;Model&#34;,&#34;GPU&#34;,&#34;Süre (10K örnek)&#34;,&#34;Tahmini Maliyet&#34;]" data-rows="[{&#34;feature&#34;:&#34;Llama 3 8B&#34;,&#34;values&#34;:[&#34;1x RTX 4090 (24GB)&#34;,&#34;2-4 saat&#34;,&#34;$5-15 (RunPod)&#34;]},{&#34;feature&#34;:&#34;Llama 3 70B&#34;,&#34;values&#34;:[&#34;1x A100 80GB&#34;,&#34;8-12 saat&#34;,&#34;$50-150 (Modal/RunPod)&#34;]},{&#34;feature&#34;:&#34;Llama 4 70B&#34;,&#34;values&#34;:[&#34;1x H100 80GB&#34;,&#34;6-10 saat&#34;,&#34;$80-200&#34;]},{&#34;feature&#34;:&#34;Mixtral 8x7B&#34;,&#34;values&#34;:[&#34;1x A100 80GB&#34;,&#34;10-15 saat&#34;,&#34;$80-200&#34;]},{&#34;feature&#34;:&#34;Qwen 2.5 72B&#34;,&#34;values&#34;:[&#34;1x H100 80GB&#34;,&#34;8-12 saat&#34;,&#34;$120-250&#34;]}]"></comparison-table>

**Bu maliyetler sadece eğitim aşaması.** Veri hazırlama, eval, iterasyonlar genelde 2-5x toplam maliyete katkı yapar.

## 6. DPO — Direct Preference Optimization

2023'te Rafailov ve arkadaşlarının yayınladığı DPO, klasik RLHF/PPO'nun yerine **çok daha basit bir matematiksel formülasyon** önerdi. 2024-2026 dönemi modern alignment standardı haline geldi.

<definition-box data-term="DPO (Direct Preference Optimization)" data-definition="İnsan tercih veri seti (chosen/rejected çiftleri) üzerinde reward model eğitimi ve PPO adımlarını atlayarak doğrudan supervised-style bir loss fonksiyonu ile optimizasyon yapan yöntem. Stanford ve CMU araştırmacılarının 2023'te yayınladığı, klasik RLHF'in operasyonel karmaşıklığını dramatik şekilde azaltan modern alignment yöntemi. 2024'ten itibaren açık model ekosisteminde standart." data-also="Direct Preference Optimization"></definition-box>

### 6.1. PPO (Klasik RLHF) vs DPO

<comparison-table data-caption="RLHF (PPO) vs DPO" data-headers="[&#34;Boyut&#34;,&#34;RLHF (PPO)&#34;,&#34;DPO&#34;]" data-rows="[{&#34;feature&#34;:&#34;Reward Model&#34;,&#34;values&#34;:[&#34;Gerekli (ayrı eğitim)&#34;,&#34;Gereksiz&#34;]},{&#34;feature&#34;:&#34;Pipeline aşaması&#34;,&#34;values&#34;:[&#34;3 (SFT + RM + PPO)&#34;,&#34;2 (SFT + DPO)&#34;]},{&#34;feature&#34;:&#34;Eğitim kararlılığı&#34;,&#34;values&#34;:[&#34;Düşük (hyperparam hassasiyeti)&#34;,&#34;Yüksek&#34;]},{&#34;feature&#34;:&#34;Hesaplama maliyeti&#34;,&#34;values&#34;:[&#34;~5x SFT&#34;,&#34;~1.5x SFT&#34;]},{&#34;feature&#34;:&#34;Kod karmaşıklığı&#34;,&#34;values&#34;:[&#34;Yüksek&#34;,&#34;Düşük&#34;]},{&#34;feature&#34;:&#34;Kalite (frontier modeller)&#34;,&#34;values&#34;:[&#34;Tarihsel olarak en iyi&#34;,&#34;Eşdeğer veya üstün (son araştırmalar)&#34;]}]"></comparison-table>

### 6.2. DPO Veri Seti Yapısı

DPO için ihtiyacınız olan: **chosen/rejected** çiftlerinden oluşan dataset.

<pre><code>{
  "prompt": "Müşteri şikayetine nasıl yanıt verirsin?",
  "chosen": "Empatik, çözüm-odaklı, kısa ve net bir yanıt...",
  "rejected": "Defansif, jenerik, çok uzun bir yanıt..."
}</code></pre>

Genelde 500-5.000 tercih çifti yeterli; veri kalitesi miktardan kat kat önemli.

### 6.3. DPO Türevleri (2024-2026)

DPO'nun yayınlanmasından sonra birçok türev önerildi:

- **ORPO (Odds Ratio Preference Optimization)** — SFT ve preference optimization'ı tek adımda yapar. Hong et al. (2024).
- **KTO (Kahneman-Tversky Optimization)** — Tercih çiftleri yerine **tek-cevap ödül/ceza** sinyalleri kullanır. Ethayarajh et al. (2024).
- **IPO (Identity Preference Optimization)** — DPO'nun aşırı uyum (overfitting) sorununa karşı regularization. Azar et al. (2023).
- **CPO (Contrastive Preference Optimization)** — Daha güçlü reject sinyali ile DPO. Xu et al. (2024).
- **simPO (Simple Preference Optimization)** — Reference model'i atlar, basitleştirir. Meng et al. (2024).

<callout-box data-variant="tip" data-title="Pratik Seçim Rehberi">

**Standart kurumsal fine-tune** için: **SFT + DPO** kombinasyonu 2026'nın en kararlı seçimi.

**SFT ve DPO'yu birleştirmek** istiyorsanız (tek aşama): **ORPO**.

**Çift cevap üretmek pahalıysa** (tercih veri seti hazırlamak zor): **KTO** (tek cevap + binary feedback).

PPO sadece akademik araştırma veya frontier model eğitiminde değerli — kurumsal ürün için karmaşıklık değmez.

</callout-box>

## 7. Pratik Fine-Tuning Pipeline

Sıfırdan başarılı bir fine-tune için 7 aşamalı pipeline:

<howto-steps data-name="Üretim Fine-Tuning Pipeline'ı — 7 Aşama" data-description="Sıfırdan üretim kalitesinde fine-tune için adım adım rehber." data-time="P30D" data-steps="[{&#34;name&#34;:&#34;1. Use-Case Tanımı ve Baseline&#34;,&#34;text&#34;:&#34;Hangi problem için fine-tuning gerekli? Prompt + RAG ile ne kadar başarılı oluyor? Baseline metrikler tanımla.&#34;},{&#34;name&#34;:&#34;2. Veri Toplama&#34;,&#34;text&#34;:&#34;500-10.000 yüksek-kalite örnek topla. Manuel etiketleme, mevcut veriden temizleme veya sentetik veri (büyük modelin küçüğe öğretmesi).&#34;},{&#34;name&#34;:&#34;3. Veri Temizleme ve Kalite Kontrol&#34;,&#34;text&#34;:&#34;Duplikatlar, yanlış etiketler, hassas veri (KVKK) temizliği. Eğitim/eval/test bölünmesi (genelde 80/10/10).&#34;},{&#34;name&#34;:&#34;4. Format ve Tokenizasyon&#34;,&#34;text&#34;:&#34;Sohbet şablonu (Llama, Mistral, ChatML), system prompt yapısı. Sequence length seçimi. Tokenizer kontrol.&#34;},{&#34;name&#34;:&#34;5. Eğitim&#34;,&#34;text&#34;:&#34;Framework seçimi (Unsloth, Axolotl, LLaMA Factory). Hyperparameters: learning rate (1e-4 LoRA için, 5e-5 SFT için), batch size, epoch (genelde 1-3), LoRA r/alpha. Cloud GPU veya yerel.&#34;},{&#34;name&#34;:&#34;6. Evaluation&#34;,&#34;text&#34;:&#34;Otomatik metrikler (perplexity, BLEU, custom domain metrics) + LLM-as-judge + insan değerlendirme. Eval seti üretim öncesi mutlak şart.&#34;},{&#34;name&#34;:&#34;7. Deployment&#34;,&#34;text&#34;:&#34;vLLM, TGI veya Ollama ile inference servisi. A/B test (mevcut model vs fine-tune). Performans + maliyet metrik izleme.&#34;}]"></howto-steps>

### 7.1. Eğitim Framework'leri

<comparison-table data-caption="2026 Fine-Tuning Framework Karşılaştırması" data-headers="[&#34;Framework&#34;,&#34;Hız&#34;,&#34;Kolaylık&#34;,&#34;Kapsam&#34;]" data-rows="[{&#34;feature&#34;:&#34;Unsloth&#34;,&#34;values&#34;:[&#34;2-5x hızlı (Triton optimizasyonu)&#34;,&#34;Yüksek (basit Python)&#34;,&#34;LoRA, QLoRA, SFT, DPO&#34;]},{&#34;feature&#34;:&#34;Axolotl&#34;,&#34;values&#34;:[&#34;Standart&#34;,&#34;Orta (YAML config)&#34;,&#34;Tam yelpaze, full fine-tuning dahil&#34;]},{&#34;feature&#34;:&#34;LLaMA Factory&#34;,&#34;values&#34;:[&#34;Standart&#34;,&#34;Yüksek (CLI + UI)&#34;,&#34;LoRA, QLoRA, RLHF, DPO, ORPO, KTO&#34;]},{&#34;feature&#34;:&#34;Hugging Face TRL&#34;,&#34;values&#34;:[&#34;Standart&#34;,&#34;Orta (Python kütüphane)&#34;,&#34;Tam yelpaze, en güncel teknikler&#34;]},{&#34;feature&#34;:&#34;Together / Replicate / Modal&#34;,&#34;values&#34;:[&#34;Bulut&#34;,&#34;Çok yüksek (managed)&#34;,&#34;LoRA, sınırlı kontrol&#34;]},{&#34;feature&#34;:&#34;OpenAI Fine-tuning API&#34;,&#34;values&#34;:[&#34;Bulut&#34;,&#34;Çok yüksek&#34;,&#34;SFT + sınırlı DPO, kapalı kaynak&#34;]}]"></comparison-table>

**Pratik seçim.** Geliştirici/araştırmacı için **Unsloth** (hız + kolaylık). Üretim ekibi için **LLaMA Factory** (geniş kapsam). Cloud kolaylığı için **Together** veya **Modal**. Hassasiyet/uyum kritik kurumsal için **Axolotl + self-hosted GPU**.

### 7.2. Veri Hazırlama — Görünmez Başarı Faktörü

**Veri kalitesi, fine-tune sonucunun %70'ini belirler.** Eğitim sadece son adımdır. Pratik tavsiyeler:

- **Manuel etiketleme > sentetik** kalite açısından, ama maliyet 10-50x
- **Sentetik veri** için yaygın yöntem: GPT-5 veya Claude Opus 4.7 ile büyük bir modele "öğretici" rol vererek küçük modele örnek üretmek
- **Self-Instruct** — modeli kendi örneklerinden öğretme (Stanford 2022)
- **DataDreamer, Distilabel, Lilac** gibi modern veri-hazırlama framework'leri
- Veriyi **eval setinden ayır** — eğitim verisinden sızıntı olmasın
- **Class balance** — kategorilerin dengeli temsil edilmesi

## 8. Türkçe Fine-Tuning — Pratik Notlar

Türkçe LLM fine-tuning'in global rehberlerde olmayan 5 kritik nüansı:

### 8.1. Tokenizer Verimi

Türkçe morfolojik zenginlik nedeniyle tipik tokenizer'da bir kelime 2-5 token'a parçalanır. Bu fine-tuning'de:

- **Sequence length 2x kullanılır** (aynı içerik için)
- **Eğitim maliyeti %30-50 yüksek**
- **Context window'a daha az içerik sığar**

**Çözüm:** Türkçe-özel tokenizer (BERTurk gibi) veya Türkçe vocabulary extension. Llama, Mistral gibi modeller için BPE vocab'a 3K-5K Türkçe token eklemek, Türkçe verimliliği %30-50 artırır.

### 8.2. Türkçe Veri Seti Kaynakları

- **Belebele Turkish** — Türkçe okuma anlama
- **Cosmos QA TR** — sosyal akıl yürütme
- **xCOPA Turkish** — nedensel akıl yürütme
- **WMT translation pairs** — Türkçe-İngilizce çiftler
- **Wikipedia Turkish** — genel bilgi
- **MultiWOZ TR** — diyalog
- **Hugging Face Turkish datasets** — 100+ açık veri seti
- **Cezeri instruction tuning data** — Türkçe instruct
- **Kurumsal veri** — sizin domain veriniz (en değerli)

### 8.3. Base Model Seçimi (Türkçe için)

<comparison-table data-caption="Türkçe Fine-Tune için Base Model" data-headers="[&#34;Model&#34;,&#34;Türkçe Skoru&#34;,&#34;Boyut&#34;,&#34;Lisans&#34;,&#34;Fine-tune dostluğu&#34;]" data-rows="[{&#34;feature&#34;:&#34;Llama 4 8B&#34;,&#34;values&#34;:[&#34;Orta-iyi&#34;,&#34;8B&#34;,&#34;Meta açık&#34;,&#34;Yüksek&#34;]},{&#34;feature&#34;:&#34;Llama 4 70B&#34;,&#34;values&#34;:[&#34;İyi&#34;,&#34;70B&#34;,&#34;Meta açık&#34;,&#34;Yüksek&#34;]},{&#34;feature&#34;:&#34;Mistral Small 3&#34;,&#34;values&#34;:[&#34;İyi&#34;,&#34;22B&#34;,&#34;Apache 2.0&#34;,&#34;Yüksek&#34;]},{&#34;feature&#34;:&#34;Qwen 2.5 14B&#34;,&#34;values&#34;:[&#34;Yüksek (multilingual)&#34;,&#34;14B&#34;,&#34;Apache 2.0&#34;,&#34;Yüksek&#34;]},{&#34;feature&#34;:&#34;Qwen 2.5 72B&#34;,&#34;values&#34;:[&#34;Çok yüksek&#34;,&#34;72B&#34;,&#34;Apache 2.0&#34;,&#34;Yüksek&#34;]},{&#34;feature&#34;:&#34;DeepSeek V3&#34;,&#34;values&#34;:[&#34;Yüksek&#34;,&#34;671B (MoE)&#34;,&#34;MIT&#34;,&#34;Orta (büyük)&#34;]},{&#34;feature&#34;:&#34;BERTurk&#34;,&#34;values&#34;:[&#34;Mükemmel (NLP)&#34;,&#34;Tabanlı&#34;,&#34;MIT&#34;,&#34;NLP görevleri için&#34;]}]"></comparison-table>

**Pratik tavsiye.** Domain-genel Türkçe instruction-tune için **Qwen 2.5 14B** veya **Llama 4 8B** en iyi başlangıç. Türkçe NLP özel (sınıflandırma, NER) için **BERTurk**.

### 8.4. Türkçe Stil Sabitleme

Türkçe'de "siz" / "sen" ayrımı, ton (formal/samimi/resmî), Anadolu/İstanbul dialektleri, devrik vs düz cümle tercihleri — bunlar fine-tune'da kontrol edilmelidir. Eğitim verisini bir editör ile kalite kontrolden geçirmek **şart**.

### 8.5. Domain-Spesifik Türkçe Örnekleri

- **Türk hukuk** — TBK, TMK, KVKK metinleri + emsal davalar
- **Türk vergi** — VUK, KDV, GVK + örnek olaylar
- **Sağlık** — Türkçe tıbbi raporlar (anonim)
- **E-ticaret** — Trendyol, Hepsiburada gibi platformlardan ürün verisi
- **Bankacılık** — BDDK düzenlemeleri + müşteri etkileşim örnekleri

## 9. Donanım, Bulut, Maliyet

### 9.1. GPU Seçimi (2026)

<comparison-table data-caption="Fine-Tuning için GPU Seçenekleri (2026)" data-headers="[&#34;GPU&#34;,&#34;VRAM&#34;,&#34;Tipik Fiyat (USD/saat bulut)&#34;,&#34;Uygun Model Boyutu (QLoRA ile)&#34;]" data-rows="[{&#34;feature&#34;:&#34;RTX 4090&#34;,&#34;values&#34;:[&#34;24GB&#34;,&#34;$0.40-0.80&#34;,&#34;7B-13B&#34;]},{&#34;feature&#34;:&#34;RTX 5090&#34;,&#34;values&#34;:[&#34;32GB&#34;,&#34;$0.60-1.20&#34;,&#34;13B-22B&#34;]},{&#34;feature&#34;:&#34;A100 40GB&#34;,&#34;values&#34;:[&#34;40GB&#34;,&#34;$1.20-2.00&#34;,&#34;13B-34B&#34;]},{&#34;feature&#34;:&#34;A100 80GB&#34;,&#34;values&#34;:[&#34;80GB&#34;,&#34;$1.80-3.50&#34;,&#34;34B-70B&#34;]},{&#34;feature&#34;:&#34;H100 80GB&#34;,&#34;values&#34;:[&#34;80GB&#34;,&#34;$3.50-6.00&#34;,&#34;34B-70B (hızlı)&#34;]},{&#34;feature&#34;:&#34;H200&#34;,&#34;values&#34;:[&#34;141GB&#34;,&#34;$5-9&#34;,&#34;70B+ (rahat)&#34;]},{&#34;feature&#34;:&#34;GB200/B200 (Blackwell)&#34;,&#34;values&#34;:[&#34;192GB&#34;,&#34;$8-15&#34;,&#34;100B+ MoE&#34;]}]"></comparison-table>

### 9.2. Bulut Platformları

- **Modal** — Python-native, anlık GPU, kullandığın kadar öde. Hızlı prototip için ideal.
- **RunPod** — En ucuz spot fiyatları. Geliştirici dostu.
- **Together AI** — Managed fine-tuning + inference, kolay.
- **Replicate** — Hazır fine-tune template'leri.
- **AWS SageMaker / GCP Vertex AI / Azure ML** — Kurumsal ortam, ama daha pahalı.
- **Lambda Cloud** — On-demand H100/H200 erişimi.

### 9.3. Tipik Maliyet Senaryoları

- **Türkçe stil hizalama, Llama 4 8B QLoRA, 5K örnek:** ~$15-40 eğitim + ~$50-100 veri hazırlık + ~$30 eval = **~$100-200 toplam**
- **Domain-özel Mistral Small 3 fine-tune, 20K örnek:** ~$80-200 eğitim + ~$300-800 veri + ~$100 eval = **~$500-1.200**
- **Llama 4 70B QLoRA, 50K örnek + DPO ekleme:** ~$300-600 eğitim (2 fazda) + $1.000-3.000 veri + $200-500 eval = **~$2.000-5.000**

**Hatırlatma:** Veri hazırlık + eval maliyetin %60-70'ini oluşturur. GPU saatleri en küçük kalemdir.

## 10. Vaka Çalışmaları (Anonim Türk Şirketleri)

### Vaka 1 — Türk Bankası: Türkçe Hukuki Belge Asistanı

**Problem.** Bankanın hukuk ekibi sözleşme analizinde GPT-5'i kullanıyordu ama Türk hukukunun spesifik dilini (TBK, TMK referansları, mahkeme jargonu) yeterince yakalayamıyordu.

**Çözüm.** Llama 4 70B üzerinde QLoRA fine-tune:

- **Veri:** 8.000 anonim sözleşme + 3.000 Türk yüksek mahkeme kararı + 2.000 hukuki Q&A çifti
- **Yöntem:** SFT + DPO (avukatlar 1.500 cevap çiftinde değerlendirme yaptı)
- **Süre:** 6 hafta (veri 4 hafta, eğitim + eval 2 hafta)
- **Maliyet:** ~$8.000 (veri etiketleme dahil)

**Sonuç.** Türk hukuk terminolojisinde doğruluk %72'den %91'e çıktı. Sözleşme analizi süresi avukat başına haftalık 14 saatten 5 saate düştü.

### Vaka 2 — E-Ticaret: Kategori Sınıflandırma + Açıklama Üretimi

**Problem.** Yeni eklenen ürünler için manuel kategori seçimi + Türkçe açıklama yazımı saatler alıyordu. GPT-4o-mini ile prompt engineering yetersizdi (kategori taxonomy çok büyük: 12.000 alt-kategori).

**Çözüm.** Qwen 2.5 14B QLoRA fine-tune:

- **Veri:** 250.000 mevcut ürün (ad + açıklama → kategori + tag + SEO-uyumlu açıklama)
- **Yöntem:** SFT (DPO gerek görülmedi)
- **Eğitim:** 2 adet A100 80GB, 18 saat
- **Maliyet:** ~$1.200

**Sonuç.** Kategori sınıflandırma doğruluğu %78'den %96'ya. Yeni ürün başına ortalama insan müdahale süresi 15 dakikadan 1 dakikaya. Aylık 80K ürün işleyişinin maliyeti ChatGPT API'sine kıyasla %90 azaldı (self-hosted Qwen + LoRA).

### Vaka 3 — Sağlık Teknolojisi: Tıbbi Rapor Yapılandırma

**Problem.** Klinik notların yapılandırılmış formata (ICD-10 kodları, tanı + tedavi + ilaç) dönüştürülmesi GPT-5'te %80 doğrulukta kalıyordu; sağlık sektörü %95+ talep ediyor.

**Çözüm.** Mistral Small 3 ORPO ile fine-tune:

- **Veri:** 15.000 anonim klinik not + uzman doktor onaylı yapılandırılmış output
- **Yöntem:** ORPO (SFT + DPO tek aşamada)
- **KVKK önlemleri:** Tüm hasta verisi anonimleştirildi; eğitim on-prem yapıldı; eval audit log'lu
- **Maliyet:** ~$3.500 (anonim doktor etiketleme dahil)

**Sonuç.** Tıbbi yapılandırma doğruluğu %97. KVKK ve sağlık regülasyonu uyumu sağlandı. Türk sigorta şirketleri ile B2B entegrasyona açıldı.

## 11. Yaygın Hatalar ve Anti-Pattern'ler

### 11.1. "Fine-Tune Önce, Soruları Sonra Sor"

En yaygın hata. Önce **prompt + RAG eval'i** yapın; fine-tune'a koşmadan önce o iki katmanın ne kadar başarılı olduğunu bilin.

### 11.2. Az Veri ile Eğitim

500'den az örnekle stil fine-tune yapmaya çalışmak. Genelde başarılı olmaz. Minimum 1.000 yüksek-kalite örnek; ideal 5.000-10.000.

### 11.3. Catastrophic Forgetting

Yanlış learning rate (çok yüksek) veya çok fazla epoch (3+) modelin temel yetkinliklerini bozar. Eğitim sırasında eval seti üzerinde **genel benchmark performansını** da takip edin.

### 11.4. Test Seti Sızıntısı

Eğitim verisinin bir kısmı eval setine geçerse, fine-tune skoru yapay olarak yüksek görünür ama üretimde başarısız olur. Veriyi **temizlik aşamasında ayır**, eğitim sırasında karıştırma.

### 11.5. KVKK Uyumsuz Veri

Müşteri/çalışan kişisel verisi içeren prompt'larla fine-tune yapmak. **KVKK ihlali + öğrenilen kişisel veri model ağırlıklarına gömülür.** Anonimleştirme her zaman şart.

### 11.6. Versiyonlama Yok

Fine-tune adapter'larını ve veri setlerini versiyonlamamak. **HF Hub, W&B, MLflow** ile her eğitim experiment'ini izleyin.

### 11.7. Eval'siz Üretim

"Loss düştü, çalışıyor" deyip canlıya almak. Loss eval değildir; gerçek görev başarısını eval setiyle ölçün.

### 11.8. Yanlış Base Model Seçimi

Türkçe gerektiren göreve sadece-İngilizce model fine-tune etmeye çalışmak. Base model **zaten Türkçe biliyor olmalı**; fine-tune onu domain'inize uyarlar, sıfırdan Türkçe öğretmez.

## 12. Fine-Tuning vs Distillation

**Distillation** — büyük bir modelin (öğretmen) çıktısı ile küçük bir modeli (öğrenci) eğitme. Yaygın fine-tuning kalıbı:

1. Büyük model (Claude Opus 4.7) ile sentetik veri üret
2. Küçük modeli (Llama 4 8B) bu veriyle SFT et
3. Küçük model = ucuz + hızlı + büyük modelin %85-90 kalitesinde

Bu yaklaşım, 2025-2026'nın **en pratik fine-tuning kalıbı** haline geldi — verisini insan etiketlemeyle hazırlamadan kalitesi yüksek fine-tune yapmanın yolu.

## 13. Modern Fine-Tuning Trendleri (2026)

- **Synthetic data dominance** — insan etiketlemesi yerine GPT-5/Claude/Gemini ile veri üretme
- **Distillation everywhere** — frontier modellerden küçüklere bilgi aktarımı
- **Self-Reward modeli** — modelin kendi cevaplarını değerlendirip kendine eğitim verisi üretmesi
- **Verifier modeller** — fine-tune sonucu otomatik kalite kontrolü
- **RLAIF (RL from AI Feedback)** — insan yerine başka bir AI'ın tercihleri
- **Continual learning** — modelin sürekli güncellenmesi (catastrophic forgetting'i önleyerek)
- **PEFT yeni teknikler** — DoRA, MoRA, LoftQ; LoRA'nın kalitesini artıran 2024-2025 yenilikleri

## 14. KVKK Uyumlu Fine-Tuning

Fine-tuning yaparken kişisel veri içeren eğitim seti kullanmak özel dikkat gerektirir.

### 14.1. Riskler

- **Veri modele gömülür** — fine-tune sonrası modelden bu veriyi "silme" pratik olarak imkansızdır
- **Membership inference saldırısı** — model çıktısından eğitim verisi üyeliği tespit edilebilir
- **Veri sızıntısı** — model bazen eğitim verisini neredeyse aynen üretir

### 14.2. Korunma Yöntemleri

1. **Anonimleştirme** — TC, ad, telefon, e-posta gibi PII çıkar
2. **Differential privacy** — eğitime gürültü ekle (kalite vs gizlilik dengesi)
3. **Federated learning** — veriyi merkezîleştirmeden eğit (gelişmiş)
4. **Veri yerleşimi** — Türkiye veya AB-içi GPU'larla eğit
5. **Audit log** — hangi veri hangi eğitimde kullanıldı

### 14.3. EU AI Act Açısından

Fine-tune edilen model **yüksek risk** kategorisinde ise (kredi skoru, İK seçimi vb.):

- Teknik dokümantasyon (Annex IV)
- Eğitim verisi yönetişimi
- Risk değerlendirmesi
- İnsan denetimi
- Uyum değerlendirmesi (conformity assessment)

Detay için sitedeki **KVKK + EU AI Act + ISO 42001 Uyum Rehberi**ne bakın.

## 15. Sıkça Sorulan Sorular

<callout-box data-variant="answer" data-title="Fine-tune mu yapmalıyım, RAG mı?">

**Önce RAG'ı dene.** Fine-tune yalnızca: (a) stil/format/davranış kilitleme, (b) düşük latency için küçük modele büyük model davranışını öğretme, (c) Türkçe domain dili (hukuk, tıp) sabitleme, (d) yapılandırılmış çıktı garantisi gerekli ise. Bilgi tabanı + güncel veri için RAG her zaman daha hızlı/ucuz.

</callout-box>

<callout-box data-variant="answer" data-title="LoRA mı, QLoRA mı, tam fine-tune mu?">

%95 vakada **QLoRA**. Yalnızca: (a) frontier model üzerinde çalışıyorsanız ve GPU'nuz büyük, (b) "her zerre kalite önemli" demek istiyorsanız tam fine-tune. LoRA (quantization'sız), 16-bit GPU yeterse ve hız önemli ise tercih.

</callout-box>

<callout-box data-variant="answer" data-title="DPO mu, ORPO mu, KTO mu?">

**DPO** standart kurumsal seçim. **ORPO** SFT + DPO'yu tek aşamada birleştirir, pipeline'ı basitleştirir. **KTO** tercih çifti üretmek pahalıysa (sadece tek-cevap binary feedback yeterli). 2026'da çoğu durum için DPO veya ORPO yeterli.

</callout-box>

<callout-box data-variant="answer" data-title="Hangi base model ile başlamalıyım?">

Türkçe için: **Qwen 2.5 14B** veya **Llama 4 8B/70B**. Ticari kullanım için Apache 2.0/MIT lisans tercih edin. Yetenek paritesi için Mistral Small 3 de güçlü. Test eden eval setiniz olmadan seçim yapmayın.

</callout-box>

<callout-box data-variant="answer" data-title="Ne kadar veri yeterli?">

Stil hizalama için 1.000-3.000 yüksek-kalite örnek; domain bilgisi için 5.000-15.000; davranış değişikliği için 10.000+. Kalite > miktar her zaman.

</callout-box>

<callout-box data-variant="answer" data-title="Fine-tune ne kadara mal olur?">

Türkiye'de tipik aralık: **$200-$5.000** (model boyutu + veri etiketleme + eval). Sentetik veri kullanırsanız maliyeti %60 azaltabilirsiniz. Veri etiketleme genelde en pahalı kalemdir.

</callout-box>

<callout-box data-variant="answer" data-title="Fine-tune ettiğim modeli üretime nasıl alırım?">

**vLLM** (en hızlı, üretim sınıfı), **TGI** (Hugging Face), **Ollama** (kolay self-hosted), **LMDeploy** (TensorRT-LLM tabanlı). LoRA adapter'ları base model üzerine merge edebilir veya runtime'da yükleyebilirsiniz.

</callout-box>

<callout-box data-variant="answer" data-title="Catastrophic forgetting'i nasıl önlerim?">

Düşük learning rate (1e-4 LoRA, 5e-5 SFT), az epoch (1-3), eğitim sırasında genel benchmark eval (MMLU, HumanEval), LoRA tercih edin (tam fine-tune'dan daha az forgetting). Mixed batch (yeni veri + genel veri) yardımcı olur.

</callout-box>

<callout-box data-variant="answer" data-title="OpenAI veya Anthropic fine-tuning API'sini kullanmalı mıyım?">

OpenAI'ın SFT + sınırlı DPO fine-tuning API'si var; kolay ama kapalı kaynak (model dışarı çıkmaz) + pahalı. Anthropic'in resmî public fine-tune API'si yok (Enterprise için sınırlı). KVKK + maliyet kontrolü için **kendi self-hosted fine-tune** çoğu durumda daha iyi.

</callout-box>

<callout-box data-variant="answer" data-title="Fine-tune model nasıl test edilir?">

3 katmanlı eval: **(1)** Otomatik metrikler (perplexity, exact match, BLEU/ROUGE eğer çeviri/özetleme), **(2)** LLM-as-judge (GPT-5 / Claude Opus 4.7 ile çiftli karşılaştırma), **(3)** İnsan değerlendirme (50-200 örnek üzerinde). Üçü birlikte güvenilir sonuç verir.

</callout-box>

<callout-box data-variant="answer" data-title="Sentetik veri ne kadar güvenli?">

Sentetik veri 2026'da yaygın ve etkili. Riskler: **(a)** öğretmen modelin önyargıları aktarılır, **(b)** çeşitlilik azalabilir (model collapse). Hibrit yaklaşım önerilir: %70 sentetik + %30 insan-etiketli.

</callout-box>

<callout-box data-variant="answer" data-title="Fine-tune sonrası model boyutu büyür mü?">

LoRA / QLoRA için: HAYIR. Adapter ~50MB-1GB; merge edilince base model boyutunda kalır. Tam fine-tune: base model boyutunu korur (~140GB Llama 70B için).

</callout-box>

<callout-box data-variant="answer" data-title="LoRA adapter'ları nasıl yönetirim?">

**Hugging Face Hub** (private repo), **MLflow Model Registry**, **W&B Artifacts** ile versiyonlayın. vLLM ve TGI runtime'da multi-adapter yüklemeyi destekler — tek model üzerinde 10 farklı LoRA'yı hızla swap edebilirsiniz.

</callout-box>

<callout-box data-variant="answer" data-title="Türkçe için BERTurk mü, LLM mi fine-tune?">

Görev türüne bağlı: **NLP klasik** (sınıflandırma, NER, sentiment) için BERTurk küçük + hızlı + yeterli. **Üretken görevler** (yazım, çeviri, soru-cevap) için LLM (Qwen, Llama, Mistral) fine-tune gerekli.

</callout-box>

<callout-box data-variant="answer" data-title="Fine-tune işimi otomatize edebilir miyim?">

Evet. **Continuous fine-tuning** pipeline'ı: kullanıcı feedback toplama → eval skoru izleme → eşik altına düşerse otomatik yeniden eğit → A/B test → rollout. MLflow + Argo Workflows + Modal/Together kombinasyonu pratik.

</callout-box>

## 16. Bir Sonraki Adım

Şirketinizde LLM fine-tuning stratejisi geliştirmek veya mevcut bir fine-tune'u üretim kalitesine taşımak için:

1. **Fine-Tune Use-Case Değerlendirmesi.** Gerçekten fine-tune gerekli mi? RAG/prompt yeterli mi? Yatırım hesabı + 4 saatlik atölye.
2. **Veri ve Pipeline Kurulumu.** Türkçe veri toplama, etiketleme stratejisi, eğitim platformu seçimi, eval harness — uçtan uca pipeline tasarımı.
3. **Production Fine-Tune Audit.** Mevcut fine-tune'unuz varsa: kalite, KVKK uyumu, maliyet, observability açısından 360° denetim.

İletişim için site üzerindeki contact formunu kullanabilirsiniz.

<references-list data-items="[{&#34;title&#34;:&#34;LoRA: Low-Rank Adaptation of Large Language Models&#34;,&#34;url&#34;:&#34;https://arxiv.org/abs/2106.09685&#34;,&#34;author&#34;:&#34;Hu et al.&#34;,&#34;publishedAt&#34;:&#34;2021-06&#34;,&#34;publisher&#34;:&#34;Microsoft Research&#34;},{&#34;title&#34;:&#34;QLoRA: Efficient Finetuning of Quantized LLMs&#34;,&#34;url&#34;:&#34;https://arxiv.org/abs/2305.14314&#34;,&#34;author&#34;:&#34;Dettmers et al.&#34;,&#34;publishedAt&#34;:&#34;2023-05&#34;,&#34;publisher&#34;:&#34;University of Washington&#34;},{&#34;title&#34;:&#34;DPO: Your Language Model is Secretly a Reward Model&#34;,&#34;url&#34;:&#34;https://arxiv.org/abs/2305.18290&#34;,&#34;author&#34;:&#34;Rafailov et al.&#34;,&#34;publishedAt&#34;:&#34;2023-05&#34;,&#34;publisher&#34;:&#34;Stanford&#34;},{&#34;title&#34;:&#34;ORPO: Monolithic Preference Optimization without Reference Model&#34;,&#34;url&#34;:&#34;https://arxiv.org/abs/2403.07691&#34;,&#34;author&#34;:&#34;Hong et al.&#34;,&#34;publishedAt&#34;:&#34;2024-03&#34;,&#34;publisher&#34;:&#34;KAIST&#34;},{&#34;title&#34;:&#34;KTO: Model Alignment as Prospect Theoretic Optimization&#34;,&#34;url&#34;:&#34;https://arxiv.org/abs/2402.01306&#34;,&#34;author&#34;:&#34;Ethayarajh et al.&#34;,&#34;publishedAt&#34;:&#34;2024-02&#34;,&#34;publisher&#34;:&#34;Stanford&#34;},{&#34;title&#34;:&#34;IPO: A General Theoretical Paradigm&#34;,&#34;url&#34;:&#34;https://arxiv.org/abs/2310.12036&#34;,&#34;author&#34;:&#34;Azar et al.&#34;,&#34;publishedAt&#34;:&#34;2023-10&#34;,&#34;publisher&#34;:&#34;Google DeepMind&#34;},{&#34;title&#34;:&#34;InstructGPT: Training language models with human feedback&#34;,&#34;url&#34;:&#34;https://arxiv.org/abs/2203.02155&#34;,&#34;author&#34;:&#34;Ouyang et al.&#34;,&#34;publishedAt&#34;:&#34;2022-03&#34;,&#34;publisher&#34;:&#34;OpenAI&#34;},{&#34;title&#34;:&#34;DoRA: Weight-Decomposed Low-Rank Adaptation&#34;,&#34;url&#34;:&#34;https://arxiv.org/abs/2402.09353&#34;,&#34;author&#34;:&#34;Liu et al.&#34;,&#34;publishedAt&#34;:&#34;2024-02&#34;,&#34;publisher&#34;:&#34;NVIDIA&#34;},{&#34;title&#34;:&#34;Constitutional AI: Harmlessness from AI Feedback&#34;,&#34;url&#34;:&#34;https://arxiv.org/abs/2212.08073&#34;,&#34;author&#34;:&#34;Bai et al.&#34;,&#34;publishedAt&#34;:&#34;2022-12&#34;,&#34;publisher&#34;:&#34;Anthropic&#34;},{&#34;title&#34;:&#34;Self-Instruct: Aligning Language Models with Self-Generated Instructions&#34;,&#34;url&#34;:&#34;https://arxiv.org/abs/2212.10560&#34;,&#34;author&#34;:&#34;Wang et al.&#34;,&#34;publishedAt&#34;:&#34;2022-12&#34;,&#34;publisher&#34;:&#34;University of Washington&#34;},{&#34;title&#34;:&#34;Unsloth Documentation&#34;,&#34;url&#34;:&#34;https://unsloth.ai/&#34;,&#34;author&#34;:&#34;Unsloth AI&#34;,&#34;publishedAt&#34;:&#34;2025&#34;,&#34;publisher&#34;:&#34;Unsloth&#34;},{&#34;title&#34;:&#34;Hugging Face TRL&#34;,&#34;url&#34;:&#34;https://huggingface.co/docs/trl/&#34;,&#34;author&#34;:&#34;Hugging Face&#34;,&#34;publishedAt&#34;:&#34;2025&#34;,&#34;publisher&#34;:&#34;Hugging Face&#34;},{&#34;title&#34;:&#34;Axolotl&#34;,&#34;url&#34;:&#34;https://github.com/axolotl-ai-cloud/axolotl&#34;,&#34;author&#34;:&#34;Axolotl&#34;,&#34;publishedAt&#34;:&#34;2025&#34;,&#34;publisher&#34;:&#34;Axolotl&#34;},{&#34;title&#34;:&#34;LLaMA Factory&#34;,&#34;url&#34;:&#34;https://github.com/hiyouga/LlamaFactory&#34;,&#34;author&#34;:&#34;LLaMA Factory&#34;,&#34;publishedAt&#34;:&#34;2025&#34;,&#34;publisher&#34;:&#34;GitHub&#34;},{&#34;title&#34;:&#34;KVKK - 6698 Sayılı Kanun&#34;,&#34;url&#34;:&#34;https://www.kvkk.gov.tr/&#34;,&#34;author&#34;:&#34;T.C. KVKK&#34;,&#34;publishedAt&#34;:&#34;2016&#34;,&#34;publisher&#34;:&#34;Türkiye Cumhuriyeti&#34;},{&#34;title&#34;:&#34;EU AI Act&#34;,&#34;url&#34;:&#34;https://artificialintelligenceact.eu/&#34;,&#34;author&#34;:&#34;European Commission&#34;,&#34;publishedAt&#34;:&#34;2024-03&#34;,&#34;publisher&#34;:&#34;EU&#34;}]"></references-list>

---

Bu rehber yaşayan bir belgedir; fine-tuning ekosistemi (yeni yöntemler, framework'ler, base model'ler) her çeyrek değiştiği için **çeyreklik olarak güncellenmektedir**.