# DPO Devrim: Rafailov 2023'ün Matematik Keşfi — RLHF'i Tek Loss Fonksiyonuna Sıkıştırmak

> Source: https://sukruyusufkaya.com/learn/llm-muhendisligi/dpo-devrim-rafailov-2023-matematik-kesfi
> Updated: 2026-08-21T03:57:01.048Z
> Category: LLM Mühendisliği
> Module: Modül 15: Tercih Hizalama — RLHF, PPO, DPO, GRPO
**TLDR:** Direct Preference Optimization (Rafailov vd. 2023): RLHF'in 3 aşamasını tek supervised loss'a indiren matematik keşfin tam türevi. Reward model'in 'gizli reformülasyonu', Bradley-Terry + KL constraint optimum çözümü, neden DPO 'her LLM zaten reward model' diyor, kapalı form çözümün matematik anlamı. PPO ile sayısal karşılaştırma, modern DPO varyantları (IPO, KTO, SimPO), Türkçe DPO production pipeline'ı.

