# DPO Math: Bradley-Terry → Loss Function Derivation — Niye Reward Model Gerekmez?

> Source: https://sukruyusufkaya.com/learn/fine-tuning-cookbook/ftc-dpo-mathematical-derivation
> Updated: 2026-08-18T17:21:59.521Z
> Category: Fine-Tuning Cookbook (Model-by-Model)
> Module: Part XI — Alignment & Preference Optimization
**TLDR:** DPO (Rafailov et al. 2023) — RLHF'in matematiksel ekvivalenti, ama TEK aşama. Bradley-Terry preference model → KL-constrained RL objective → closed-form policy gradient → SFT-like loss. β hiperparametresinin gradient üzerindeki etkisi, RTX 4090'da DPO TRL DPOTrainer Lab.

