# Reward Model'in Matematiği: Bradley-Terry 1952'den Modern LLM Reward Mimari'ye — Tercihten Skalar Skora Geçiş

> Source: https://sukruyusufkaya.com/learn/llm-muhendisligi/reward-model-matematik-bradley-terry-modern-mimari
> Updated: 2026-08-17T01:24:50.460Z
> Category: LLM Mühendisliği
> Module: Modül 15: Tercih Hizalama — RLHF, PPO, DPO, GRPO
**TLDR:** RLHF'in kalbi olan reward model'in matematiksel anatomisi: Bradley-Terry 1952 logistik tercih modelinin türetilmesi, sigmoid'in olasılıkçı yorumu, ranking loss'un türevi, RM mimari seçimleri (SFT'den ayrı vs ortak gövde + value head), kalibrasyon ve overconfidence sorunları, multiple comparison'lar için Plackett-Luce uzantısı, Türkçe için RM eğitiminin pratik tuzakları.

