# RLHF'in Doğuşu: Christiano 2017'den ChatGPT'ye Yedi Yıllık Yolculuk — İnsan Tercihiyle Hizalama'nın Tarihsel ve Felsefi Anatomisi

> Source: https://sukruyusufkaya.com/learn/llm-muhendisligi/rlhf-dogusu-christiano-2017-chatgpt-tarih-felsefe
> Updated: 2026-08-11T06:33:19.287Z
> Category: LLM Mühendisliği
> Module: Modül 15: Tercih Hizalama — RLHF, PPO, DPO, GRPO
**TLDR:** RLHF'in tarihsel ve felsefi temelleri: Christiano vd. 2017 'Deep RL from Human Preferences' paper'ından başlayarak, Stiennon 2020 özetleme çalışması, Ouyang 2022 InstructGPT, Aralık 2022 ChatGPT lansmanına uzanan yedi yıllık dönüşüm. Niye sadece SFT yetmiyor, 'helpful-harmless-honest' üçgeninin gerilimi, Goodhart Yasası ve reward hacking sorunu. Türkçe için kültürel bağlamla alignment ne demek — sen/siz ayrımı, sosyal hassasiyet, KVKK sınırı. Müfredatın en kritik kavramsal dersi.

