# GRPO ve Reasoning RL: DeepSeek-R1'in İçi — Grup-Bazlı Avantaj Tahmininden Process Reward'a

> Source: https://sukruyusufkaya.com/learn/llm-muhendisligi/grpo-reasoning-rl-deepseek-r1
> Updated: 2026-08-17T14:45:34.580Z
> Category: LLM Mühendisliği
> Module: Modül 15: Tercih Hizalama — RLHF, PPO, DPO, GRPO
**TLDR:** GRPO (Group Relative Policy Optimization): DeepSeek'in PPO'ya getirdiği elegant sadeleştirme. Value function olmadan advantage tahmini, grup karşılaştırması, computational verimlilik. DeepSeek-R1 paper'ının (Ocak 2025) anatomi, reasoning eğitiminin RL sıralaması, 'aha moments' fenomeni, process reward model'lerin rolü, o1 vs R1 mimari karşılaştırma, Türkçe reasoning model'i için pratik notlar.

