# DeepSeek-R1 GRPO Derinlemesine: Açık Reasoning RL'in Matematiği — Group Relative Policy Optimization

> Source: https://sukruyusufkaya.com/learn/llm-muhendisligi/deepseek-r1-grpo-derinlemesine-matematik
> Updated: 2026-08-22T06:25:26.485Z
> Category: LLM Mühendisliği
> Module: Modül 17: Akıl Yürüten Modeller — Test-Time Compute Devrimi
**TLDR:** DeepSeek-R1'in (Ocak 2025) ana eğitim algoritması GRPO (Group Relative Policy Optimization). PPO'dan farkları satır satır türev. Value function'sız avantaj tahmini (grup karşılaştırması). 4 aşamalı eğitim (R1-Zero → Cold Start → Reasoning RL → Distill) detaylı walk-through. 'Aha moments' empirik fenomeni — paper'da verilen örnekler ve istatistik analiz. Türkçe için R1 fine-tune stratejileri.

