# GRPO RL Stage: Math + Code Reward — Convergence Sayıları (Qwen-7B + GSM8K +%5-8)

> Source: https://sukruyusufkaya.com/learn/fine-tuning-cookbook/ftc-grpo-rl-math-code-reward
> Updated: 2026-08-20T17:20:28.427Z
> Category: Fine-Tuning Cookbook (Model-by-Model)
> Module: Part XII — Reasoning Model FT (R1-style)
**TLDR:** Reasoning model'in son aşaması: GRPO ile RL. SFT base'in üzerine math correctness + code execution reward'larıyla GRPO. Reward shaping (correctness 1.0, format 0.2, length penalty 0.001), advantage normalization, KL constraint. RTX 4090 + Qwen 2.5 7B-Instruct + GSM8K: 6-8 saat, accuracy +%5-8.

