# Process Reward Models (PRM): Step-Level Supervision — PRM800K Dataset

> Source: https://sukruyusufkaya.com/learn/fine-tuning-cookbook/ftc-prm-process-reward-models-step-level
> Updated: 2026-08-23T11:42:47.733Z
> Category: Fine-Tuning Cookbook (Model-by-Model)
> Module: Part XI — Alignment & Preference Optimization
**TLDR:** PRM = her reasoning step için ayrı reward. Outcome-only (final answer) yerine her ara adım kaliteyi öğretiyor. OpenAI PRM800K dataset, Math-Shepherd otomatik PRM generation, Step-DPO. Test-time tree search (Best-of-N, MCTS) için temel. RTX 4090'da PRM train + use.

