# Optimization: SGD'den AdamW'a, Lion'a, Muon'a — Modern LLM'in Tüm Optimizer'ları

> Source: https://sukruyusufkaya.com/learn/llm-muhendisligi/optimization-sgd-adam-adamw-lion-muon
> Updated: 2026-09-09T14:31:37.190Z
> Category: LLM Mühendisliği
> Module: Modül 1: AI Engineer'ın Matematiksel Cephaneliği
**TLDR:** Gradient descent ailesinin geçmişi ve geleceği: GD, SGD, Momentum (Heavy ball, Nesterov), AdaGrad, RMSProp, Adam, AdamW, Lion, Muon. Learning rate schedules: linear warmup + cosine decay. Loss landscape: sharp vs flat minima.

