3 yazı
MMLU, HumanEval, SWE-bench Verified/Pro, ARC-AGI-2, GPQA Diamond, AIME, LiveCodeBench v6, Terminal-Bench 2.0, OSWorld, HLE ve Türkçe benchmark'lar (TR-MMLU, TUMLU) — her birinin neyi ölçtüğü, frontier eşikleri, kontaminasyon ve cherry-picking riskleri, CTO + yatırımcı + mühendis için pratik anlam. 32+ kaynak.
GPT-5.5, Claude Opus 4.7 ve Gemini 3.1 Pro'yu Türkçe görevlerde uçtan uca karşılaştırdık: TR-MMLU ve TUMLU benchmark sonuçları, 50 promptluk gerçek test, hukuk, finans, kod, yaratıcı yazma ve Q&A; Türk şirketlerinde A/B test, TL bazlı maliyet ve hangi model hangi Türkçe iş için en uygun. 35+ kaynak.
Türkçe açık kaynak LLM ekosisteminin 2026 fotoğrafı: Trendyol-LLM, Cosmos-Llama, KanarYa, Kumru AI, TÜBİTAK BİLGEM yerli model ve T3 AI Baykar savunma modeli. MMLU-TR, TUMLU benchmarkları, lisans, tokenization farkı, VRAM ihtiyacı, self-host gereksinimleri ve hangi modeli hangi use-case için seçmeniz gerektiğine dair detaylı karar rehberi.