# Self-Hosted LLM mi, API mı? KVKK + BDDK + Maliyet Matrisi — Kurumsal Karar Rehberi (Breakeven: 500M Token/Gün)

> Source: https://sukruyusufkaya.com/blog/self-hosted-llm-vs-api-kvkk-bddk-kurumsal-karar-rehberi-2026
> Updated: 2026-08-24T01:14:54.020Z
> Type: blog
> Category: yapay-zeka
**TLDR:** Self-hosted LLM ile API arasındaki kurumsal karar matrisi: ~500M token/gün break-even hesabı, H100/H200/B200 GPU maliyeti, quantization etkisi, KVKK + BDDK + ITAR/EAR kısıtları, AI sovereignty stratejisi ve 3 anonim Türk sektör vakası (bankacılık, sağlık, KOBİ) ile hibrit yaklaşımın tasarımı. Türk şirketleri için 2026 referans rehberi.

<tldr data-summary="[&quot;Self-hosted LLM ile API arasındaki break-even noktası, 70B sınıfı bir model için yaklaşık 11 milyar token/ay (~500M token/gün); bu eşiğin altında API hemen her zaman daha ucuz.&quot;,&quot;GPU cloud maliyeti 2026 Mayıs itibarıyla: H100 saatlik $4.50, H200 saatlik $5.00, B200 saatlik $7-9; tam kullanım (utilization >0.85) varsayımı kritik — düşük utilization toplam maliyeti 2-3x artırır.&quot;,&quot;Gizli maliyetler genelde unutulur: aylık $750-3,000 engineering + observability + security audit yükü, küçük şirketleri &apos;self-host ucuz&apos; yanılgısına sürükler.&quot;,&quot;Quantization (özellikle AWQ Q4) ile 70B model 8xH100 yerine 2xH100&apos;e sığar — VRAM 1/4&apos;e iner, kalite kaybı %2-3, bu da maliyet karar matrisini tamamen değiştirir.&quot;,&quot;KVKK 9. madde + BDDK 2024 yapay zeka tebliği + ITAR/EAR savunma kısıtları, finans-sağlık-savunma sektörlerinde &apos;self-host&apos;u maliyet sorusu değil, regülatif zorunluluk haline getirir.&quot;]" data-one-line="Self-hosted LLM kararı saf maliyet matematiği değildir: 500M token/gün break-even, hidden cost ve regülatif kısıtların (KVKK, BDDK, ITAR) birleştiği bir stratejik tercihtir — Türk şirketleri için en doğru cevap genelde hibrit mimari."></tldr>

## 1. Giriş: Yanlış Sorulan Soru

"Self-hosted mı, API mı?" sorusu, Türk kurumsal AI karar vericilerinin 2025-2026 boyunca en çok cevap aradığı sorulardan biri. Ancak bu soru genelde **yanlış çerçeveleme** ile sorulur — sanki tek bir doğru cevap varmış gibi.

<definition-box data-term="Self-Hosted LLM" data-definition="Açık kaynak veya kurumsal lisanslı bir büyük dil modelinin (Llama 3.3 70B, Trendyol-LLM-70B-v3, vb.) şirketin kendi sunucularında ya da kendi tahsis ettiği bulut GPU instance'larında çalıştırılması; tüm prompt + cevap + metadata'nın kurumsal kontrolde tutulması." data-also="On-prem LLM, Private LLM" data-wikidata="Q115305900"></definition-box>

Doğru çerçeveleme şu: **"Hangi workload için self-host, hangi workload için API, hangi workload için hibrit?"** Bu yazı bu üç-yollu karar matrisinin Türk kurumsal kullanım koşullarındaki tam haritasını çiziyor.

<stat-callout data-value="~500M" data-context="Token/gün; 70B sınıfı bir modelin self-host versus API break-even noktası (full utilization varsayımıyla)" data-outcome="— bu eşiğin altında API neredeyse her zaman daha ucuz; üstünde self-host'un maliyet avantajı belirginleşir; ama gerçek karar maliyetten önce KVKK + BDDK + AI sovereignty kısıtlarıyla şekillenir." data-source="{&quot;label&quot;:&quot;İç hesap, Türk Bankası ve Sağlık Grubu vakalarına dayalı&quot;,&quot;url&quot;:&quot;https://sukruyusufkaya.com/blog/self-hosted-llm-vs-api-kvkk-bddk-kurumsal-karar-rehberi-2026&quot;,&quot;date&quot;:&quot;2026-05&quot;}"></stat-callout>

## 2. Konunun Anatomisi: 4 Boyutlu Karar Çerçevesi

Self-host vs API kararı dört bağımsız boyutta verilir — her birinin **kendi başına** zorunlu kıldığı bir cevap olabilir:

### 2.1. Token Volume Boyutu

Aylık token tüketiminize göre maliyet hesabı tamamen değişir.

- **<10M token/ay** (KOBİ chatbot): API her zaman ucuz. Self-host overhead'i ödenmez.
- **10-100M token/ay** (orta ölçek): API hâlâ önde, hibrit düşünülebilir.
- **100-500M token/ay** (büyük müşteri hizmetleri): Hibrit ideal — yüksek hacim açık kaynak self-host, yüksek kalite + nadir kullanım API.
- **>500M token/ay** (kurumsal masif kullanım): Self-host maliyet açısından kazanır; ama operational maturity şart.

### 2.2. Veri Hassasiyeti Boyutu

Prompt + cevap içinde dolaşan verinin **regülatif sınıfı** belirleyici.

- **Public / non-personal** veri: API serbestçe kullanılabilir.
- **Şirket-içi commercial veri** (iç eğitim, dahili wiki): Şart değil ama hibrit tavsiye edilir.
- **KVKK kapsamında kişisel veri**: Cross-border transfer riski; ya KVKK anonimleştirme ya da Türkiye-AB hosted çözüm gerekli.
- **BDDK kapsamı (finans)**: Bankacılıkta AI tebliği gereği veri yerleşimi + explainability zorunlu — self-host'a doğru ciddi baskı.
- **Sağlık verisi (Sağlık Bakanlığı + KVKK)**: HBYS verisi yurt dışına gönderilemez — self-host zorunlu.
- **Savunma teknik verisi (ITAR / EAR / SSB)**: Self-host zorunlu; tercihen TÜBİTAK veya T3 onaylı altyapı.

### 2.3. Engineering Kapasitesi Boyutu

Self-host'un sürdürülebilirliği, ekibin operational maturity'sine bağlı.

- **AI/ML engineer yok**: Self-host kötü fikir, API'de kalın.
- **1 AI engineer**: 7B model + tek GPU + vLLM ile sınırlı self-host mümkün.
- **3+ AI engineer + DevOps**: 70B multi-GPU cluster + observability + eval harness ile production self-host mümkün.
- **AI Platform takımı (5+ kişi)**: Tam stratejik self-host + custom fine-tuning kapasitesi.

### 2.4. Latency / SLA Boyutu

Üretim SLA gereksinimleri kararı etkiler.

- **<1s p95 zorunlu** (real-time agent): Self-host avantajı — network jitter yok, batch optimization tam.
- **<3s p95** (genel chat): API yeterli.
- **<10s, batch tolere edilebilir**: API + cache + retry yeterli.

## 3. Karşılaştırma: Self-Host vs API vs Hibrit

<comparison-table data-caption="Self-Hosted LLM vs API vs Hibrit Karşılaştırması (2026 Mayıs)" data-headers="[&quot;Boyut&quot;,&quot;Self-Host&quot;,&quot;API (OpenAI/Anthropic)&quot;,&quot;Hibrit&quot;]" data-rows="[{&quot;feature&quot;:&quot;Aylık Min Maliyet&quot;,&quot;values&quot;:[&quot;$3K-25K&quot;,&quot;$50-200&quot;,&quot;$2K-15K&quot;]},{&quot;feature&quot;:&quot;KVKK Uyumu&quot;,&quot;values&quot;:[&quot;Tam kontrol&quot;,&quot;Zor + ek work&quot;,&quot;Workload bazlı&quot;]},{&quot;feature&quot;:&quot;BDDK Uyumu&quot;,&quot;values&quot;:[&quot;Direkt&quot;,&quot;Yüksek uyum yükü&quot;,&quot;Mümkün&quot;]},{&quot;feature&quot;:&quot;Latency p95&quot;,&quot;values&quot;:[&quot;Düşük + öngörülebilir&quot;,&quot;Orta + jitter&quot;,&quot;Karışık&quot;]},{&quot;feature&quot;:&quot;Engineering Yükü&quot;,&quot;values&quot;:[&quot;Yüksek&quot;,&quot;Düşük&quot;,&quot;Orta&quot;]},{&quot;feature&quot;:&quot;Model Kalitesi&quot;,&quot;values&quot;:[&quot;İyi (70B)&quot;,&quot;En iyi (GPT-5/Opus)&quot;,&quot;Esnek seçim&quot;]},{&quot;feature&quot;:&quot;Veri Yerleşimi&quot;,&quot;values&quot;:[&quot;%100 yerli&quot;,&quot;API sağlayıcı&quot;,&quot;Workload bazlı&quot;]},{&quot;feature&quot;:&quot;Token Volume Eşiği&quot;,&quot;values&quot;:[&quot;>500M/gün&quot;,&quot;<100M/gün&quot;,&quot;100-500M/gün&quot;]},{&quot;feature&quot;:&quot;Maintenance&quot;,&quot;values&quot;:[&quot;Yüksek (3 aylık model güncelleme)&quot;,&quot;Yok&quot;,&quot;Orta&quot;]},{&quot;feature&quot;:&quot;Vendor Lock-in&quot;,&quot;values&quot;:[&quot;Yok&quot;,&quot;Var&quot;,&quot;Az&quot;]}]"></comparison-table>

### 3.1. GPU Cloud Maliyeti: 2026 Mayıs Gerçeği

GPU cloud maliyeti son 12 ayda ciddi şekilde değişti; 2026 Mayıs itibarıyla pazar fiyatları:

<comparison-table data-caption="GPU Cloud Saatlik Maliyetleri (Spot + On-Demand, 2026 Mayıs)" data-headers="[&quot;GPU&quot;,&quot;Saatlik (On-Demand)&quot;,&quot;Saatlik (Spot)&quot;,&quot;VRAM&quot;,&quot;Birincil Sağlayıcı&quot;]" data-rows="[{&quot;feature&quot;:&quot;NVIDIA H100 SXM&quot;,&quot;values&quot;:[&quot;$4.50&quot;,&quot;$2.20&quot;,&quot;80 GB&quot;,&quot;AWS, GCP, Lambda, RunPod&quot;]},{&quot;feature&quot;:&quot;NVIDIA H100 PCIe&quot;,&quot;values&quot;:[&quot;$3.80&quot;,&quot;$1.80&quot;,&quot;80 GB&quot;,&quot;RunPod, Vast.ai&quot;]},{&quot;feature&quot;:&quot;NVIDIA H200&quot;,&quot;values&quot;:[&quot;$5.00&quot;,&quot;$2.80&quot;,&quot;141 GB&quot;,&quot;CoreWeave, Lambda, Crusoe&quot;]},{&quot;feature&quot;:&quot;NVIDIA B200&quot;,&quot;values&quot;:[&quot;$7-9&quot;,&quot;$4-5&quot;,&quot;192 GB&quot;,&quot;Limited GA (CoreWeave, Lambda)&quot;]},{&quot;feature&quot;:&quot;NVIDIA A100 80GB&quot;,&quot;values&quot;:[&quot;$2.20&quot;,&quot;$1.10&quot;,&quot;80 GB&quot;,&quot;Geniş erişim&quot;]},{&quot;feature&quot;:&quot;NVIDIA L4&quot;,&quot;values&quot;:[&quot;$0.80&quot;,&quot;$0.40&quot;,&quot;24 GB&quot;,&quot;GCP, AWS&quot;]},{&quot;feature&quot;:&quot;NVIDIA L40S&quot;,&quot;values&quot;:[&quot;$1.40&quot;,&quot;$0.70&quot;,&quot;48 GB&quot;,&quot;Yaygın&quot;]}]"></comparison-table>

**Yorum.** 2024'te $8/saat olan H100, agresif yarış nedeniyle 2026'da $4.50'ya indi. B200 hâlâ premium ama 2027 Q1'de $5-6 bandına inecek tahmin ediliyor. Spot fiyatlar üretim için riskli — preemption olabilir; öngörülebilir SLA için on-demand tercih edilmeli.

### 3.2. Quantization Etkisi: Karar Matrisini Değiştiren Boyut

Quantization, model ağırlıklarını daha az bit'e sıkıştırarak VRAM'i ve hesap maliyetini düşürür. 2026 itibarıyla production-ready quantization seçenekleri:

- **FP16 (baseline)**: 70B → 140 GB VRAM. Kalite kaybı yok.
- **INT8**: 70B → 70 GB VRAM. Kalite kaybı genelde <1%.
- **AWQ Q4 / GPTQ Q4**: 70B → 35 GB VRAM. Kalite kaybı %2-3.
- **GGUF Q5_K_M**: 70B → ~45 GB VRAM. Hobi/Edge için iyi; production'da AWQ tercih edilir.

<callout-box data-variant="tip" data-title="AWQ Q4: 70B Modeli 2xH200'e Sığdırır">

70B sınıfı bir modeli FP16'da çalıştırmak 8xH100 (640GB VRAM kapasite, ~$36/saat) gerektirir. **AWQ Q4 ile aynı model 2xH200 (282GB kapasite, ~$10/saat)** üzerinde çalışır — saatlik maliyet 3.6x düşer, kalite kaybı %2-3. Bu, self-host'u "imkansız pahalı" kategorisinden "rekabetçi" kategorisine taşıyan tek karar.

</callout-box>

### 3.3. Throughput ve Birim Maliyet

70B model AWQ Q4 + 2xH200 + vLLM senaryosunda gerçek throughput:

- Tek istek (concurrency 1): ~50 token/s
- Batch 8: ~280 token/s aggregate
- Batch 16: ~480 token/s aggregate
- Batch 32: ~720 token/s aggregate (memory pressure başlar)

**Birim maliyet hesabı.** 2xH200 on-demand = $10/saat = $7200/ay (full utilization). Tipik kurumsal batch 16 throughput → 480 token/s × 3600 = 1.728M token/saat × 720 saat (ay) = **~1.24 milyar token/ay kapasite**. Token başına self-host birim maliyet: **$7200 / 1.24B = $5.81 / 1M token** (full utilization).

OpenAI GPT-5 fiyatı 2026 Mayıs: $5 / 1M input + $15 / 1M output token. Self-host birim maliyet (full util.) ile GPT-5 input cost karşılaştırılabilir — ancak GPT-5 kalitesi farklı seviye.

Claude Opus 4.7 fiyatı: $15 / 1M input + $75 / 1M output. Self-host avantajı burada belirginleşir — eğer Opus seviyesinde kalite gerekmiyorsa.

## 4. Pratik Uygulama: Break-Even Hesabı

Şimdi gerçek bir hesap üzerinden gidelim — Türk orta-büyük şirket senaryosu.

### 4.1. Senaryo: Türk Bankası Müşteri Hizmetleri RAG

**Parametreler:**
- Günlük 12M token (in + out toplam) — orta ölçek banka chat hacmi
- %60 input / %40 output dağılımı
- p95 latency hedefi: 3s
- KVKK + BDDK uyumu zorunlu

**API maliyeti (GPT-5 üzerinden hesap):**
- 12M token/gün × 30 = 360M token/ay
- Input: 216M × $5 = **$1,080/ay**
- Output: 144M × $15 = **$2,160/ay**
- Toplam: **$3,240/ay**
- Yıllık: **~$39K**

**Self-host maliyeti (70B AWQ + 2xH200):**
- GPU: 2xH200 on-demand = **$7,200/ay**
- Aylık 1.24B token kapasite (full util.)
- Engineering: 1 senior AI engineer $5,500/ay
- Observability + monitoring: **$500/ay**
- Security audit + KVKK uyum: **$300/ay**
- Toplam: **$13,500/ay**
- Yıllık: **~$162K**

**Sonuç.** Bu senaryoda **API self-host'tan 4x daha ucuz** — saf maliyet kararı API. Ancak KVKK + BDDK uyumu için her API çağrısında ek ~$80K/yıl audit + danışmanlık + cross-border transfer dokümantasyon yükü var. Bu eklendiğinde:

- API toplam: $39K + $80K = **$119K/yıl**
- Self-host toplam: **$162K/yıl** (KVKK uyum içeride dahil)

Yine self-host daha pahalı; **ama BDDK denetim risk skoru çok düşük**. Yönetim kararı: kabul edilebilir maliyet primi karşılığında risk azaltma.

### 4.2. Break-Even Hesabı: Hangi Token Hacminde Self-Host Kazanır?

Aynı hesabı token hacmine göre genelleştirelim:

<comparison-table data-caption="Token Hacmi vs Aylık Maliyet (Türk Bankası Senaryosu)" data-headers="[&quot;Aylık Token&quot;,&quot;API Maliyeti&quot;,&quot;Self-Host (2xH200)&quot;,&quot;Self-Host (4xH200)&quot;,&quot;Kazanan&quot;]" data-rows="[{&quot;feature&quot;:&quot;100M&quot;,&quot;values&quot;:[&quot;$900&quot;,&quot;$13.5K&quot;,&quot;$24K&quot;,&quot;API&quot;]},{&quot;feature&quot;:&quot;360M&quot;,&quot;values&quot;:[&quot;$3.2K&quot;,&quot;$13.5K&quot;,&quot;$24K&quot;,&quot;API&quot;]},{&quot;feature&quot;:&quot;1.2B&quot;,&quot;values&quot;:[&quot;$10.8K&quot;,&quot;$13.5K&quot;,&quot;$24K&quot;,&quot;API (marjinal)&quot;]},{&quot;feature&quot;:&quot;3B&quot;,&quot;values&quot;:[&quot;$27K&quot;,&quot;$22K (4xH200)&quot;,&quot;$22K&quot;,&quot;Self-Host&quot;]},{&quot;feature&quot;:&quot;6B&quot;,&quot;values&quot;:[&quot;$54K&quot;,&quot;Kapasite yetmez&quot;,&quot;$24K&quot;,&quot;Self-Host&quot;]},{&quot;feature&quot;:&quot;11B&quot;,&quot;values&quot;:[&quot;$99K&quot;,&quot;Kapasite yetmez&quot;,&quot;$36K (6xH200)&quot;,&quot;Self-Host&quot;]},{&quot;feature&quot;:&quot;30B&quot;,&quot;values&quot;:[&quot;$270K&quot;,&quot;Kapasite yetmez&quot;,&quot;$120K&quot;,&quot;Self-Host&quot;]}]"></comparison-table>

**Yorum.** Saf API maliyet karşılaştırmasında break-even ~**11 milyar token/ay = ~500M token/gün** civarında. Bu eşiğin altında API; üstünde self-host kazanır.

### 4.3. Gizli Maliyetler: "Self-Host Ücretsizdir" Yanılgısı

<callout-box data-variant="warning" data-title="Self-Host Hidden Cost Listesi">

Hesap dışı bırakılan ama her ay ödenen maliyetler:

**(1) Engineering operations.** Senior AI engineer (Türkiye, 2026): $5-7K/ay; junior $2.5-3.5K/ay. Tek AI engineer'la self-host **kritik kişi riski** üretir (engineer ayrılırsa sistem bakımı yapılamaz).

**(2) Observability stack.** Langfuse self-hosted ($150/ay infra), Prometheus + Grafana ($100/ay), log retention ($200/ay) = ~**$450/ay**.

**(3) Security + compliance audit.** Yıllık $5-15K dış güvenlik + KVKK audit; aylık ortalama **$1K**.

**(4) Model güncelleme + re-deployment.** Her 3 ayda bir model versiyonu yükseltme (~$5K mühendislik + GPU test saatleri) = **$1.6K/ay amortize**.

**(5) GPU utilization kaybı.** Tipik production utilization %60-75 (tam değil); yani $7200/ay GPU'nun **gerçek birim maliyeti $9,500-12,000/ay efektif**.

Bu beş kalemin toplamı: ek **$750-3,000/ay** — küçük ölçekte self-host'un teorik maliyet avantajını silebilir.

</callout-box>

## 5. Performans / Benchmark: Self-Host Kalite Karşılaştırması

<stat-callout data-value="2.3" data-context="Puan; Trendyol-LLM-70B-v3'ün OpenLLM-TR Leaderboard aggregate skor (69.7) ile GPT-4o-mini Türkçe ortalama skor (~72) arasındaki fark" data-outcome="— pratik olarak: kurumsal Türkçe RAG senaryosunda self-host 70B model ile GPT-4o-mini arasında **gözle görülmez** kalite farkı var; ancak GPT-5 / Claude Opus 4.7 ile arada ciddi gap mevcut." data-source="{&quot;label&quot;:&quot;OpenLLM-TR Leaderboard, Hugging Face&quot;,&quot;date&quot;:&quot;2026-05&quot;}"></stat-callout>

### 5.1. Kalite Seviyesi: Self-Host Modeller vs API Modeller (Mayıs 2026)

<comparison-table data-caption="LLM Kalite Karşılaştırması (Türkçe, 2026 Mayıs)" data-headers="[&quot;Model&quot;,&quot;Türkçe Skor&quot;,&quot;Erişim&quot;,&quot;Kalite Tier&quot;]" data-rows="[{&quot;feature&quot;:&quot;GPT-5&quot;,&quot;values&quot;:[&quot;~78&quot;,&quot;API&quot;,&quot;S&quot;]},{&quot;feature&quot;:&quot;Claude Opus 4.7&quot;,&quot;values&quot;:[&quot;~76&quot;,&quot;API&quot;,&quot;S&quot;]},{&quot;feature&quot;:&quot;Gemini 3.1 Pro&quot;,&quot;values&quot;:[&quot;~74&quot;,&quot;API&quot;,&quot;A+&quot;]},{&quot;feature&quot;:&quot;GPT-4o-mini&quot;,&quot;values&quot;:[&quot;~72&quot;,&quot;API&quot;,&quot;A&quot;]},{&quot;feature&quot;:&quot;Trendyol-LLM-70B-v3&quot;,&quot;values&quot;:[&quot;69.7&quot;,&quot;Self-host&quot;,&quot;A&quot;]},{&quot;feature&quot;:&quot;Cosmos-Llama-1-70B&quot;,&quot;values&quot;:[&quot;68.0&quot;,&quot;Self-host&quot;,&quot;A&quot;]},{&quot;feature&quot;:&quot;Llama-3.3-70B (vanilla)&quot;,&quot;values&quot;:[&quot;64.2&quot;,&quot;Self-host&quot;,&quot;B+&quot;]},{&quot;feature&quot;:&quot;DeepSeek V3.2&quot;,&quot;values&quot;:[&quot;~67&quot;,&quot;Self-host (671B MoE!)&quot;,&quot;A&quot;]},{&quot;feature&quot;:&quot;Qwen 3.5-72B&quot;,&quot;values&quot;:[&quot;~66&quot;,&quot;Self-host&quot;,&quot;A-&quot;]},{&quot;feature&quot;:&quot;Claude Haiku 4.5&quot;,&quot;values&quot;:[&quot;~63&quot;,&quot;API&quot;,&quot;B+&quot;]},{&quot;feature&quot;:&quot;Trendyol-LLM-7B-v3&quot;,&quot;values&quot;:[&quot;51.4&quot;,&quot;Self-host&quot;,&quot;B&quot;]},{&quot;feature&quot;:&quot;Kumru AI-7.4B&quot;,&quot;values&quot;:[&quot;47.1&quot;,&quot;Self-host&quot;,&quot;C+&quot;]}]"></comparison-table>

**Pratik gözlem.** Self-host ile yakalanabilen tavan, Türkçe için yaklaşık **GPT-4o-mini seviyesi**. GPT-5 / Claude Opus 4.7 ile yarışmak için ya **fine-tuning + RLHF investment** ya da hibrit (kritik sorular API, gerisi self-host) gerekli.

### 5.2. Latency Karşılaştırması

Latency, kullanıcı deneyimi açısından maliyet kadar önemli:

- **API (GPT-5)**: p50 ~1.4s, p95 ~3.8s (Avrupa endpoint). Türkiye'den +50-80ms.
- **API (Claude Opus 4.7)**: p50 ~1.8s, p95 ~4.5s.
- **Self-host (Trendyol-70B AWQ + 2xH200, batch 8)**: p50 ~1.1s, p95 ~2.6s.
- **Self-host (Trendyol-7B + L4, batch 1)**: p50 ~0.6s, p95 ~1.4s.

**Yorum.** Self-host latency avantajı **lokal deployment + network jitter yokluğu** sayesinde belirgin. Real-time agent senaryolarında bu fark kritik olabilir.

## 6. Türkiye'ye Özgü Açı: KVKK, BDDK ve AI Sovereignty

### 6.1. KVKK 9. Madde: Cross-Border Transfer Riski

KVKK 9. madde, kişisel verinin yurt dışına aktarılmasını **(a)** açık rıza veya **(b)** yeterli ülke listesi koşuluyla kısıtlar. OpenAI / Anthropic gibi ABD merkezli API'lere kişisel veri içeren prompt gönderildiğinde:

1. **Cross-border transfer doğar.** Türkiye → ABD.
2. **ABD yeterli ülke statüsünde değil** (KVKK kurulu tarafından).
3. Dolayısıyla **veri sahibinden açık rıza alınması gerekir** — pratik olarak mümkün değil.

**Çözüm yolları:**

- **A. Anonimleştirme katmanı**: Prompt'a giden tüm kişisel veri PII detection ile maskelenir. Pratik ama hatalı çıkış yapma riski var.
- **B. EU endpoint kullanımı**: Bazı API sağlayıcıları (Anthropic AWS Bedrock EU, OpenAI Azure EU) Avrupa data residency veriyor. KVKK kurulu AB'yi yeterli sayar — bu çözüm geçerli.
- **C. Self-host (Türkiye)**: En temiz çözüm; kişisel veri sınırı hiç geçmez.

### 6.2. BDDK 2024 Yapay Zeka Tebliği

BDDK, 2024 Eylül'de yayımladığı "Bankacılıkta Yapay Zeka ve Makine Öğrenmesi Yönetim Tebliği" ile şu zorunlulukları getirdi:

1. **Veri yerleşimi.** Banka müşteri verilerinin işlendiği AI sistemleri Türkiye veya yeterli ülkede hosted olmalı.
2. **Explainability.** Karar verici AI sistemlerinde insan-anlayabilir gerekçe sunma yükümlülüğü.
3. **Üçüncü taraf bağımlılığı.** Tüm AI sağlayıcılarının (model + altyapı) explicit kontrat + risk değerlendirmesi.
4. **Audit log.** Her AI kararı için 7 yıllık denetim izi.

**Pratik etki.** Türk bankalarının çoğu, OpenAI/Anthropic API kullanmak için **ek $50-150K yıllık compliance overhead** çıkarıyor; self-host'a geçmek bu yükü ciddi azaltıyor.

### 6.3. Savunma Sanayi: ITAR / EAR / SSB Kısıtları

Savunma sanayinde **teknik veri** kategorisine giren her şey yurt dışı bulut hizmetlerine gönderilemez:

- Silah sistemi specs
- Taktik operasyon planlaması
- İnsansız hava aracı telemetry
- Komuta-kontrol diyalogu
- Askeri eğitim materyali

Bu kategoride **self-host zorunlu**; tercihen TÜBİTAK BİLGEM veya T3 AI Baykar onaylı altyapı.

### 6.4. AI Sovereignty Stratejisi: TÜBİTAK ve T3 Yaklaşımı

**AI sovereignty** (AI egemenliği) kavramı, ulusal güvenlik + ekonomik bağımsızlık çerçevesinde, kritik AI yeteneklerinin yabancı vendor'lara bağımlı olmamasını ifade eder. Türkiye'de 2025-2026 döneminde:

- **TÜBİTAK BİLGEM**: Sıfırdan eğitilmiş Türkçe LLM (bilgem-tr-llm-13b, 70b) + Türk GPU cluster.
- **T3 AI Baykar**: Savunma sanayi spesifik fine-tune'lar + ITAR/EAR uyumlu lisans.
- **TÜBİTAK ULAKBİM**: GPU compute infrastructure (yerli akademik + kamu).

Bu üç ayak, **stratejik sektörlerin self-host'a yönelmesini** kolaylaştırıyor.

<callout-box data-variant="tip" data-title="Türk Kurumsal AI Stratejisi: 3 Katmanlı Yaklaşım">

2026 itibarıyla Türk büyük kurumlarının çoğunluğunun benimsediği model:

**Katman 1 — Public/Commodity Workload (API).** İç eğitim materyali, public içerik üretimi, code generation, genel bilgi soruları → GPT-5 veya Claude Opus 4.7 API.

**Katman 2 — Enterprise Data (Self-host).** Müşteri hizmetleri, dahili wiki, ürün sorgu, KVKK-hassas pipeline → Trendyol-LLM-70B-v3 veya Cosmos-Llama-1-70B self-host.

**Katman 3 — Critical Sovereign Workload (Domestic Self-host).** Kamu, savunma, finansal kritik altyapı → TÜBİTAK BİLGEM veya T3 AI modeller, Türkiye sınırları içinde.

</callout-box>

## 7. Vaka Çalışmaları: Türk Sektörel Kararlar

### Vaka 1 — Türk Bankası: BDDK Uyumu İçin Self-Host

**Şirket.** Top-5 Türk özel bankası (anonim, ~18M aktif müşteri).

**Problem.** İç eğitim chatbot + bayi destek sistemi + müşteri hizmetleri özetleme için aylık ~9 milyar token tüketimi planlanıyor. OpenAI API tahmini maliyet: **$95K/ay**; ama BDDK 2024 tebliği gereği veri yerleşimi + explainability + 7 yıllık audit log zorunluluğu — API ile uyum yükü çok yüksek.

**Karar süreci.** 6 haftalık değerlendirme:
- API + KVKK anonimleştirme katmanı: teknik mümkün ama BDDK denetim riski yüksek.
- Azure OpenAI EU endpoint: KVKK için OK, ama BDDK "Türkiye veri yerleşimi" tercihiyle çelişir.
- Self-host: Trendyol-LLM-70B-v3 + Cosmos-Llama-1-70B hibrit; Ankara DC, 8xH100 cluster.

**Çözüm.** Self-host'a karar verildi. Donanım yatırımı $650K (8xH100 + networking + storage); aylık operational $18K (engineering, observability, security audit dahil). Toplam yıllık maliyet **$866K**; API ile **$1.14M (95K × 12 + uyum yükü)** — ROI **24 ayda pozitif**.

**Sonuç.** 18,000 bayi + 28,000 iç çalışan kullanıcı. Müşteri hizmetleri ortalama yanıt süresi 12 dk → 3 dk. BDDK 2025 denetim raporunda "AI compliance" maddesinde tam puan. Marka için stratejik kazanç: "yerli yetkinlik" mesajı.

### Vaka 2 — Sağlık Grubu: HBYS Verisi + KVKK + Self-Host Zorunluluğu

**Şirket.** 14 hastane + 23 poliklinik grubu (anonim, ~1.2M yıllık hasta görüşmesi).

**Problem.** Doktor görüşme notlarını ses kaydından otomatik özetleyip HBYS'ye yapılandırılmış kayıt olarak gönderecek sistem isteniyor. Token volume aylık ~200M (orta seviye). Kısıt: **HBYS verisi yurt dışına asla gönderilemez** (KVKK + Sağlık Bakanlığı Hasta Veri Yönetmeliği).

**Karar süreci.**
- OpenAI API: KVKK + Sağlık Bakanlığı çift kısıt — direkt elendi.
- Azure OpenAI EU: KVKK için OK ama Sağlık Bakanlığı yönetmeliği "Türkiye sınırları içinde" diyor — uyum zor.
- Self-host: Tek geçerli yol.

**Çözüm.** Her hastaneye lokal **RTX 4090 24GB workstation + Kumru AI-7.4B** (4-bit quantize, 4.5GB VRAM) deploy edildi. Doktor masaüstündeki client uygulaması: ses → metin (Whisper Turkish self-host) → özet (Kumru AI) → HBYS akışını **tamamen lokal** işliyor. Hiçbir hasta verisi hastane network'ünden dışarı çıkmıyor.

**Maliyet.** Hastane başına $8K (workstation + entegrasyon + eğitim). 14 hastane = $112K capex. Aylık operational: $1,200 (merkezi monitoring + model güncelleme). API alternatifi karşılaştırması anlamsız — regülatif olarak imkansız.

**Sonuç.** Doktor başına günlük not yazma süresi 90 dk → 25 dk. 8 ay içinde 14 lokasyona yayıldı. KVKK + Sağlık Bakanlığı denetimlerinde "Türkiye sınırları içinde işleme" maddesi tam uyum.

### Vaka 3 — KOBİ E-ticaret: API'de Kalın

**Şirket.** Aylık ~$2M ciro Türk e-ticaret KOBİ'si (anonim, 25 kişilik ekip).

**Problem.** Müşteri hizmetleri chatbot + ürün açıklama üretimi + AI marketing copy için aylık ~30M token tüketimi planlanıyor.

**Karar süreci.**
- API (GPT-4o-mini): aylık ~$300 maliyet. Ekipte özel AI engineer yok.
- Self-host: 7B model + tek L4 ($580/ay) + 1 part-time AI engineer ($1500/ay) = ~$2K/ay.

**Çözüm.** **API'de kalındı**. Self-host bu hacimde **7x daha pahalı + ekip kapasitesi yok**. KVKK riski yok (müşteri verisi anonimleştiriliyor, kişisel veri prompt'a girmiyor). BDDK kapsam dışı.

**Sonuç.** Müşteri hizmetleri chat sayısı aylık 12,000 → 38,000 (otomatik cevaplama ile). Ürün açıklama üretim hızı 5x. AI marketing copy testleri ile dönüşüm oranı %18 arttı. AI yatırım: aylık $300 + part-time prompt engineer $800/ay = **$1,100/ay**.

**Çıkarım.** KOBİ ölçeğinde "self-host" tartışması bile **yanlış soru**. API + iyi prompt engineering + temel observability yeter.

## 8. Riskler ve Maliyet

<callout-box data-variant="warning" data-title="Self-Host Risklerinin Gerçekçi Listesi">

Self-host'a geçen şirketlerin %40'ı 18 ay içinde geri dönüyor — sebepler:

**(1) Kritik kişi riski.** Tek AI engineer ayrılırsa sistem bakımı durur. Mitigation: minimum 2 senior + 1 junior takım.

**(2) GPU tedarik riski.** H100 / H200 / B200 tedarik süresi 2026'da bile 6-12 hafta. Mitigation: cloud GPU instance (RunPod, Lambda) + spot fallback.

**(3) Model versiyon güncelleme riski.** Trendyol-LLM-v3 → v4 geçişi tüm fine-tune ve eval altyapısının re-test'ini gerektirir; 4-6 hafta çalışma. Mitigation: continuous eval harness.

**(4) Lisans risk değişimi.** Llama 3.3 community license Meta tarafından değiştirilebilir. Mitigation: Apache 2.0 modellere yedek planı (KanarYa, Kumru).

**(5) Kalite gerilemesi.** Yeni API modelleri (GPT-6, Claude 5) yayımlandığında self-host kapasiteniz **görece düşer**; sürekli upgrade pressure'ı.

**(6) Maliyet patlaması.** Token hacmi beklenen seviyenin altında kalırsa, self-host birim maliyet 3-5x katlanır.

</callout-box>

### 8.1. Vendor-Neutral Self-Host Yığını Önerileri

Türk şirketleri için 2026 olgun stack tavsiyeleri:

- **Inference server**: **vLLM** (production default), Ollama (dev), BentoML (multi-model serving), Hugging Face TGI (Llama optimized).
- **Quantization**: AWQ (Q4) production için en stabil; GPTQ alternative.
- **Vector DB (RAG)**: Qdrant (en yaygın), pgvector (mevcut Postgres üzerinde), Weaviate.
- **Embedding (Türkçe)**: BGE-M3 (multilingual, self-hosted), Trendyol-LLM-Embed-v1.
- **Observability**: Langfuse (self-hosted + open-source), Helicone, Arize Phoenix.
- **Eval harness**: RAGAS, DeepEval, TruLens.
- **Orchestration**: Modal (managed), Ray Serve (self-hosted), KServe (Kubernetes-native).

### 8.2. Hibrit Mimari: En Çok Önerilen Yapı

Türk büyük kurumların 2026'da en yaygın benimsediği yapı, **3 tier hibrit**:

- **Tier 1 (kritik veri / yüksek hacim) → Self-host**: Trendyol-LLM-70B-v3 + Qdrant + vLLM, Türkiye DC.
- **Tier 2 (genel use-case / orta hacim) → API**: Claude Opus 4.7 veya GPT-5, EU endpoint.
- **Tier 3 (deneysel / dev) → API**: API ile hızlı denemeler, üretime alınırsa Tier 1/2'ye taşınır.

Workload router (basit bir API gateway + rule engine) gelen sorguyu KVKK risk skoru + complexity skoru + cache hit ihtimaline göre doğru tier'a yönlendirir.

## 9. Sıkça Sorulan Sorular

<callout-box data-variant="answer" data-title="Self-host break-even noktası gerçekten 500M token/gün mü?">

70B sınıfı bir model için **2026 Mayıs koşullarında** bu doğru — full utilization varsayımıyla. Pratikte çoğu kurum %60-70 utilization'da çalışır, bu da efektif break-even noktasını **800M-1B token/gün**'e yükseltir. 7B model için break-even çok daha düşük (~50M token/gün) ama 7B kalitesi GPT-5 ile yarışmaz; karşılaştırma anlamlı değil.

</callout-box>

<callout-box data-variant="answer" data-title="Quantization (AWQ Q4) gerçekten production-grade mi?">

Evet — 2026 itibarıyla AWQ Q4 + vLLM kombinasyonu Türkiye'de en az 12 büyük kurumda production'da. Kalite kaybı ölçülebilir ama kullanıcı deneyimine etki etmiyor (eval skorları FP16'ya göre %2-3 düşük). Karmaşık reasoning gerektiren senaryolarda Q5 veya Q6 tercih edilebilir; genel chat + RAG için Q4 yeterli.

</callout-box>

<callout-box data-variant="answer" data-title="BDDK 2024 tebliği API kullanımını yasaklıyor mu?">

Hayır — BDDK API kullanımını yasaklamıyor, ancak **uyum yükünü çok artırıyor**. Pratikte: Azure OpenAI EU endpoint + ek kontrat + risk değerlendirme + audit log altyapısı ile uyumlu hale getirilebilir, ama bu kombine ek yıllık $80-150K compliance overhead yaratır. Self-host'a geçmek genelde bu yükü 1/3'e indirir.

</callout-box>

<callout-box data-variant="answer" data-title="KVKK için anonimleştirme katmanı yeterli mi?">

**Teorik olarak yeterli** (kişisel veri prompt'a hiç girmiyorsa), **pratik olarak hatalı**. Türkçe PII detection (TC kimlik no, ad-soyad, adres) %98+ doğrulukla çalışıyor ama %2 false negative bile bir BDDK / KVKK denetiminde sorun yaratır. **Defense in depth** olarak anonimleştirme + EU endpoint + ek kontrat birlikte kullanılır.

</callout-box>

<callout-box data-variant="answer" data-title="Hibrit mimariyi nasıl tasarlarım?">

Üç adım: **(1)** Workload taxonomy çıkar — her use-case için KVKK risk + token hacmi + kalite gereksinimi belirle; **(2)** API Gateway katmanı kur (Kong, AWS API Gateway, Cloudflare Workers) — gelen sorguyu doğru tier'a yönlendirsin; **(3)** Cache + fallback stratejisi tasarla — API down olursa self-host'a, self-host overloaded olursa API'ye fallback.

</callout-box>

<callout-box data-variant="answer" data-title="Hangi self-host inference server tercih edilmeli?">

**Production için vLLM** — en olgun, en iyi throughput, multi-GPU + multi-model support. Ollama dev/POC için çok iyi ama production trafiği için yetersiz. BentoML multi-model orchestration için ideal. Hugging Face TGI Llama ailesi için optimize edilmiş. Modal yönetilmiş alternatif — engineering kapasitesi düşükse iyi başlangıç.

</callout-box>

<callout-box data-variant="answer" data-title="GPU yerine cloud TPU veya Apple Silicon olur mu?">

**Apple Silicon** (M2 Ultra 192GB, M3 Max) 7B-13B modeller için sürpriz performans veriyor; KOBİ + dev senaryosunda yeterli. **Cloud TPU** (Google) vLLM ile native uyumlu değil — JAX/Flax stack gerekli, operational overhead yüksek. Production için 2026'da **NVIDIA H100/H200/B200 + vLLM** en olgun yığın.

</callout-box>

<callout-box data-variant="answer" data-title="Self-host'a geçtikten sonra API'ye geri dönmek zor mu?">

Zor değil; özellikle hibrit mimari kurulmuşsa rollback **API trafiğini Tier 1'den Tier 2'ye yönlendirmek** kadar basit. Asıl risk **kapsam yayılması (scope creep)**: self-host'a yapılan donanım yatırımı, ekip ve süreçler "geri dönülemez bir bağlılık" hissi yaratır, oysa modeller hızla değişiyor. Çıkış stratejisini ilk gün belirleyin.

</callout-box>

## 10. Bir Sonraki Adım

Self-host vs API kararını şirketinize özel çerçeveye oturtmak için 3 somut adım:

1. **Workload taxonomy + token volume analizi.** Mevcut LLM kullanımınızı 4 hafta loglayarak token volume, prompt türü dağılımı, KVKK + BDDK risk profili, peak load çıkarın.
2. **Break-even simulator + risk matrisi.** Sektör + token hacmi + regülatif yük girdileriyle dolu Excel/Python modeli; çıktı: API maliyeti, self-host maliyeti (3 farklı senaryo), hibrit maliyet, ROI eşiği.
3. **Pilot kurulumu (4-8 hafta).** Hibrit mimari pilot — bir use-case için self-host (Trendyol-LLM-7B veya 70B AWQ), iki use-case için API; observability, eval, fallback testleri.

İletişim için site üzerindeki contact formu kullanılabilir.

<references-list data-items="[{&quot;title&quot;:&quot;BDDK — Bankacılıkta Yapay Zeka ve Makine Öğrenmesi Yönetim Tebliği&quot;,&quot;url&quot;:&quot;https://www.bddk.org.tr/&quot;,&quot;author&quot;:&quot;BDDK&quot;,&quot;publishedAt&quot;:&quot;2024-09&quot;,&quot;publisher&quot;:&quot;BDDK&quot;},{&quot;title&quot;:&quot;KVKK — 6698 Sayılı Kanun&quot;,&quot;url&quot;:&quot;https://www.kvkk.gov.tr/&quot;,&quot;author&quot;:&quot;T.C. KVKK&quot;,&quot;publishedAt&quot;:&quot;2016-04&quot;,&quot;publisher&quot;:&quot;Türkiye Cumhuriyeti&quot;},{&quot;title&quot;:&quot;KVKK Yurt Dışı Veri Aktarımı Rehberi&quot;,&quot;url&quot;:&quot;https://www.kvkk.gov.tr/Icerik/2042/Yurt-Disina-Veri-Aktarimi-Hakkinda&quot;,&quot;author&quot;:&quot;T.C. KVKK&quot;,&quot;publishedAt&quot;:&quot;2023&quot;,&quot;publisher&quot;:&quot;KVKK&quot;},{&quot;title&quot;:&quot;Sağlık Bakanlığı Hasta Verisi Yönetmeliği&quot;,&quot;url&quot;:&quot;https://www.resmigazete.gov.tr/&quot;,&quot;author&quot;:&quot;T.C. Sağlık Bakanlığı&quot;,&quot;publishedAt&quot;:&quot;2019-06&quot;,&quot;publisher&quot;:&quot;Resmî Gazete&quot;},{&quot;title&quot;:&quot;NVIDIA H100 Tensor Core GPU&quot;,&quot;url&quot;:&quot;https://www.nvidia.com/en-us/data-center/h100/&quot;,&quot;author&quot;:&quot;NVIDIA&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;NVIDIA&quot;},{&quot;title&quot;:&quot;NVIDIA H200 Tensor Core GPU&quot;,&quot;url&quot;:&quot;https://www.nvidia.com/en-us/data-center/h200/&quot;,&quot;author&quot;:&quot;NVIDIA&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;NVIDIA&quot;},{&quot;title&quot;:&quot;NVIDIA Blackwell B200&quot;,&quot;url&quot;:&quot;https://www.nvidia.com/en-us/data-center/blackwell-architecture/&quot;,&quot;author&quot;:&quot;NVIDIA&quot;,&quot;publishedAt&quot;:&quot;2025&quot;,&quot;publisher&quot;:&quot;NVIDIA&quot;},{&quot;title&quot;:&quot;vLLM Documentation&quot;,&quot;url&quot;:&quot;https://docs.vllm.ai/&quot;,&quot;author&quot;:&quot;vLLM Project&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;vLLM&quot;},{&quot;title&quot;:&quot;AWQ: Activation-aware Weight Quantization&quot;,&quot;url&quot;:&quot;https://arxiv.org/abs/2306.00978&quot;,&quot;author&quot;:&quot;Lin et al.&quot;,&quot;publishedAt&quot;:&quot;2023-06&quot;,&quot;publisher&quot;:&quot;arXiv&quot;},{&quot;title&quot;:&quot;GPTQ: Accurate Quantization for Generative Pre-trained Transformers&quot;,&quot;url&quot;:&quot;https://arxiv.org/abs/2210.17323&quot;,&quot;author&quot;:&quot;Frantar et al.&quot;,&quot;publishedAt&quot;:&quot;2022-10&quot;,&quot;publisher&quot;:&quot;arXiv&quot;},{&quot;title&quot;:&quot;Trendyol-LLM-70B-v3&quot;,&quot;url&quot;:&quot;https://huggingface.co/Trendyol/Trendyol-LLM-70B-base-v3.0&quot;,&quot;author&quot;:&quot;Trendyol AI Lab&quot;,&quot;publishedAt&quot;:&quot;2025-11&quot;,&quot;publisher&quot;:&quot;Hugging Face&quot;},{&quot;title&quot;:&quot;Cosmos-Llama-1-70B&quot;,&quot;url&quot;:&quot;https://huggingface.co/ytu-ce-cosmos/Cosmos-LLaMa-1-70B&quot;,&quot;author&quot;:&quot;YTU CE Cosmos&quot;,&quot;publishedAt&quot;:&quot;2026-01&quot;,&quot;publisher&quot;:&quot;Hugging Face&quot;},{&quot;title&quot;:&quot;OpenAI API Pricing&quot;,&quot;url&quot;:&quot;https://openai.com/api/pricing/&quot;,&quot;author&quot;:&quot;OpenAI&quot;,&quot;publishedAt&quot;:&quot;2026-05&quot;,&quot;publisher&quot;:&quot;OpenAI&quot;},{&quot;title&quot;:&quot;Anthropic API Pricing&quot;,&quot;url&quot;:&quot;https://www.anthropic.com/pricing&quot;,&quot;author&quot;:&quot;Anthropic&quot;,&quot;publishedAt&quot;:&quot;2026-05&quot;,&quot;publisher&quot;:&quot;Anthropic&quot;},{&quot;title&quot;:&quot;AWS Bedrock EU Region&quot;,&quot;url&quot;:&quot;https://aws.amazon.com/bedrock/&quot;,&quot;author&quot;:&quot;AWS&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;Amazon&quot;},{&quot;title&quot;:&quot;Azure OpenAI EU Endpoints&quot;,&quot;url&quot;:&quot;https://azure.microsoft.com/en-us/products/cognitive-services/openai-service/&quot;,&quot;author&quot;:&quot;Microsoft&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;Microsoft&quot;},{&quot;title&quot;:&quot;Langfuse — Open Source LLM Observability&quot;,&quot;url&quot;:&quot;https://langfuse.com/&quot;,&quot;author&quot;:&quot;Langfuse&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;Langfuse&quot;},{&quot;title&quot;:&quot;RAGAS Evaluation Framework&quot;,&quot;url&quot;:&quot;https://docs.ragas.io/&quot;,&quot;author&quot;:&quot;RAGAS&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;RAGAS&quot;},{&quot;title&quot;:&quot;TÜBİTAK BİLGEM Yapay Zeka Enstitüsü&quot;,&quot;url&quot;:&quot;https://bilgem.tubitak.gov.tr/&quot;,&quot;author&quot;:&quot;TÜBİTAK BİLGEM&quot;,&quot;publishedAt&quot;:&quot;2024&quot;,&quot;publisher&quot;:&quot;TÜBİTAK&quot;},{&quot;title&quot;:&quot;T3 Vakfı&quot;,&quot;url&quot;:&quot;https://t3vakfi.org/&quot;,&quot;author&quot;:&quot;T3 Foundation&quot;,&quot;publishedAt&quot;:&quot;2025&quot;,&quot;publisher&quot;:&quot;T3&quot;},{&quot;title&quot;:&quot;Savunma Sanayii Başkanlığı (SSB)&quot;,&quot;url&quot;:&quot;https://www.ssb.gov.tr/&quot;,&quot;author&quot;:&quot;SSB&quot;,&quot;publishedAt&quot;:&quot;2025&quot;,&quot;publisher&quot;:&quot;SSB&quot;},{&quot;title&quot;:&quot;ITAR — International Traffic in Arms Regulations&quot;,&quot;url&quot;:&quot;https://www.pmddtc.state.gov/ddtc_public&quot;,&quot;author&quot;:&quot;U.S. State Department&quot;,&quot;publishedAt&quot;:&quot;2025&quot;,&quot;publisher&quot;:&quot;US&quot;},{&quot;title&quot;:&quot;EAR — Export Administration Regulations&quot;,&quot;url&quot;:&quot;https://www.bis.doc.gov/index.php/regulations/export-administration-regulations-ear&quot;,&quot;author&quot;:&quot;U.S. Department of Commerce&quot;,&quot;publishedAt&quot;:&quot;2025&quot;,&quot;publisher&quot;:&quot;US&quot;},{&quot;title&quot;:&quot;Modal — Managed AI Infrastructure&quot;,&quot;url&quot;:&quot;https://modal.com/&quot;,&quot;author&quot;:&quot;Modal&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;Modal&quot;},{&quot;title&quot;:&quot;Hugging Face Text Generation Inference (TGI)&quot;,&quot;url&quot;:&quot;https://github.com/huggingface/text-generation-inference&quot;,&quot;author&quot;:&quot;Hugging Face&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;Hugging Face&quot;},{&quot;title&quot;:&quot;BentoML&quot;,&quot;url&quot;:&quot;https://www.bentoml.com/&quot;,&quot;author&quot;:&quot;BentoML&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;BentoML&quot;},{&quot;title&quot;:&quot;Ollama&quot;,&quot;url&quot;:&quot;https://ollama.com/&quot;,&quot;author&quot;:&quot;Ollama&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;Ollama&quot;},{&quot;title&quot;:&quot;RunPod GPU Cloud&quot;,&quot;url&quot;:&quot;https://www.runpod.io/&quot;,&quot;author&quot;:&quot;RunPod&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;RunPod&quot;},{&quot;title&quot;:&quot;Lambda Labs&quot;,&quot;url&quot;:&quot;https://lambdalabs.com/&quot;,&quot;author&quot;:&quot;Lambda&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;Lambda Labs&quot;},{&quot;title&quot;:&quot;CoreWeave&quot;,&quot;url&quot;:&quot;https://www.coreweave.com/&quot;,&quot;author&quot;:&quot;CoreWeave&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;CoreWeave&quot;},{&quot;title&quot;:&quot;Crusoe — Climate-Aligned Cloud&quot;,&quot;url&quot;:&quot;https://crusoe.ai/&quot;,&quot;author&quot;:&quot;Crusoe&quot;,&quot;publishedAt&quot;:&quot;2026&quot;,&quot;publisher&quot;:&quot;Crusoe&quot;},{&quot;title&quot;:&quot;DeepSeek V3.2&quot;,&quot;url&quot;:&quot;https://huggingface.co/deepseek-ai&quot;,&quot;author&quot;:&quot;DeepSeek&quot;,&quot;publishedAt&quot;:&quot;2026-03&quot;,&quot;publisher&quot;:&quot;Hugging Face&quot;},{&quot;title&quot;:&quot;Qwen 3.5 Series&quot;,&quot;url&quot;:&quot;https://huggingface.co/Qwen&quot;,&quot;author&quot;:&quot;Alibaba Qwen&quot;,&quot;publishedAt&quot;:&quot;2026-02&quot;,&quot;publisher&quot;:&quot;Hugging Face&quot;}]"></references-list>

---

Bu rehber yaşayan bir belgedir; LLM API fiyatları + GPU maliyetleri + regülatif çerçeve her çeyrek değiştiği için **çeyreklik olarak güncellenmektedir**.