# Multimodal Mimari Matematiği: Vision Encoder → Projection → LLM — 3 Bağlama Stratejisi

> Source: https://sukruyusufkaya.com/learn/llm-muhendisligi/multimodal-mimari-matematik-vision-llm-baglama
> Updated: 2026-08-11T16:01:32.839Z
> Category: LLM Mühendisliği
> Module: Modül 19: Çok Modlu Modeller (Multimodal) — Görüntü + Ses + Video
**TLDR:** Multimodal LLM'lerin iç mimari matematiği: Vision encoder (ViT/CLIP/SigLIP) → projection → LLM bağlama 3 stratejisi. (1) Linear projection (LLaVA tarzı, basit), (2) Q-Former (BLIP-2 tarzı, learnable queries), (3) Cross-attention (Flamingo/Llama-3.2 tarzı, derin entegrasyon). Image token budget management, resolution sorunu, vision-text alignment. PyTorch'ta sıfırdan LLaVA-style multimodal mimari. Türkçe için image-text alignment.

