# VLM Mimari Anatomisi: Vision Encoder + Projector + LLM Backbone — Detaylı Diseksiyon

> Source: https://sukruyusufkaya.com/learn/fine-tuning-cookbook/ftc-vlm-architecture-anatomy
> Updated: 2026-08-23T08:21:41.731Z
> Category: Fine-Tuning Cookbook (Model-by-Model)
> Module: Part VI — Vision-Language Multimodal FT
**TLDR:** VLM'in 3 ana bileşeni: Vision encoder (SigLIP-400M, ViT-G/14, EVA-CLIP), Projector (MLP / Q-former / Resampler / Cross-attention), LLM backbone (Llama/Qwen/Phi). Token interleave format, image token allocation, position encoding harmoni, 2D/M-RoPE patches. Her popüler VLM family için arch tablosu.

