# Vision-Language Models: CLIP'ten GPT-4o'ya — Image Encoder + LLM Birleşimi

> Source: https://sukruyusufkaya.com/learn/llm-muhendisligi/vision-language-models-clip-gpt-4o-llama-vision
> Updated: 2026-08-23T19:42:16.977Z
> Category: LLM Mühendisliği
> Module: Modül 19: Multimodal LLMs — Vision + Audio + Video
**TLDR:** Vision-Language Models (VLM) anatomi: CLIP (Radford 2021) image-text alignment, image patch embedding (ViT), projection layer LLM'e, GPT-4V (Eylül 2023), GPT-4o (Mayıs 2024) unified, Llama-3.2 Vision (Eylül 2024) open-source. Mimari: image encoder + projection + LLM. Türkçe multimodal pratik.

