# Llama 3.2 Vision 11B / 90B: Cross-Attention Adapter + Multi-Image FT

> Source: https://sukruyusufkaya.com/learn/fine-tuning-cookbook/ftc-llama-3.2-vision-cross-attention
> Updated: 2026-08-16T00:22:58.320Z
> Category: Fine-Tuning Cookbook (Model-by-Model)
> Module: Part VI — Vision-Language Multimodal FT
**TLDR:** Llama 3.2 Vision — Meta'nın cross-attention adapter yaklaşımı (LLaVA MLP'sinden farklı). Vision encoder ViT-H/14, LLM ile **interleaved cross-attention layers** ile birleşir. Multi-image FT, image+text interleave format, RTX 4090'da 11B QLoRA marjinal (~22 GB), 90B cloud only.

