⚡ Öne ÇıkanBilgisayarımda hangi ücretsiz yapay zeka çalışır?

Vision Transformer (ViT)

Mimari
Ing: Vision TransformerSon güncelleme: 10 Eylül 2026
Görüntüyü küçük karelere bölüp Transformer mimarisiyle işleyen model. CNN'lerin uzun süre hüküm sürdüğü görüntü işlemeye Transformer'ı soktu.

Vision Transformer nedir?

Vision Transformer, yani ViT, aslında dil modellerinde kullanılan Transformermetin işleyen sinir ağı mimarisi• yapısını görüntülere uyarlayan bir model. 2020'de Google araştırmacıları "bir görüntü 16x16 kelimeye bedeldir" diyerek ortaya attı. Fikir basit ama etkili: görüntüyü ızgara gibi küçük karelere (patch) böl, her kareyi bir "kelime" gibi say, sonra Transformer'a ver.

Nasıl çalışır?

Bir fotoğrafı alıp küçük parçalara bölersin. Her parça düzleştirilip bir embeddingsayısal vektör temsili• haline gelir. Bu vektörlere konum bilgisi (positional encoding) eklenir ki model hangi parçanın nerede olduğunu bilsin. Sonra tüm parçalar self-attentionparçaların birbiriyle ilişkisini ölçen mekanizma• katmanlarından geçer. Model böylece görüntünün bir köşesindeki detayla öbür köşesindekini aynı anda ilişkilendirebilir — CNN'lerin komşuluk odaklı bakışından farklı olarak.

Neden önemli?

Uzun yıllar görüntü işleme CNNconvolutional sinir ağı• demekti. ViT, yeterli veriyle eğitildiğinde CNN'leri geçebileceğini gösterdi ve alanı ikiye böldü. Bugün görüntü gören ve üreten pek çok model, multimodal sistemler dahil, ViT tabanlı omurgalar kullanıyor.

Kullanım alanları

Görüntü sınıflandırma, nesne tanıma, tıbbi görüntü analizi ve metinle görüntüyü birlikte işleyen multimodal modeller. Bir yapay zekâ "bu fotoğrafta ne var?" sorusunu cevaplıyorsa, arkasında büyük ihtimalle ViT akrabası bir yapı vardır.

mindi
mindi'nin notu
ViT'nin dersi şu: bazen bir alandaki çözümü alıp bambaşka bir alana taşımak, o alanı sıfırdan icat etmekten daha verimli. Transformer önce dili çözdü, sonra görüntüye el attı.