Seyrek Dikkat (Sparse Attention)
MimariSparse Attention nedir?
Standart self-attention •her token''ın diğer tüm token''larla ilişkisini hesaplama• dizideki her token''ı diğer her token''la karşılaştırır. Bu, dizi uzadıkça hesabın karesel (N²) büyümesi demek: 100.000 token''lık bir context''te bu maliyet patlar. Sparse attention, her token''ın bütün token''lara değil, sadece dikkatle seçilmiş bir alt kümesine bakmasına izin vererek bu maliyeti düşürür.
Nasıl çalışır?
Fikir şu: her token''ın gerçekten her token''a bakması gerekmez. Sparse attention önceden tanımlı bir desenle hangi bağlantıların hesaplanacağına karar verir. Yaygın desenler: yakındaki token''lara bakan yerel (sliding window) desen, belirli aralıklarla uzağa uzanan atlamalı (strided) desen ve tüm diziyi gören birkaç "global" token. OpenAI''ın 2019''daki Sparse Transformers çalışması bu deseni popülerleştirdi; karesel maliyeti N√N seviyesine indirdi. Böylece model, tam attention''ın bilgisinin çoğunu koruyarak çok daha uzun dizileri işleyebiliyor.
Neden önemli?
Uzun context window •modelin aynı anda görebildiği token miktarı• bugün en çok istenen özelliklerden biri: koca dökümanlar, saatlerce kod, uzun sohbet geçmişi. Tam attention''la bunları işlemek hem yavaş hem pahalı. Sparse attention, uzun-context modellerin ekonomik olmasını sağlayan temel tekniklerden biri; Flash Attention ve grouped-query attention gibi yöntemlerle birlikte "uzun context ucuzladı" denkleminin bir parçası.
Kullanım alanları
Uzun metin, uzun kod ve uzun ses/görüntü dizilerini işleyen modellerde; verimli uzun-context transformer mimarilerinde; belleği ve gecikmeyi düşürmek istenen üretim (inference) senaryolarında kullanılır. Pratikte modern büyük modeller genelde birkaç attention tekniğini bir arada kullanır.
Ilgili terimler
