⚡ Öne ÇıkanBilgisayarımda hangi ücretsiz yapay zeka çalışır?

Çekişmeli Örnek (Adversarial Example)

Araç kavramları
Ing: Adversarial ExampleSon güncelleme: 14 Eylül 2026
İnsanın gözüne normal görünen ama modeli kasıtlı olarak yanıltmak için ince ayarlanmış girdi. Panda fotoğrafına göz kapanmayan bir gürültü ekleyip modele "jibon" dedirtmek gibi.

Çekişmeli örnek nedir?

Çekişmeli örnek (adversarial example), bir yapay zeka modelini yanlış cevaba itmek için özel olarak hazırlanmış bir girdidir. İşin ürkütücü tarafı: bu girdi çoğu zaman insan gözüne tamamen normal görünür. Bir panda fotoğrafına, gözle fark edilmeyecek kadar hafif bir gürültü eklersin; sen hâlâ panda görürsün ama model kendinden emin bir şekilde "cıvık maymun" der. Fark, piksellerdeki minik ama hesaplı bir kaymadan ibarettir.

Nasıl çalışır?

Model bir girdiyi işlerken aslında yüksek boyutlu bir uzayda karar sınırları (decision boundary) çizer. Saldırgan, modelin bu sınırlarına olan matematiksel hassasiyetini kullanır: girdideki her pikseli, modelin hata yapma yönünde en çok değişecek şekilde küçük adımlarla oynatır. Bunu genelde modelin kendi gradient bilgisini tersine kullanarak yapar (gradient tabanlı saldırı). Sonuçta ortaya, orijinalinden neredeyse ayırt edilemeyen ama modeli çökerten bir kopya çıkar. Metin modellerinde de benzeri var: gözle masum görünen bir kelime dizisi, modelin guardrails'ini aşabilir — prompt injection ve jailbreak bu ailenin akrabalarıdır.

Neden önemli?

Çünkü yapay zeka artık sadece kedi-köpek ayırmıyor; otonom araçların trafik levhalarını okuduğu, dolandırıcılık filtrelerinin çalıştığı, tıbbi görüntülerin sınıflandırıldığı yerlerde. Bir dur levhasına yapıştırılan birkaç bant parçası modele onu "hız sınırı" olarak okutabiliyorsa, bu bir güvenlik açığıdır. Çekişmeli örnekler, modellerin göründüğü kadar sağlam olmadığını, "yüksek doğruluk" rakamının gerçek dünyadaki dayanıklılığı garanti etmediğini gösterir.

Kullanım alanları

İki yüzü var. Saldırı tarafında: görüntü tanıma, spam filtreleri, içerik moderasyonu ve otonom sistemleri kandırmak. Savunma tarafında ise araştırmacılar bu örnekleri kasıtlı üretip modeli onlarla eğitir (adversarial training), böylece model gelecekteki saldırılara karşı sertleşir. Red teaming ekipleri de modelin zayıf noktalarını yayına çıkmadan bulmak için bu tekniği kullanır.

Kaynak:arXiv
mindi
mindi'nin notu
"Model yüzde 99 doğru" cümlesi seni rahatlatmasın. O yüzde 99, birinin kasıtlı kandırmadığı temiz veride. Kritik iş yapan bir modeli değerlendirirken "ne kadar doğru" kadar "ne kadar kolay kandırılıyor" da sorulmalı.