Veri Zehirlenmesi (Data Poisoning)
Veri & eğitimVeri zehirlenmesi nedir?
Veri zehirlenmesi, bir yapay zeka modelinin eğitildiği veri kümesine kasıtlı olarak bozuk, yanıltıcı ya da gizli tetikleyici içeren örnekler sokulmasıdır. Amaç modeli çökertmek değil — modelin belirli bir durumda saldırganın istediği çıktıyı vermesini sağlamak.
Fark şurada: normal veri hatası rastgeledir, zehirlenme hedeflidir. Model eğitim sırasında bu örnekleri "doğru" kabul eder ve öğrendiği şeyi silmek, sonradan çok pahalıya patlar.
Nasıl çalışır?
Büyük modeller internetten toplanan devasa veri kümeleriyle eğitiliyor. Bu ölçek, saldırı yüzeyini de büyütüyor. Yaygın yöntemler:
Backdoor (arka kapı) yerleştirme: Eğitim verisine, içinde belirli bir tetikleyici kelime ya da görsel desen bulunan örnekler eklenir. Model normalde düzgün çalışır, ama tetikleyiciyi gördüğü anda saldırganın istediği davranışa geçer.
Etiket bozma: Örnekler doğru, etiketler yanlıştır. Model sistematik olarak yanlış sınıflandırmayı öğrenir.
Kaynak ele geçirme: Veri kümesi topladığı adresleri zaman içinde tekrar ziyaret ediyorsa, o adresteki içeriği sonradan değiştirmek yeterli olabiliyor. Veri kümesi listesi eski içeriği işaret ederken, indirilen şey yeni ve zehirli içerik oluyor.
Kritik nokta: zehirlenme için veri kümesinin büyük bölümünü kirletmek gerekmiyor. Araştırmalar, oldukça küçük ve sabit sayıda zehirli belgenin bile model boyutundan bağımsız olarak arka kapı açabildiğini gösteriyor.
Neden önemli?
Çünkü tespiti zor. Zehirlenmiş model standart testlerde temiz görünür — arıza sadece tetikleyici geldiğinde ortaya çıkar. Modeli kullanan şirket sorunu üretimde, gerçek kullanıcı üzerinde fark eder.
Bir de tedarik zinciri boyutu var. Hazır bir model, hazır bir veri kümesi ya da topluluktan indirilen bir ince ayar ağırlığı kullanıyorsan, o zincirdeki her halka güven meselesidir.
Kullanım alanları
- Güvenlik testi: Kırmızı takım çalışmalarında modelin zehirlenmeye dayanıklılığı ölçülür.
- Veri kümesi denetimi: Eğitim verisinin kaynağı, indirilme zamanı ve içerik özeti (hash) kayıt altına alınır.
- Telif koruması: Sanatçılar, eserlerinin izinsiz eğitimde kullanılmasını engellemek için görsellerine model bozucu değişiklikler ekleyen araçlar kullanıyor — savunma amaçlı zehirlenme.
- İnce ayar hijyeni: Kullanıcıdan gelen veriyle ince ayar yapan sistemlerde girdi filtreleme zorunlu hale geliyor.
Ilgili terimler
