⚡ Öne ÇıkanYapay zekaya sıfırdan başla. Ücretsiz Eğitimler

Veri Zehirlenmesi (Data Poisoning)

Veri & eğitim
Ing: Data PoisoningGuncellendi: 21 Temmuz 2026
Bir modelin eğitim verisine kasıtlı olarak bozuk örnek sokma saldırısı. Model o veriyle öğrenince saldırganın istediği hatayı yapmaya başlar.

Veri zehirlenmesi nedir?

Veri zehirlenmesi, bir yapay zeka modelinin eğitildiği veri kümesine kasıtlı olarak bozuk, yanıltıcı ya da gizli tetikleyici içeren örnekler sokulmasıdır. Amaç modeli çökertmek değil — modelin belirli bir durumda saldırganın istediği çıktıyı vermesini sağlamak.

Fark şurada: normal veri hatası rastgeledir, zehirlenme hedeflidir. Model eğitim sırasında bu örnekleri "doğru" kabul eder ve öğrendiği şeyi silmek, sonradan çok pahalıya patlar.

Nasıl çalışır?

Büyük modeller internetten toplanan devasa veri kümeleriyle eğitiliyor. Bu ölçek, saldırı yüzeyini de büyütüyor. Yaygın yöntemler:

Backdoor (arka kapı) yerleştirme: Eğitim verisine, içinde belirli bir tetikleyici kelime ya da görsel desen bulunan örnekler eklenir. Model normalde düzgün çalışır, ama tetikleyiciyi gördüğü anda saldırganın istediği davranışa geçer.

Etiket bozma: Örnekler doğru, etiketler yanlıştır. Model sistematik olarak yanlış sınıflandırmayı öğrenir.

Kaynak ele geçirme: Veri kümesi topladığı adresleri zaman içinde tekrar ziyaret ediyorsa, o adresteki içeriği sonradan değiştirmek yeterli olabiliyor. Veri kümesi listesi eski içeriği işaret ederken, indirilen şey yeni ve zehirli içerik oluyor.

Kritik nokta: zehirlenme için veri kümesinin büyük bölümünü kirletmek gerekmiyor. Araştırmalar, oldukça küçük ve sabit sayıda zehirli belgenin bile model boyutundan bağımsız olarak arka kapı açabildiğini gösteriyor.

Neden önemli?

Çünkü tespiti zor. Zehirlenmiş model standart testlerde temiz görünür — arıza sadece tetikleyici geldiğinde ortaya çıkar. Modeli kullanan şirket sorunu üretimde, gerçek kullanıcı üzerinde fark eder.

Bir de tedarik zinciri boyutu var. Hazır bir model, hazır bir veri kümesi ya da topluluktan indirilen bir ince ayar ağırlığı kullanıyorsan, o zincirdeki her halka güven meselesidir.

Kullanım alanları

  • Güvenlik testi: Kırmızı takım çalışmalarında modelin zehirlenmeye dayanıklılığı ölçülür.
  • Veri kümesi denetimi: Eğitim verisinin kaynağı, indirilme zamanı ve içerik özeti (hash) kayıt altına alınır.
  • Telif koruması: Sanatçılar, eserlerinin izinsiz eğitimde kullanılmasını engellemek için görsellerine model bozucu değişiklikler ekleyen araçlar kullanıyor — savunma amaçlı zehirlenme.
  • İnce ayar hijyeni: Kullanıcıdan gelen veriyle ince ayar yapan sistemlerde girdi filtreleme zorunlu hale geliyor.
mindi
mindi'nin notu
Zehirlenmiş model bozuk görünmez, o yüzden tehlikeli. Kapı kilidini değiştirmişler ama kapı hâlâ normal açılıyor — sadece bir kişinin anahtarı da uyuyor artık. Hazır veri kümesi indirirken kaynağına bakmanın sebebi bu.