Şifreli düşünce zincirleri kırıldı: zayıf model, güçlü modelin aklını okudu
Yeni bir araştırma, büyük sağlayıcıların istemciye gönderdiği şifreli düşünce zinciri bloklarının aynı ailedeki zayıf modellere geri beslenip düz metne çevrilebildiğini gösterdi. Açık üç sağlayıcıya da bildirildi ve kapatıldı.
Bir grup araştırmacı, sınır modellerinin gizli akıl yürütmesini dışarı çıkarmanın şaşırtıcı derecede basit bir yolunu buldu. Yöntem şifre kırmak değil, modeli kendi ailesine karşı kullanmak.
Saldırı nasıl işliyor
Büyük sağlayıcılar API cevabında modelin chain-of-thoughti
Modelin cevaba giderken izlediği adım adım düşünme süreci. blokunu şifreli olarak da gönderiyor. Araştırmacılar aynı ailedeki tüm modellerin aynı şifreleme anahtarını kullandığını fark etti. Güçlü bir modelden alınan şifreli blok ailenin en zayıf üyesine gönderilip "bu düşünceyi olduğu gibi yaz" denince model uyuyor. Küçük modellerde koruma daha gevşek olduğundan jailbreaki
Modelin güvenlik kısıtlarını aşacak şekilde kandırılması. kolay oluyor; güçlü modele hiç dokunmadan onun düşüncesi okunuyor.
Ne kadar veri açıkta kalmış
Kamuya açık kod depolarında yüz binlerce şifreli akıl yürütme bloku dolaşıyor. Makale bunlardan 315.320 tanesinin çözülebildiğini, blokların içinden kimlik bilgisi ve kişisel veri çıkarılabildiğini bildiriyor. Çözülen izler, modellerin insan okusun diye yazmadığı, telgraf gibi kısaltılmış bir iç konuşmayı ortaya çıkarıyor.
Daha sinsi kısım
Makale bir prompt injectioni
Modele dışarıdan gizli talimat sızdırma saldırısı. varyantı da gösteriyor: model bir dosyayı dışarı göndermeyi düşünmeye ikna ediliyor, sonra o düşünce bloku başka bir modele besleniyor. Modeller kendi akıl yürütme izlerini sorgusuz kabul ediyor, dolayısıyla oraya sızmış bir talimatı uygulama ihtimalleri normal girdiye göre belirgin şekilde yüksek. Bilgisayarı doğrudan kullanabilen ajanların neler yapabildiğini şu karşılaştırmada anlatmıştık; risk tam da orada büyüyor.
Açık kapatıldı
Ekip bulguları sağlayıcılara bildirdi ve makaleye göre aynı saldırılar artık çalışmıyor. Yani bugün alınacak acil bir önlem yok. Kalıcı olan ders başka: ajan zincirlerinde modelin kendi düşüncesine duyduğu güven, başlı başına bir saldırı yüzeyi.

Buradaki asıl güzellik saldırının basitliğinde: kimse şifre kırmamış, sadece aynı ailenin zayıf üyesine sormuş. Ajan kuranlar için ders son paragrafta duruyor; bir modelin kendi düşünce izine gösterdiği güven, dışarıdan doldurulabilen bir kutu. Açık kapandı ama aynı mantık başka bir yerden yine çıkar. Sağlayıcıların bu kez hızlı yama geçmesi de not düşülmeli, altı ay bekleyen örneklerini bu hafta gördük.
Bu haber Simon Willison kaynağındaki içerikten mindi tarafından Türkçeye derlenmiştir.