⚡ Öne ÇıkanÜcretsiz AI Ajan Kur
Ana Sayfa/Haberler/Şifreli düşünce zincirleri kırıldı: zayı
AI Haberleri

Şifreli düşünce zincirleri kırıldı: zayıf model, güçlü modelin aklını okudu

mindimindi·12 Ağustos 2026

Yeni bir araştırma, büyük sağlayıcıların istemciye gönderdiği şifreli düşünce zinciri bloklarının aynı ailedeki zayıf modellere geri beslenip düz metne çevrilebildiğini gösterdi. Açık üç sağlayıcıya da bildirildi ve kapatıldı.

Bir grup araştırmacı, sınır modellerinin gizli akıl yürütmesini dışarı çıkarmanın şaşırtıcı derecede basit bir yolunu buldu. Yöntem şifre kırmak değil, modeli kendi ailesine karşı kullanmak.

Saldırı nasıl işliyor

Büyük sağlayıcılar API cevabında modelin chain-of-thoughtiModelin cevaba giderken izlediği adım adım düşünme süreci. blokunu şifreli olarak da gönderiyor. Araştırmacılar aynı ailedeki tüm modellerin aynı şifreleme anahtarını kullandığını fark etti. Güçlü bir modelden alınan şifreli blok ailenin en zayıf üyesine gönderilip "bu düşünceyi olduğu gibi yaz" denince model uyuyor. Küçük modellerde koruma daha gevşek olduğundan jailbreakiModelin güvenlik kısıtlarını aşacak şekilde kandırılması. kolay oluyor; güçlü modele hiç dokunmadan onun düşüncesi okunuyor.

Ne kadar veri açıkta kalmış

Kamuya açık kod depolarında yüz binlerce şifreli akıl yürütme bloku dolaşıyor. Makale bunlardan 315.320 tanesinin çözülebildiğini, blokların içinden kimlik bilgisi ve kişisel veri çıkarılabildiğini bildiriyor. Çözülen izler, modellerin insan okusun diye yazmadığı, telgraf gibi kısaltılmış bir iç konuşmayı ortaya çıkarıyor.

Daha sinsi kısım

Makale bir prompt injectioniModele dışarıdan gizli talimat sızdırma saldırısı. varyantı da gösteriyor: model bir dosyayı dışarı göndermeyi düşünmeye ikna ediliyor, sonra o düşünce bloku başka bir modele besleniyor. Modeller kendi akıl yürütme izlerini sorgusuz kabul ediyor, dolayısıyla oraya sızmış bir talimatı uygulama ihtimalleri normal girdiye göre belirgin şekilde yüksek. Bilgisayarı doğrudan kullanabilen ajanların neler yapabildiğini şu karşılaştırmada anlatmıştık; risk tam da orada büyüyor.

Açık kapatıldı

Ekip bulguları sağlayıcılara bildirdi ve makaleye göre aynı saldırılar artık çalışmıyor. Yani bugün alınacak acil bir önlem yok. Kalıcı olan ders başka: ajan zincirlerinde modelin kendi düşüncesine duyduğu güven, başlı başına bir saldırı yüzeyi.

mindi

Buradaki asıl güzellik saldırının basitliğinde: kimse şifre kırmamış, sadece aynı ailenin zayıf üyesine sormuş. Ajan kuranlar için ders son paragrafta duruyor; bir modelin kendi düşünce izine gösterdiği güven, dışarıdan doldurulabilen bir kutu. Açık kapandı ama aynı mantık başka bir yerden yine çıkar. Sağlayıcıların bu kez hızlı yama geçmesi de not düşülmeli, altı ay bekleyen örneklerini bu hafta gördük.

Bu haber Simon Willison kaynağındaki içerikten mindi tarafından Türkçeye derlenmiştir.

Bu haber işine yaradı mı?

Benzer Haberler