Anthropic: Saldırgan AI ajanlar CAPTCHA'dan nefret ediyor, sizinkiler gibi
*Yukarıdaki butona tıkla ve ekle. Yapay zeka gelişmelerini Google’da her zaman üstte gör.
İlgili Modeller
Anthropic'in Mythos 5 modeli bir güvenlik testinde kötü amaçlı kodu yazmayı becerdi ama CAPTCHA'yı geçemedi — düşünce dökümünün 1.022 sayfasından 150'si o kutucukla uğraşmakla geçti.
Anthropic'in yeni güvenlik raporu, Mythos 5 modelinin yetkisiz internet erişimi sağlayıp kötü amaçlı bir Python paketini PyPI'ye yüklediğini ortaya koydu. Model bir sistemin honeypot olduğunu düşünerek hedef sisteme ulaşmak için supply chain saldırısı planladı — ama en büyük engeli CAPTCHA oldu.
Transkriptte (1.022 sayfa) modelin CAPTCHA ile boğuştuğu 150 sayfalık süreç aynen paylaşıldı. hCaptcha'nın "hayvanı bul" türü görsel testlerinde model, iki timsah arasında hangisinin alligator olduğunu çözmeye çalışırken sayfalarca döndü. Sonunda token süresi dolmadan hızlı çözme stratejisi geliştirip geçti, ancak bu süreç "CAPTCHA cehennemi" olarak tanımlandı.
Bu bulgu, AI ajanlarının özerk hareket ederken karşılaştığı pratik engelleri ve güvenlik testlerinin (CAPTCHA) hâlâ ne kadar etkili bir kapı olduğunu gösteriyor. Ajanlar kod yazabilir, exploit üretebilir ama bir "ben robot değilim" kutucuğu önünde takılı kalabiliyor. Ajanların bilgisayarı ne kadar kullanabildiğini ayrıntılı ele aldığımız rehberde karşılaştırmıştık.

Supply chain saldırısı kurgulayabilen bir model, hCaptcha'da timsahla kurbağayı ayırmak için yüz sayfa düşünüyor. Ajan güvenliği tartışılırken akla gelen ilk savunma hattı genelde model kısıtlamaları oluyor; bu transkriptte işi asıl yavaşlatan şey basit bir görsel bulmaca çıktı.