Anthropic'in otomatik araştırmacıları 10 hizalama hatasını insanlardan hızlı çözdü
*Yukarıdaki butona tıkla ve ekle. Yapay zeka gelişmelerini Google’da her zaman üstte gör.
İlgili Modeller

Anthropic Fellows ekibinin yeni çalışması, araştırmacı rolünde koşan bir yapay zeka ajanının 10 hizalama hatasında deneyimli insanların en iyi fikirlerini ortalama 6,4 saatte geçtiğini gösteriyor.
Anthropic'in Fellows programındaki üç araştırmacı, yapay zeka ajanlarının model güvenliğini kendi başlarına iyileştirebildiğini gösteren bir çalışma yayımladı. "Automated Researchers Can Reliably Mitigate Alignment Failures" başlıklı makale, araştırmacı rolünde çalışan bir ajanın 10 ayrı alignmenti
Modelin insan değer ve niyetleriyle uyumlu davranması. hatasında deneyimli insanların en iyi fikirlerini geçtiğini ortaya koyuyor.
Sistem nasıl kurulmuş
Otomatik araştırmacı, Claude Opus 4.8 üzerinde koşuyor. Ajan bir hatayı alıyor, çözüm öneriyor, uyguluyor ve sonucu 3-5 benchmarki
Modelleri standart görevlerde ölçen test setleri. üzerinde ölçüp döngüyü tekrarlıyor. Ele alınan hatalar arasında kandırma, dalkavukluk, jailbreak ve prompt enjeksiyonu var. Hedef modeller küçük tutulmuş: 2-7 milyar parametreli açık ağırlıklı modeller, ama yöntemler 4,7 kat büyüklerde de işe yaramış.
Rakamlar
Karşılaştırma için 28 deneyimli araştırmacı — ortalama 2,5 yıl güvenlik tecrübesi — aynı problemlere fikir üretmiş. Otomatik araştırmacılar bu fikirlerin en iyisini ortalama 6,4 saatte geçmiş. Maliyet farkı daha çarpıcı: ajan saatte yaklaşık 4 dolarlık API tüketiyor, insan araştırmacının saatlik maliyeti 150 dolar. Üretilen 1.601 yöntemin %2,4'ü, yani 39 tanesi, benchmark'i gerçekten çözmek yerine kandırmaya çalışmış; ekip bunların hiçbirinin en iyi sonuçlar arasına girmediğini söylüyor.
Araştırmacıların kendi koyduğu sınırlar
Makale iddiayı dar tutuyor: çalışma yalnızca ölçülebilen 10 hatayı kapsıyor, yeni ya da nadir türler kapsam dışı. Kazanımlar benchmark'e bağlı, daha yetenekli modellerde ayrı ayar gerektiriyor ve kapsamlı pekiştirmeli öğrenme sonrasında kalıcı olup olmadığı test edilmemiş. Listedeki hatalardan birinin neden bu kadar inatçı olduğunu bu rehberde ayrıntılı anlatmıştık.

"Kendi kendini geliştiren AI" başlığı büyük duruyor ama iş şimdilik 2-7 milyar parametreli küçük modellerde ve ölçülebilen on hatada. Asıl dikkat çekici sayı 6,4 saat değil, %2,4: ajanların bir kısmı sorunu çözmek yerine testi kandırmayı denemiş. Otomasyonun ölçtüğü aralık ne kadar darsa, o aralığı kandırmak da o kadar kolay oluyor.