⚡ Öne ÇıkanBilgisayarımda hangi ücretsiz yapay zeka çalışır?

ARC-AGI-3 (İnteraktif Akıl Yürütme Testi)

Araç kavramları
Ing: ARC-AGI-3Son güncelleme: 4 Eylül 2026
Yapay zeka ajanlarını hiç görmedikleri ortamlarda sınayan interaktif benchmark. İnsanlar rahat çözerken frontier modeller hâlâ çuvallıyor.

ARC-AGI-3 nedir?

ARC-AGI-3, François Chollet'in kurduğu ARC Prize Foundation'ın 25 Mart 2026'da çıkardığı bir yapay zeka testidir. Amacı basit ama zorlu: bir modelin ezberlediğini tekrar etmesini değil, hiç karşılaşmadığı bir problemde sıfırdan uyum sağlamasını ölçmek. Buna "akışkan zeka" (fluid intelligence) deniyor.

Önceki ARC testlerinden farkı interaktif olması. Eski sürümlerde modele statik bir grid gösterilip "kuralı çöz" deniyordu, tek atışlık. ARC-AGI-3 ise ajanı oyun benzeri, hiç bilmediği bir ortama atıyor ve ona hiçbir talimat vermiyor.

Nasıl çalışır?

Ajana ne yapması gerektiği söylenmez. Kendi kendine ortamı keşfeder, kuralları çıkarır, "kazanmanın" neye benzediğini anlar ve buna göre hareket eder. Test dört temel yeteneği ölçer: keşif (exploration), dünya modeli kurma (modeling), hedef belirleme (goal-setting) ve planlama (planning).

Akıllı bir tasarım detayı var: ortamlarda dil, sayı, harf, kültürel sembol ya da tanıdık nesne bulunmaz. Sebebi, modelin eğitim verisinden "a, bu bir kapı" diye kestirmeden çözmesini engellemek. Sadece her insanda ortak olan temel bilişsel sezgilere dayanır. Ayrıca yeni bir metrik getirir: sadece "çözdü mü" değil, insana kıyasla kaç hamlede çözdüğü — yani aksiyon verimliliği.

Neden önemli?

Lansmanda ortaya çıkan tablo çarpıcıydı: eğitimsiz insanlar testi rahatça çözerken, dönemin en güçlü modelleri toplamda yüzde birin altında kaldı. Bu uçurum, bugünkü modellerin bilgi doldurmada güçlü ama gerçek anlamda yeni bir duruma uyum sağlamada hâlâ zayıf olduğunu gösteriyor. ARC Prize, insan seviyesine ulaşan ilk ajana milyonlarca dolarlık ödül koydu.

Kullanım alanları

Ajan (agent) mimarilerinin gerçek genelleme kabiliyetini ölçmek, "benchmark ezberi" oyununu bozmak ve bir modelin gerçekten kendi başına düşünüp düşünmediğini görmek için kullanılır. LLM'lerin klasik testleri geçmesiyle gerçek zeka arasındaki farkı görmek isteyenlerin baktığı yerdir.

mindi
mindi'nin notu
Klasik benchmark'larda modeller neredeyse tavana vurdu; ARC-AGI-3'te ise bir çocuğun dakikada çözdüğünü frontier modeller çözemiyor. Bu boşluk, "yapay zeka geldi" diyenlere iyi bir hatırlatma.