World Labs Atlas: Tek görüntüden video üreten, sahneyi 3D yeniden inşa eden dünya modeli
*Yukarıdaki butona tıkla ve ekle. Yapay zeka gelişmelerini Google’da her zaman üstte gör.

World Labs, görüntü, video ve 3D'nin hepsini tek modele sığdıran yeni dünya modeli Atlas'ı tanıttı. Tek referans görüntüden istediğin kamerayı oynatıp bir dakikaya kadar 1440p video üretebiliyor, gördüğü sahneyi aynı anda üç boyutlu olarak yeniden inşa ediyor.
World Labs, sıfırdan eğittiği ve metin, görüntü, video ile 3D üzerinde aynı anda çalışan world modeli
Dünyayı gözlemleyip simüle ederek tahmin üreten yapay zeka modeli Atlas'ı duyurdu. Şirket Atlas'ı tek bir sahnede tüm bu veri türlerini birleştiren çok amaçlı bir model olarak konumlandırıyor; kamerayı komutla değil kesin geometriyle yönetiyorsun.
Ne yapabiliyor
Atlas'ın dört ana yeteneği var. İlk olarak bir veya birden çok referans görüntüden piksel-kusursuz kamera kontrolüyle görüntü ve video üretiyor; karede görünmeyen kısımları kurgulayıp sahneyi öteye taşıyor. İkincisi, bir sahneden yeni bakış açıları çıkarıp sahneyi açık biçimde 3D olarak yeniden kuruyor. Üçüncüsü, girdi videolarını yeniden çerçeveleyip zamanda ileri taşıyarak robotik eğitimi için gerçekten simülasyona geçiş (real-to-sim) sağlıyor. Son olarak metinden görüntü ve 360 derece panorama üretiyor; karmaşık komutları takip edip içine yazı da render edebiliyor.
Altyapı
Model bir diffusion modeli
Gürültüden adım adım anlamlı görüntü/video üreten model türü altyapısıyla tüm girdileri ortak uzamsal bir bağlamda birleştirip sıradaki kareyi buna göre tahmin ediyor. World Labs, hesaplama gücü arttıkça performansın da ölçeklendiğini söylüyor; Atlas'a şimdilik mühendislik erken erişimi ile ulaşılabiliyor. Bu yaklaşımın klasik üretici modellerden neden ayrıştığını dünya modeli rehberinde ayrıntıyla anlattım.

Dünya modeli alanı ürün için vaktinden önce doğmuş görünüyor: çoğu oyuncu bir dakikayı geçmeyen video demolarında. Atlas'ın asıl iddiası doğru açı üretmekten çok sahneyi 3D anlayıp sonra onu oynatabilmesi; bu da sıradaki adımın video değil, ortam üreticileri olacağını hissettiriyor.