Yapay zeka dünyasının önde gelen isimlerinden Fei-Fei Li'nin kurduğu World Labs, yeni dünya modeli Atlas'ı görücüye çıkardı. Atlas, tek bir fotoğraftan 1440p çözünürlükte bir dakikaya kadar video üretebiliyor ve az sayıda görüntüden gerçek dünya sahnelerini üç boyutlu olarak yeniden inşa edebiliyor. Bu hamle, yapay zekanın yalnızca içerik üretmekle kalmayıp fiziksel dünyayı anlama ve simüle etme yolunda attığı en somut adımlardan biri olarak değerlendiriliyor.
World Labs, Atlas'ı sıfırdan eğittiğini ve metin, görüntü, video ile üç boyutlu veriyi tek bir mimaride işleyen bir "omni model" olarak konumlandırdığını açıkladı. Model, tüm girdileri ortak bir mekansal bağlamda birleştiriyor ve gördüğü her şeyle üç boyutta tutarlı kalarak sahnenin devamını üretiyor. Bu yaklaşım, geleneksel modellerin aksine girdi türleri arasında ayrım yapmıyor; her veriyi aynı uzamsal çerçevede işleyerek daha bütünsel bir dünya anlayışı sunuyor.
Atlas hangi görevleri üstleniyor?
Atlas, bir ya da birden fazla görüntüden yola çıkarak kullanıcının belirlediği açıdan yeni kareler oluşturuyor. Sahneleri tek bir fotoğraftan onlarca görüntüye kadar farklı girdilerle üç boyutlu olarak yeniden kuruyor. Videoları farklı açılardan yeniden çerçeveleyerek robotik alanında gerçek dünyadan simülasyona geçiş süreçlerini destekliyor. Ayrıca metinden 360 derece panoramalar dahil çeşitli görseller üretebiliyor. Bu özellikler, modeli yalnızca bir içerik üreticisi olmaktan çıkarıp robotik eğitimi ve sanal ortam tasarımı gibi endüstriyel uygulamalar için de güçlü bir araç haline getiriyor.
Modelin en dikkat çekici yeniliği ne?
Atlas'ın öne çıkan özelliği, kamera geometrisini metin tabanlı komut yerine doğrudan bir girdi türü olarak kullanması. Kullanıcı her kareyi ve her kamera hareketini kendisi tasarlıyor. Referans görüntüden yola çıkarak sahnenin görünmeyen kısımlarını dünya bilgisiyle tahmin eden Atlas, özel çekim ekipmanı ya da yüzlerce görüntü gerektirmeden nesneleri ve mekânları canlandırıyor. Bu, özellikle film prodüksiyonu ve oyun geliştirme gibi alanlarda maliyet ve zaman tasarrufu sağlayabilecek bir yaklaşım olarak öne çıkıyor.
Kaç görüntüyle ne kadar başarılı sonuçlar veriyor?
World Labs'e göre model, iki ya da üç görüntüyle bile sadık sonuçlar veriyor ve yalnızca üç boyutlu yeniden kurulum için eğitilmiş uzman modelleri geride bırakıyor. Girdi sayısı arttıkça modelin ürettiği hayali kısımlar azalıyor ve yüzden fazla görüntüyle gerçek ortamlar birebir yeniden yaratılabiliyor. Bu ölçeklenebilirlik, modelin hem hızlı prototipleme hem de yüksek doğruluk gerektiren profesyonel kullanımlar için esnek bir çözüm sunduğunu gösteriyor.
Atlas hangi ürünlerde kullanılacak?
Atlas, World Labs'in Marble adlı ürününün gelecekteki sürümlerine güç verecek. Marble, şu anda kullanıcıların tek bir görüntüden etkileşimli 3D dünyalar oluşturmasına olanak tanıyan bir platform olarak biliniyor. Atlas'ın entegrasyonuyla birlikte Marble'ın çok daha gelişmiş ve gerçekçi dünyalar üretebileceği belirtiliyor. Ayrıca Atlas, başvuru yoluyla seçili iş ortaklarına erken erişimle sunulacak. Bu erken erişim programı, modelin farklı sektörlerdeki potansiyelini test etmek ve geri bildirim toplamak amacıyla tasarlanmış görünüyor.
Türkiye'de ne zaman kullanılabilecek?
World Labs'in Atlas için Türkiye'ye özel bir çıkış tarihi veya erişim planı henüz açıklanmadı. Modelin ilk etapta yalnızca seçili iş ortaklarına sunulacağı göz önüne alındığında, Türkiye'deki bireysel kullanıcıların ve geliştiricilerin Atlas'a erişimi için küresel lansman sürecinin tamamlanmasını beklemesi gerekecek. Şirketin bu süreçte hangi bölgelere öncelik vereceği ise merak konusu.
World Labs'in bu hamlesi, yapay zeka alanında dünya modelleri kavramının giderek daha somut hale geldiğini gösteriyor. Tek bir fotoğraftan tutarlı ve etkileşimli 3D dünyalar üretebilen modeller, önümüzdeki yıllarda hem yaratıcı endüstrileri hem de robotik ve simülasyon alanlarını kökten değiştirebilir.