
Donanım
Nvidia Rubin Mimarisiyle Yapay Zeka Çıkarımında Yeni Bir Devrim Geliyor
Nvidia'ın yeni Rubin GPU platformu ile yapay zeka çıkarımında verimlilik odaklı devrim başlıyor.
Hexcore
2 dk
22 Temmuz 2026

Nvidia, yapay zeka dünyasının odak noktasını gelen ön eğitimlerden milyarlarca kullanıcıya hizmet veren 'ajan modellerinin' çıkarmasına kaydıran yeni Vera Rubin mimarisini duyurdu. Bu gelecek yıl piyasaya çıkacak platformun temel hedefi, devasa ölçekte ve düşük birim maliyetle metin üretme (token) süreçlerini mümkün kılmak olarak belirlendi.
Odak noktası geleneksel işlem gücü artışından ziyade verimlilik üzerine kuruludur. Nvidia, bu yeni mimarinin GPU seviyesinden sunucu raf ölçeğine ve veri merkezleri düzeyine kadar çıkarım (inference) verimliliğini nasıl katlayacağını detaylandı. Rubin mimarisi, iki hesaplama birimini yüksek bant genişliğine sahip tek bir paket içinde birleştirerek, 224 Streaming Multiprocessor (SM) barındıran güçlü bir çip sunuyor.
Bu yeni GPU'nun kalbindinde, toplamda 896 Tensor Core bulunuyor ve bu çekirdekler 288 GB HBM4 belleği ile destekleniyor. Bu konfigürasyon, saniyede 22 terabayta (TB/s) ulaşabilen muazzam bir bellek bant genişliği sağlıyor. Nvidia, Rubin'i öncelikle çıkarım odaklı bir hızlandırıcı olarak konumlandırıyor ve spesifik performans değerleri yayınladı.
Rubin mimarisi çeşitli veri türlerinde olağanüstü veriler sunuyor. En dikkat çekici performansı, nadir (sparse) yapaylık içeren modellerde saniyede 50 PFLOPS NVFP4 çıkarım gücü olarak açıklıyor. Ancak bu yalnızca bir gösterge olup çipin işleyebildiği pek çok farklı veri türünü kapsıyor.
Tarihe baktığımızda, FP32 hassasiyetinde 130 TFLOPs saniyede hesaplama yapabilme kapasitesi sunan Rubine, özellikle düşük hassasiyetli operasyonlarda büyük bir sıçrama yapıyor. INT8 formatında ise ulaşılan 250 TOPS değeri işlem verimliliğinin ne denli arttığını gözler önüne seriyor.
Yapay zeka modelleri gelen sabit yapılardan farklı olarak karma bir uzman model mimarisine (MoE) evrildi. Bu mimaride tüm parametreler kullanılmak yerine, belirli her çıktı token'ı için sadece ilgili uzman alt ağları devreye giriyor. Ancak bu durum, GPU belleğindeki kısıtlı alanı ve ek yönetimi zorlaştırıyor.
Rival çip ailelerinde, bir modelin sahip olduğu her uzmana dair konum bilgisini ayrı şekilde bellekte tutmak gerekiyordu. Bu yöntem, uzmanın sayısı arttıkça hesaplama yükünü artırıyordu. Rubine in üstün noktası ise Tensor Bellek Hızlandırıcı (TMA) yeteneklerindeki iyileştirmelerden geliyor.
Rubin'in TMA birimi, şu anki en gelişmiş modellerde yer alan çok sayıda uzmanın yönetim zorluğunu başarıyla çözdü. Artık yeni işlemci çekirdekleri (GPU kernels), yürütme zamanında tek ve birleşik bir uzman tanımlayıcısını doğrudan TMA komutunda tutabiliyor. Bu sayede Uzman Metadata'sının hesaplanma yükü azalıyor ve veri hareketi için harcanan işlem süresi minimuma iniyor.
Bu optimize yaklaşım, pahalı yapay zeka hızlandırıcı çipin vakitlerinin, doğal olarak en çok zaman geçirmesi gereken çıkarmaya yönelik hesaplamalara ayrılmasını sağlıyor. Bu büyük bir mimari rahatlık sunuyor.
Henüz yorum yapılmamış. İlk yorumu sen yap!
E-posta adresiniz yayımlanmayacaktır. Gerekli alanlar (*) ile işaretlenmiştir.