Yapay zeka dünyası, hem düşük gecikme (latency) hem de yüksek verimlilik gerektiren zorlu talepler karşısında yeni mimarilere yöneliyor. Bu doğrultuda öne çıkan iki dev isim olan AMD ve Cerebras Systems iş birliğine giderek, yapay zeka çıkarım (inference) süreçlerini kökten dönüştürecek hibrit bir platform geliştirecek.
Yeni oluşturulan bu çözümün temelinde, AMD'nin efsanevi EPYC işlemcileri ile Helios isimli rakskal altyapısının gücü ile Cerebras firmasının piyasaya sürdüğü Wafer-Scale Engine (WSE) mimarisi bulunuyor. Bu ortaklık, yapay zeka modellerinin sadece hızını artırmakla kalmıyor, aynı zamanda enerji tüketimi ve maliyet açısından da büyük verimlilik vaat ediyor.
Mimari Farklılaşma: İş Bölümü Yeni Bir Denge Sunuyor
Yapay zeka çıkarımı (yani eğitilmiş bir modelin somut çıktılar üretmesi) karmaşık bir süreçtir ve genellikle iki ana aşamadan oluşur: Bağlamı Hazırlama (Context/Prefill) ve Çözüm Üretme (Token Generation). Bu yeni platform, bu süreci en verimli şekilde ayırmak için mimari bir yaklaşım sergiliyor. AMD'nin güçlü EPYC işlemcileri ile desteklenen Helios altyapısı, yoğun hesaplama gerektiren 'Bağlamı Hazırlama' aşamasını üstleniyor. Yani uzun ve karmaşık girdiler (prompt'lar) ve büyük bağlam pencereleri anında işleme yeteneğine sahip.
Mesele sadece bu kadarmış gibi görünse de asıl fark, Cerebras WSE mimarisinin 'Token Üretme' aşamasındaki üstün başarısıdır. Bu aşama bellek bant genişliğinden çok etkilenen ve gecikmeye karşı en hassas kısımdır. Cerebras, Wafer-Scale Engines ile bu gecikmeli süreci devrim niteliğinde hızlandırarak modelin saniyelik token sayısını (T/s) maksimum seviyeye çıkarıyor.
Nvidia'ya Alternatif Bir Yaklaşım: Tersine Özel Donanım Dizaynı
Yapısal olarak AMD ve Cerebras'ın bu birleşimi, yapay zeka donanımı alanında son yıllarda öne çıkan disaggregate (dağıtılmış) mimari konseptleriyle aynı mantık üzerine kurulu. Bu prensip NVIDIA tarafından daha önce görülmüş olsa da, yeni ortaklık özel hardware parçalarının bu iş yükünü farklı bölümlere nasıl dağıttığıyla fark yaratıyor.
NVIDIA'nın önceki yaklaşımında genellikle ön hazırlık aşaması için optimize edilmiş bir işlemci ve bellek bant genişliğine dayalı üretme aşaması için ayrı donanımlar kullanılıyordu. Ancak AMD ve Cerebras platformu, bu dağıtılmış tasarımı tersine çevirerek spesifik gereksinimlere göre uzmanlaşmış parçaları farklı görevlerde konumlandırıyor. Yani AMD Helios'un hesaplama gücü prompt yüklerini yönetirken, özel bir WSE mimarisi bellek bant genişliği kısıtı olan ve gecikmeye en hassas aşamayı devralarak optimizasyonu zirveye taşıyor.
Sektördeki Etkileri ve Gelecek Planları
Bu iki teknoloji devi, platformlarının sadece teknik performans açısından değil, aynı zamanda enerji verimliliği söz konusu olduğunda da büyük sıçrama yapacağını iddia ediyor. Beklentiler, bu disaggregate çıkarım mimarisinin watt başına elde edilen token sayısını (T/s/W) %5’e varan oranlarda artırması yönünde. Bu başarı, veri merkezlerinin daha az enerji harcayarak aynı veya daha fazla işi yapabileceği anlamına geliyor.
Mevcut planlara göre Cerebras, AMD'nin geliştirdiği Helios sistemlerini kendi veri merkezlerine entegre etmeyi hedefliyor. Nihai hibrit çözümün ilk olarak hizmet vereceği 'Cerebras Bulut' (Cerebras Cloud) platformunun ise 2026 yılının ikinci yarısında kullanıma sunulması bekleniyor.
Hermesi, büyük dil modelleri ve yapay zeka çıkarımı artık sadece ham işlem gücüyle değil, görev bazlı uzmanlaşmış donanımlar aracılığıyla benzersiz bir verimlilikle gerçekleştirileceği vizyonunu ortaya koyuyor. Bu iş birliği, Yapay Zeka altyapısı tasarımlarında yeni standartların belirleneceğine işaret ediyor.