Bilgisayar donanımıyla yakından ilgilenen bir hobi meraklısı, oldukça eski ve genellikle sunucu işlerinde kullanılan Nvidia Tesla V100 isimli yapay zeka hızlandırıcıyı alıp şaşırtıcı bir amaç için yeniden değerlendirdi. Bu dev GPU'nun en belirgin özelliği, sunduğu büyük bellekti ve sesten ziyade veri işlemeye odaklanması bekleniyordu. Ancak bu meraklı sayesinde, son birkaç yılda donanım fiyatlarının giderek yükseldiği bir dönemde, toplam VRAM miktarını sadece 266 dolar gibi nispeten uygun bir bütçeyle iki katına çıkarmayı başardı.
Elde ettiği bu 32 GB'lık bellek sayesinde kişisel bilgisayarı artık çok daha büyük yapay zeka modellerini kendi içinde çalıştırmak için kullanabiliyor. Bu başarı özellikle, yeni donanımlar ve yazılımların maliyetlerinin sürekli artmasıyla dikkat çekiyor. Tesla V100 SXM2 gibi eski bir platformdan gelen bu güçlü ekran kartı sayesinde kullanıcılar, 32 milyar parametrelik devasa modelleri saniyede yaklaşık 32 token hızında işlemeye imkan bulabiliyor.
Eski Donanım Yeni Ama Güçlü Yapay Zeka İşleri İçin Kullanılıyor
Tüm bu sistem kurulumu büyük ölçüde ucuza bulunabilen ikinci el donanımlardan oluşuyor. Meraklı, 16 GB HBM2 bellek kapasitesine sahip bir Tesla V100 SXM2 kartını tedarik etti ve sisteme entegrasyon için gerekli ara adaptörleri temin etti. Toplamda yaklaşık 200 dolar civarında harcama yaparak bu güç yükseltmesi hayata geçirildi.
Ancak, sistemde bulunan bir başka dikkat çekici unsur da VRAM genişlemesinin getirdiği sesten ziyade, aslında ortaya çıkan fan gürültüsüydü. Tesla V100 gibi sunucu odaklı ve çok güçlü ekran kartları standart olarak oldukça yüksek sesli soğutma sistemleriyle gelirler. Meraklı tarafından tarif edilen bu fansız ortamda, kartın normalde ürettiği 82 desibel civarındaki tiz gürültü; metalle dolu bir çöp öğütücü veya bir çim biçme makinesi çalışıyormuş hissi veriyordu.
Gürültüyü Kontrol Altına Almak Teknik Bir Zorluktu
Yüksek sesli bu soğutma sorununu çözmek, projenin en karmaşık kısmını oluşturdu. Standart olarak gelen fanın kablolarının bir şekilde yeniden yönlendirilmesi ve bilgisayar anakartındaki PWM kontrolüne bağlanması gerekiyor. Bu işlem teknik bilgi gerektirse de başarıyla tamamlandı. Meraklı’nın testlerine göre, Tesla V100 tamamen yük altındayken bile 50 derecenin altında kalmasını sağlamak için fanın çok düşük bir devirde çalışması yeterli bulunuyor.
Geliştirilen bu sistemdeki toplam 32 GB'lık belleği yapay zeka uygulamaları için kullanabilmek ise oldukça zahmetsizdi. Meraklı, NixOS işletim sistemi ile hem eski Volta mimarisine (Tesla V100) hem de daha yeni Ada mimarisini destekleyen Nvidia sürücülerini entegre ederek bir çözüm üretti.
Sonuç olarak, kişisel bilgisayarında RTX 4080'in sağladığı 16 GB VRAM ve Tesla V100'un eklediği 16 GB VRAM gibi iki farklı belleğin gücünü birleştiren bu hibrit yapı; saniyede 32 token hızında çalışan, 32 milyar parametreli yerel dil modellerini çalıştırabiliyor. Bu performansı kullanıcılar kendi cihazlarında elde edebiliyor ve mevcut bulut servislerindeki çoğu ticari API alternatifine kıyasla çok daha hızlı bir etkileşim deneyimi sunuyor.