Son dönemde yerel yapay zekâ (AI) çözümlerini konuşurken akla genellikle pahalı bilgisayar sistemleri veya kurumsal sunucular geliyor. Ancak yakın zamanda ortaya çıkan bir çalışma, bu algıyı kökten değiştirerek yapay zekânın artık piyasanın en uygun fiyatlı bileşenleriyle bile çalışabildiğini kanıtladı.
Bu çığır açan projenin ardında, Slava S olarak bilinen Ukraynalı bir geliştirici duruyor. Geliştirilen ESP32-AI adlı bu proje ile 28.9 milyon parametreli dil modelinin tamamen cihaza entegre edilmiş ve yerel çalıştığı beyan edildi. Bu devasa bir başarı; zira modern büyük dil modellerini (LLM) geleneksel olarak çalıştırmak için gigabayttayasa RAM kapasitesine sahip, çok pahalı sunucu donanımları şarttı.
Mikro İşlemciyle Yapılan Dev Bir Kanıt
Mevcut bir akıllı telefonun kamerasından çekilmiş tek ham fotoğraftaki depolama alanından daha az belleğe sahip bileşenler dahi, eskiden çok basit görevleri yerine getirebiliyordu. Örneğin, ESP32-S3 çipi sadece 512 kilobayt (KB) gibi sınırlı bir hızlı erişim hafızasına ve toplamda ancak 8 megabayttan (MB) biraz daha fazla kalıcı depolama alanına sahipti. Normal şartlarda, yaklaşık 29 milyon parametreli bu boyutta bir modeli böyle kısıtlı bellek kapasitesine sığdırmak neredeyse imkânsız görünüyordu.
LLM'lerin işleyişi gereği işlemcinin her parametre üzerinde sürekli matematiksel hesaplama yapması gerekir. Bu, modelin tamamının hızlı bellekte bulunmasını zorunlu kılan kritik bir darboğazdır. Geçmişte bu tür düşük güç tüketen yongalar için kaydedilen rekor çok daha düşü seviyedeydi.
Google'ın Sırrı Çıktı
Slava S, işte tam bu bellek sorununun üzerine yürümek için bir zekâ örneği sergiledi. Çalışmasında yapay zeka dünyasının devlerinden Google'dan ilham aldı. Özellikle Google'ın Gemma gibi modellerinde kullanılan ve 'Katman Başına Gömme' (Per-Layer Embeddings) adı verilen mimari bir tekniği benimsedi.
Bu yöntem, modelin parametrelerini 4 bitlik veri formatına küçülterek toplam dosya boyutunu sadece 14.9 megabayta indirdi. Daha da önemlisi, modeldeki yaklaşık 25 milyonluk gömme tablosunu yavaş çalışan ancak daha büyük olan 16 MB'lık flaş belleğe taşıdı. Hızlı RAM (SRAM) ise yalnızca modelin esas mantığını ve akıl yürütme çekirdeğini barındıran kısım için serbest bırakıldı.
Mekanizma şudur: bu spesifik mimari, her yeni kelime üretmek için bellek tablosundan sadece birkaç satırı okumaya ihtiyaç duyuyor. Bu sayede yavaş olan flaş belleğin işlemciyi tıkayacağı korkusu ortadan kalktı ve cihazın kısıtlı 512 KB hızlı hafızası tamamen ana işine odaklanabildi.
Kapsam ve Uygulama Alanları
Bu tür bir başarı, donanımsal olarak son derece büyük modellerin bile düşük kaynaklara sahip gömülü bilgisayarlar üzerinde çalışabileceğinin somut kanıtıdır. Ancak bu modelin neyle çalıştığını göz ardı etmek doğru olmaz. Slava S'nin kullandığı yapı TinyStories veri setiyle eğitilmiş bir Küçük Dil Modeli (SLM). Bu, genel amaçlı bir yapay zekâ gibi sohbet edebilecek veya karmaşık kod yazabilecek bir beyin değildir.
Mevcut haliyle model; gerçek dünya hakkında hiçbir bilimsel bilgiye sahip değildir. Ancak bu sınırlaması aksine kullanım alanlarını işaret ediyor: örneğin sadece kahve çekirdekleri, öğütme oranları ve su sıcaklığı gibi kahve bilgisine odaklanmış bir ‘akıllı makine’ tasarlamak.