Ara

Yapay Zeka Modellerinin Bellek Sıkıntısına Yeni Çözüm: HBF, HBM’nin Yükünü Hafifletecek

Yapay zeka modellerinin bellek ve HBM (Yüksek Bant Genişlikli Bellek) kullanımı konusundaki darboğazın, SanDisk'in SK hynix ile birlikte geliştirdiği Yüksek Bant Genişlikli Flash (HBF) teknolojisi sayesinde önemli ölçüde azalması bekleniyor. Bu gelişme, HBM'nin şu anda tek başına üstlendiği görevlerin bir kısmının HBF'ye kaydırılmasına yol açacak.

HBF, HBM4'ten Kat Kat Yüksek Okuma Bant Genişliği Sunarken Yazma Dayanıklılığı Konusunda Sınırlı Kalıyor

HBF standardını daha yakından incelemeden önce, HBM ile sıkça karşılaşılan bellek duvarı sorununa değinelim.

HBM ve Bellek Duvarı Sorunu

100 milyar parametreye sahip ve fp16 hesaplama seviyesinde çalışan bir yapay zeka modeli (her parametre için 2 bayt anlamına gelir), yalnızca model ağırlıklarını depolamak için 200 GB HBM'ye ihtiyaç duyar (100 x 10⁹ x 2).

Bilgilendirme amacıyla, ağırlıklar bir modele, belirli bir kavram veya kelime dizisine ne kadar önem vermesi gerektiğini belirten bilgilerdir. Temel olarak, bir modelin depolanmış bilgisinin tamamını oluştururlar. Genel bir kural olarak, model ne kadar büyükse, o kadar çok ağırlığı depolaması gerekir.

Ancak bu kadarla sınırlı değil. Bir senaryo düşünün: Harika bir kısa süreli bellekle engellenmiş bir hikaye yazıyorsunuz. Yeni bir kelime yazdığınızda, şimdiye kadar yazdıklarınızı okumak zorunda kalıyorsunuz, çünkü ne yazdığınızı hatırlamanız gerekiyor. Açıkçası, metin uzunluğu arttıkça bu zahmetli işlem de artar.

Anahtar-Değer (KV) önbelleği, notları ayrı bir yaprakta tutmak gibidir, böylece şimdiye kadar ne yazıldığından haberdar olursunuz. Bu, tüm süreci kat kat hızlandırır. Buna rağmen, bağlam arttıkça KV önbelleği de artar ve genellikle bir modelin ne kadar hızlı ve sık erişmesi gerektiği göz önüne alındığında HBM içinde depolanır.

Şimdi zor kısım geliyor. HBM4 yığınları GPU'nun yanına lehimlenir ve sınırlı bellek bant genişliği ile donatılır. Örneğin, standart bir 12 katmanlı HBM4 yığını 36 GB veri tutarken, 16 katmanlı eşdeğeri bunu 48 GB'a çıkarabilir.

Dolayısıyla, HBM yalnızca model ağırlıklarını değil, aynı zamanda KV önbelleğini de depolar. Ve HBM'yi artırmak için genellikle GPU sayısını artırmanız gerekir ki bu da çok hızlı bir şekilde maliyetli hale gelebilir.

Şimdi Bu Denkleme HBF'yi Ekleyin

Daha önce de belirttiğimiz gibi, SanDisk, SK hynix ile birlikte bir HBF standardı geliştiriyor. Bu standart, 512 GB depolama ve 0.4 TB/s ile 3 TB/s arasında bir bant genişliği sunuyor.

Temel olarak, HBM'nin DRAM'i yığması gibi, HBF de NAND yongalarını üst üste yığar. Yongaları birbirine bağlayan Silikon Üzerinden İletkenler (TSV'ler) ve bu NAND dizisine bağlı bir denetleyici mantık yongası bulunur.

Ancak, NAND hücrelerini kullanmanın sorunu kaplumbağa hızındaki işlem yetenekleridir. Bir SRAM yaklaşık bir nanosaniyelik okuma hızları sunarken, DRAM için bu süre yaklaşık 100 nanosaniye ve NAND için tam 100 mikrosaniyedir. Bu, NAND'ın DRAM tabanlı bir HBM'den 1.000 kat daha yavaş okuma hızları sunduğu anlamına gelir.

HBF ise, bant genişliğini kat kat artırmak için paralellik gücünden yararlanır. Temel olarak, mantık yongası binlerce paralel NAND hücresi okumasını aynı anda zamanlar. Dolayısıyla, belirli bir NAND hücresinin her bir bireysel okuması yaklaşık 1.000 kat daha yavaş olsa da, binlerce paralel okuma, standart JEDEC HBM4 için sadece yaklaşık 6.4 GB/s'ye kıyasla 0.3 TB/s ila 3 TB/s arasında kümülatif bir bant genişliği sağlayabilir.

Buna rağmen, HBF, NAND'ın korkunç yazma hızlarına ve beraberindeki hassas yazma dayanıklılığına karşı koyamaz. Bu, KV önbelleğinin hala HBM üzerinde saklanması gerekeceği anlamına gelir, çünkü sık yazma işlemleri gerektirir. Ancak, model ağırlıkları HBF'ye kaydırılabilir.

Son olarak, HBF dizilerinin SSD seviyesinde ucuz olmasının beklenmediğini unutmamak gerekir, özellikle de hala gelişmiş paketleme gerektirdiğinden ve bu da maliyetli bir süreçtir. Buna rağmen, HBM'den oldukça daha ucuz olabilirler, bu da önemli ölçek ekonomilerinin kilidini açmalıdır. Ayrıca, HBM'yi KV önbelleği için serbest bırakmak, model bağlamının temel çıktı doğruluğundan ödün vermeden daha uzun olabileceği anlamına gelir, bu da bu gelişen paradigmaya başka bir önemli fayda ekler.

Önceki Haber
SpaceX'in Yapay Zeka Gücü NVIDIA'dan: 2027'ye Kadar 10 GW Kapasite Hedefi
Sıradaki Haber
Elon Musk'tan Devrim Niteliğinde Hamle: Starlink Uyduları Mobil İstasyonlara Dönüşüyor!

Benzer Haberler: