Ara

Evde Yapay Zeka Deneyleri İçin Güçlü Çözüm: Dell Pro Max GB10 ile Yerel Yapay Zeka Kümesi Kurulumu

Yerel yapay zeka (AI) testlerimiz, özellikle büyük dil modellerinin (LLM) Nvidia GB10 ve AMD Strix Halo sistemlerindeki 128GB birleşik belleğe tam olarak sığması üzerine yoğunlaştı. Bu küçük açık modeller ne kadar faydalı olsa da, bazen yer değiştirmenin yerini tutamaz. Bugün, iki adet Nvidia GB10 sistemini birbirine bağlayarak oluşturduğumuz yerel bir AI kümesinin neler sunabileceğini inceliyoruz: Dell Pro Max GB10 (bundan sonra Pro Max olarak anılacaktır). Bu kurulum, bize yerel bir AI deneme alanı için toplam 256GB bellek sunuyor.

Bir AI modelini daha yüksek hassasiyetten daha düşük hassasiyete dönüştürmek, performans ve doğruluk arasında ödünleşmeler gerektirir. Hatta dönüştürülmüş halleriyle bile, bazı gelişmiş açık modeller hala 128GB'a sığamayacak kadar büyüktür. Ancak bu modeller, veri merkezlerinde olduğu gibi, ölçeklenebilir bir omurga olarak ağ kullanılarak birden fazla yerel sisteme dağıtılabilir.

Neden GB10 sistemlerini (veya Strix Halos, veya Mac'leri) ölçeklendirelim? Tek tek GPU'lardan oluşan büyük VRAM havuzlarına sahip yerel token fabrikaları inanılmaz derecede güçlü olabilir. Birini 128GB VRAM'e kadar ölçeklendirmek, bu kartları besleyecek yeterli PCI Express yuvasına ve bant genişliğine sahip maliyetli bir ana sistem gerektirir ve 128GB'ın ötesine geçmek, en eski 48GB Ada kartlarından başlasanız bile, en az 20.000 ABD doları değerinde Nvidia GPU yatırımı anlamına gelir.

Bu tür bir kurulum için tercih edilen yapılandırma genellikle bir Threadripper Pro veya Epyc platformunu içerir. Bu da grafik kartlarını eklemeden önce bile pahalı bir CPU, anakart ve DDR5 kit anlamına gelir. Böyle bir sistemin güç gereksinimleri, standart bir 15A prizin (maksimum 1.800W) kapasitesini hızla aşabilir.

Ve dört adet tekil GPU'nun yük altında yüksek hızlarda çalışan fanlarının yanı sıra, aslında bir GPU sunucusu olan bu sistem için gereken diğer aktif soğutma çözümleri, eğer aynı alanı paylaşıyorsanız, pek hoş bir arkadaş olmayacaktır.

Dört adet RTX Pro 5000 veya RTX Pro 6000 kartına sahip bir GPU sunucusu, belirli bir uygulama için mutlak en iyi performansı elde etmek için kullanışlı olsa da, potansiyel olarak yüksek maliyetler, platform zorlukları ve yaşam kalitesi endişeleri, yerel AI meraklılarını, bugün inşa ettiğimiz GB10 kümesi gibi, kabul edilebilir LLM çıkarım performansı ile büyük yerel bellek havuzlarına ulaşmanın başka yollarını keşfetmeye yöneltmiştir.

Nvidia, DGX Spark ve onun Spark benzeri sistemlerini, yerleşik ConnectX 7 200Gbps NIC'leri sayesinde kutudan çıktığı gibi ölçeklenebilir ve kümelenebilir sistemler olarak tasarladı. Bu üst düzey arayüzler, Converged Ethernet üzerinden Uzaktan Doğrudan Bellek Erişimi (RoCE) desteği sunar, bu da iki (veya daha fazla) GB10 kutusunun dağıtık bir AI bilgi işlem kümesi için omurga olarak kullanılabilmesini sağlar.

İlk incelememiz sırasında RDMA kümesini test etmek için birden fazla Spark sistemimiz yoktu, ancak Dell, bu sistemleri birbirine bağlamak için gereken QSFP kablolarıyla birlikte bir çift Pro Max GB10 sistemi gönderdi.

Bu sistemler hala ucuz değil, ancak bu yazının yazıldığı tarihte test edilen 4TB SSD'li yapılandırmayla her biri 6.332 ABD doları olmak üzere, benzer bir GPU sunucusu oluşturmak için gereken dört adet 48GB veya 72GB GPU'nun maliyetinden daha azıyla, tam bir, kullanıma hazır, 256GB RAM'e sahip bir küme oluşturabilirsiniz.

Eğer para tasarrufu yapmanız gerekiyorsa ve karşılığında mutlak performanstan ödün verebiliyorsanız, büyük yerel modellerle uğraşmak için şu anda daha ucuz bir yol yok, özellikle de DGX Spark platformunun sunduğu ağ performansı seviyesiyle.

Dell’in GB10 ile Pro Max’i, Spark şablonunu yakından takip ediyor, ancak DGX Spark'ın sahip olmadığı son derece kullanışlı bir ön panel güç LED'i ekliyor ve ön ve arka panellerdeki altıgen ızgaralar, DGX Spark'ın metal köpük ön ve arka panelleri gibi kıyafetlere veya mikrofiber bezlere takılmıyor.

Dell ayrıca her Pro Max GB10 sistemiyle birlikte büyük bir 280W USB-C güç adaptörü sağlıyor. Bu, referans DGX Spark ile birlikte gelen adaptörden 40W daha fazla kapasiteye sahip. Ancak, bunun bir sonucu olarak bu sistemin referans Spark tasarımından daha yüksek bir TDP'ye veya saat hızlarına sahip olduğuna dair bir gösterge yok.

Dell, Pro Max GB10'u başlangıçtaki DGX Spark'ın Gen 5 sürücüsüne kıyasla bir PCIe Gen 4 SSD'ye indirmiş, ancak devam eden NAND kıtlığının Nvidia'yı maliyetleri düşürmek için Gen 4 sürücüleri tedarik etmeye zorladığı görülüyor, bu nedenle bu kararı Dell'e karşı tutmuyoruz.

Kurulum

DGX Spark referans tasarımını kendi incelemesinde zaten ele aldık, bu nedenle bu platformun temellerine aşina değilseniz, önce bu incelemeyi okumanızı öneririz. Bugün odağımızı bu iki sistemi kümelemenin özel zorlukları ve engelleri üzerine odaklayacağız.

Bu sistemlerdeki ConnectX 7 NIC, eklenti kartı formunda hem Infiniband hem de Ethernet protokollerini desteklese de, Nvidia resmi DGX Spark forumlarında GB10 sistemlerinin yalnızca Ethernet'i ve dolayısıyla kümeleme için RoCE'yi desteklediğini belirtmiştir. Elinizde bulunan Infiniband anahtarları üzerinden onları bağlama umuduyla bu sistemlerden birden fazla satın almayın.

Spark ve Dell Pro Max gibi Spark benzeri sistemlerdeki ConnectX 7 NIC, bazı olası platform sınırlamaları nedeniyle GB10 SoC'ye biraz tuhaf bir şekilde bağlıdır. Kısacası, GB10'dan elde edilebilecek en geniş PCIe veri yolu genişliğinin PCIe 5.0 x4 bağlantısı olduğu görülüyor, bu nedenle 200Gbps'yi herhangi bir QSFP bağlantı noktasında elde etmek için, ConnectX 7'ye giden iki x4 bağlantısının herhangi bir fiziksel bağlantının arkasında gruplandırılması gerekiyor. Sonuç olarak, NIC'deki her fiziksel bağlantı, sistem tarafından iki mantıksal arayüz olarak sunulur.

ConnectX 7'den gelen tam 200Gbps bant genişliğini elde etmek için ağ topolojinizi dikkatlice yapılandırmanız gerekir. Nvidia'nın bunu nasıl yapacağına dair bir Spark kılavuzu bulunmaktadır ve spark-vllm-docker projesi de bu arayüzlerin nasıl ayarlanacağına dair kendi rehberini sunmaktadır. Kendi yapılandırmanızı oluşturmak için iyi bir nedeniniz olmadıkça, bunları yakından takip etmenizi öneririm.

Dell Pro Max kutularımı arka panellerindeki aynı QSFP kafeslerini kullanarak birbirine bağladıktan, ağ arayüzlerini yukarıdaki spark-vllm-docker rehberine göre yapılandırdıktan, ikinci düğümümde şifresiz SSH'yi yapılandırdıktan ve bağlantı üzerinde önerilen NCCL bant genişliği testini çalıştırdıktan sonra, her iki kutunun da DGX Dashboard uygulaması aracılığıyla tamamen güncel olduğunu bildirmesine rağmen, beklenen RDMA bant genişliğinin yalnızca küçük bir kısmını aldığımı fark ettim.

Topluluk bilgeliği, bir firmware sürüm uyumsuzluğunun suçlu olduğunu öne sürdü, bu nedenle kümemdeki ana Pro Max düğümünün hem DGX Dashboard uygulaması aracılığıyla hem de apt paket yöneticisini kullanarak komut satırı aracılığıyla tamamen güncel olduğunu doğruladım.

DGX Dashboard, ikinci Pro Max sistemimin tamamen güncel olduğunu bildirmesine rağmen, önerilen komut satırı apt denetimlerini çalıştırmak, bir aşamalı çitin arkasında takılı kalmış bir fwupd paketi güncellemesi olduğunu ortaya çıkardı, bu yüzden onu zorla yükledim.

Bu zorunlu güncelleme tamamlandıktan sonra, ikinci Pro Max için yeni bir dizi firmware güncellemesinin kilidini açtı ve bunları usulüne uygun olarak uyguladım. Her iki sistemi yeniden başlattıktan ve önerilen NCCL bant genişliği testlerini yeniden çalıştırdıktan sonra, nihayet düzgün bir 200Gbps bağlantıdan beklenen tam 25GB/s'ye yaklaşan bir değer alıyordum.

Pro Max GB10 sistemlerimi kümeleme konusunda yaşadığım sorunların hiçbiri gösteriyi durduran türden olmasa da, tak ve çalıştır bir deneyimden de çok uzak. Ancak her iki sistem de yerleştikten sonra, kümenin birden fazla yeniden başlatılmasına rağmen, ilk gözlemlediğim düşüş performans seviyelerine geri dönen ConnectX 7 portları üzerindeki bant genişliğini görmedim.

Küme Yönetimi ve Performans

Spark'ları kümelemeyi düşünüyorsanız, tensör paralelliğini, yani hesaplama sırasında model ağırlıklarının GPU'lara dağıtımını işleyebilen bir çıkarım motoruna ihtiyacınız vardır. vLLM, spark-vllm-docker ve sparkrun gibi aktif olarak korunan topluluk araçları sayesinde DGX Spark platformunda bunu yapmak için kolay bir seçenektir, ancak tercih ettiğiniz platform SGLang ise bu sonuçları elde edebilirsiniz.

spark-vllm-docker projesi, kümeyi başlatmayı ve modelleri üzerinde dağıtmayı kolaylaştıran birkaç kullanışlı betik içerir ve sparkrun projesi benzer işlevsellik sunar. Bu test turu için spark-vllm-docker'a odaklandık, ancak keşfetmek isterseniz bu alanda seçenekleriniz var.

Çıkarım motorumuzu belirledikten sonra, kümemizden elde edilebilen 256GB VRAM'in önemli bir bölümünü kullanacak gelişmiş bir model aramaya koyulduk.

DeepSeek v4 Flash, böyle bir modeldir. Bu, 18 milyar aktif parametreye sahip 284 milyar parametreli bir uzmanlar karışımı modelidir ve 1 milyon tokene kadar bir bağlam penceresini desteklediğini iddia eder (vLLM bu kurulumda bize 400K token sınırı verdi). spark-vllm-docker bunun için önceden hazırlanmış bir vLLM tarifi sunar, bu yüzden onu indirdik, kümemize dağıttık ve kıyaslamaya başladık.

Kullandığımız DeepSeek v4 Flash vLLM tarifi, bu modelin yerleşik çoklu token tahmin yeteneklerinden yararlanır, bu nedenle bağlam uzunlukları 200K+ token'a (yaklaşık 333 sayfa A4 metin) kadar çıksa bile kod çözme verimi temelde aynı kalır. Bu, bu büyüklükteki ve yetenekteki bir model için etkileyici ve kullanılabilir bir performanstır.

Ayrıca CyanKiwi'nin MiniMax M2.7'sinin dört bitlik kuantizasyonunu da yükledik. Bu, 230 milyar toplam parametreye ve 10 milyar aktif parametreye sahip başka bir büyük uzmanlar karışımı modeldir ve 200K tokene kadar bir bağlam penceresini destekler, ki bu da vLLM'nin Spark kümemizde başlatıldıktan sonra bize verdiği tam değerdir.

Bu modelin DeepSeek v4'ün yerleşik MTP avantajı yoktur, bu nedenle bu test için kullandığımız dört bitlik kuantizasyonla bile, ilk token'e kadar geçen süre ve saniye başına token verimliliği daha tanıdık bir eğriyi takip eder. Verimlilik, nispeten kullanılabilir bir aralıkta başlar, ancak bağlam penceresinin sınırlarına yaklaştıkça hızla düşer.

DeepSeek v4 Flash ve MiniMax 2.7'yi çalıştırma deneyimimiz, bir Spark kümesinin hızlı olmasa da, bu zorlu modellerle hala saniyede yeterli token üreterek kullanışlı bir deneme alanı olabileceğini göstermektedir.

Güç ve Termal Notlar

Girişte tartıştığımız gibi, böyle bir kümenin temel avantajlarından biri, egzotik güç ve soğutma gerektirmemesi ve sessiz tutmak için onu bir garaja veya sunucu odasına hapsetmek zorunda kalmamanızdır.

Çıkarım performansı testleri sırasında kümem boyunca yaklaşık 375W ila 415W arasında bir tepe duvar gücü çekişi ölçtüm; bu, tek bir RTX 5080'in ana sistemi olmadan TGP'sinden biraz daha yüksektir.

Bu rakam, eğer gerekirse yerel bir kümeye daha fazla Spark benzeri sistem eklemek için iyiye işaret ediyor, çünkü dördünün tamamı tam güçte çalışsa bile, bir devreden 1kW'tan daha az güç gerekecektir (en azından herhangi bir harici ağ ekipmanı dikkate alınmadan önce).

Çift Dell Pro Max kurulumumun yük altındaki gürültü seviyeleri de iyi kontrol altındaydı; 18 inç mesafeden yaklaşık 40 dBA ölçüldü. Bu sistemleri dolu bir ofis alanında veya kübide tutmanız gerekirse, etraflarında bulunmaları tamamen tolere edilebilir olacaktır.

Eğer iki GB10 sisteminin ötesine geçiyorsanız, muhtemelen eklemeniz gerekecek 200G/400G ağ ekipmanlarının, muhtemelen sürekli dolu bir alan için değil, bir sunucu odası için üretilmiş olmaları nedeniyle, yük altındaki dört sistemden bile çok daha gürültülü olacağını tahmin ediyorum.

Sonuç

Eğer yerel LLM öncüsüyseniz ve büyük, yetenekli modeller için daha fazla VRAM'e ihtiyacınız varsa, 128GB'ın üzerinde belleğe sahip sıfırdan bir GPU sunucusu oluşturmak için uğraşmak istemiyor veya yeterli bütçeniz yoksa, burada oluşturduğumuz Dell Pro Max GB10 kümesi, Nvidia GB10 sistemlerini kümelemenin nasıl 128GB VRAM'in ötesine ölçeklendirme için düz, yerden tasarruflu, düşük güç tüketimli, sessiz ve nispeten uygun maliyetli bir yol olduğunu örneklendiriyor.

Buradaki "nispeten" kelimesi oldukça fazla iş yapıyor çünkü test edildiği gibi bir çift Dell Pro Max GB10 kutusu şu anda 12.664 ABD dolarına mal oluyor, artı onları bağlamak için ihtiyacınız olacak QSFP kablosu için ek 50 dolar. Departman bütçeleri olan ve satın alma siparişi verecek önerilerin yatırım getirisi (ROI) muhtemelen ikincil öncelikte olan kuruluşlar veya kurumlar için bu dolar rakamı muhtemelen ikincildir.

Ancak yalnızca ev laboratuvarlarında daha büyük bir AI deneme alanı oluşturmak isteyen ve bu ilişkilere dikkat etmek zorunda olmayan bireyler için, mevcut fiyatlarla bile, stoktan Asus'un Ascent GX10'u ile benzer bir küme oluşturmak 10.000 ABD dolarının altında hala mümkün. Ve girişte açıkladığımız gibi, birden fazla tekil GPU kullanarak 128GB'ın üzerindeki yerel belleğe geçmek, bir ana sistemin maliyetini hesaba katmadan bile, böyle bir kümeden çok daha pahalıya mal olacaktır.

Elbette herkesin birden fazla Spark bağlamasına ihtiyacı yok, ancak bu olasılık sizi ilgilendiriyorsa, her GB10 kutusundaki ConnectX 7 NIC, bu sınıftaki ağ performansı arkasındaki 256GB (veya daha büyük) dağıtılmış bellek havuzunu elde etmek için daha ucuz bir yolun olmadığını anlamına gelir.

Bazı AMD Strix Halo mini-PC'ler genişletme için PCIe yuvaları sunsa da, PCIe 4.0 x4 hızlarıyla sınırlıdırlar, bu nedenle GB10 kutularındaki tuhaf gruplandırılmış PCIe 5.0 x4 bağlantıları bile, bir Strix Halo sistemine sonradan takılan bir NIC'den çok daha yüksek potansiyel RDMA bant genişliği elde ettiğiniz anlamına gelir.

Apple'ın Mac Studio'su, Apple Silicon'dan gelen devasa bellek havuzları ve yüksek bant genişliği ile Thunderbolt 5 üzerinden RDMA sayesinde yerel AI için kümelenebilir bir alternatif olarak kısa süreliğine spot ışığında olsa da, şirket artık M4 Max Studio'larla 64GB veya M3 Ultra modelleriyle 96GB'ın üzerinde bellek seçenekleri sunmadığı için bu yıldız solmuştur. Ve bu sistemlerden herhangi birinin teslimat süreleri şu anda üç aydan fazladır; bu da hızla gelişen yerel AI pazarında bir çağ gibidir.

Yani Nvidia şu anda bu alanı neredeyse kendi başına tutuyor, çünkü GB10 kutuları hala stoktan 128GB RAM ile ve tamamen çılgınca olmayan fiyatlarla kolayca bulunabiliyor. Ve dağıtık bilgi işlem kavramlarına yeni başlayan biriyseniz, GB10 sistemleri etrafındaki aktif topluluk, aktif olarak geliştirilen araçlar ve ekosistem yazılım desteği, AI kümenizi hızlı bir şekilde çalıştırmak için çok değerlidir. Tüm bunlar, Dell'in Pro Max GB10'unu (ve diğer Spark benzerlerini) denemek için büyük bir yerel AI deneme alanı oluşturmak için yenilmesi zor hale getiriyor.

Önceki Haber
Nvidia'dan Kritik Hamle: Grace Sunucuları Yüz Binleri Buldu, Odak CPU'lara Kayıyor!
Sıradaki Haber
AMD'den NVIDIA'ya Cesur Hamle: Helios, Rubin'den %40 Daha Pahalı Olacak

Benzer Haberler: