Özel verilerinizin güvenliğini en üst düzeyde sağlamak istiyorsanız, güçlü bir açık kaynaklı modeli kendi sisteminizde barındırmak hala en iyi yol. Optimize edilmiş kurulumlar, nispeten büyük modeller için bile eşsiz bir verimlilik sunuyor. Nitekim, 552 milyar parametreli DeepSeek V4.1-Flash modeli, 4 adet NVIDIA DGX Spark ünitesinden oluşan bir ev kurulumunda benzeri görülmemiş bir çıkarım hızı elde etti.
4 Node'luk NVIDIA DGX Spark Kümesi, Optik Yönlendirici veya Ethernet Anahtarı Olmadan Saniyede Yaklaşık 500 Token Üretebildi
AMD'nin deneyimli teknoloji uzmanı Patrick Moorhead, yakın zamanda kendi yapay zeka ev kurulumunu duyurdu. Bu kurulum, toplu olarak yaklaşık 512 GB birleşik bellek sunan 4 adet NVIDIA DGX Spark ünitesinden oluşuyor ve kompakt bir "tec MOJO" rafına yerleştirilmiş durumda. Ünitelerin altında ek soğutma fanları da bulunuyor.
Bilgi sahibi olmayanlar için, burada kullanılan her bir NVIDIA DGX Spark sistemi şunları içeriyor:
- 20 çekirdekli Arm CPU (10 yüksek performanslı Cortex-X925 çekirdeği + 10 verimli Cortex-A725 çekirdeği; her çekirdek özel L2 önbelleğe ve küme başına 16 MB L3 önbelleğe sahip, yani toplamda 32 MB).
- Beşinci nesil Tensor Çekirdekleri, DLSS 4 desteği ve RTX Ray Tracing çekirdekleri içeren GB10 iGPU; yapay zeka iş yükleri için 31 TFLOPs FP32 ve 1000 TOPS NVFP4 (FP4) hesaplama gücü sunuyor.
- CPU ve GPU arasında paylaşılan 128 GB eşzamanlı birleşik LPDDR5X sistem belleği, yaklaşık 273 GB/s bant genişliği ile (256-bit bellek arayüzü).
- Yüksek hızlı kümeleme için çift 200 Gb/s QSFP bağlantı noktasına sahip ConnectX-7 SmartNIC; ayrıca 10 GbE, Wi-Fi 7, Bluetooth, HDMI 2.1a ve birden fazla USB-C bağlantı noktası bulunuyor.
- Tipik olarak 1-4 TB NVMe SSD depolama.
- Birlikte verilen adaptör ile yaklaşık 140-240 W güç tüketimi.
- Tam CUDA yapay zeka yazılım yığınına sahip NVIDIA DGX OS (Ubuntu tabanlı).
Burada dikkat çekilmesi gereken önemli bir nokta, dört NVIDIA DGX Spark ünitesinin QSFP kabloları aracılığıyla anahtarsız halka topolojisi kullanılarak birbirine bağlanmış olmasıdır:
- Spark 1, Spark 2 ve Spark 4'e bağlı.
- Spark 2, Spark 1 ve Spark 3'e bağlı.
- Spark 3, Spark 2 ve Spark 4'e bağlı.
- Spark 4, Spark 3 ve Spark 1'e bağlı.
NVIDIA'nın 4 adet DGX Spark ünitesini birbirine bağlamak için 200 GbE anahtar (yıldız topolojisi) kullanmasını önerdiğini belirtmek gerekir. Elbette anahtar, kurulumun genel maliyetini artıracaktır.
Bu arada, akıllı bir karar olarak Moorhead, oldukça verimli olan DeepSeek V4.1-Flash modelini 4 adet NVIDIA DGX Spark ünitesinden oluşan rafında barındırmayı tercih etti. Bu model, 552 milyar parametreye sahip olup, ön dolum aşamasında sadece 8 milyar, kod çözme aşamasında ise 16 milyar aktif parametre kullanıyor. Ek olarak, modelde 1 paylaşımlı ve 384 yönlendirilmiş uzman (6 aktif) bulunuyor. DeepSeek'in en son modeli, toplam KV önbelleğini token başına sadece 890 bayta indiren Causal Encoder-Decoder (CED), Compressed Sparse Attention 2 (CSA2), FP4 Kuantizasyon ve SWA Bounded Replay gibi çeşitli mimari unsurları içeriyor.
Bu 4 adet NVIDIA DGX Spark ünitesi kurulumu ile DeepSeek V4.1-Flash modelinin bu eşleşmesiyle elde edilen sonuçlar şunlardır:
- Tepe çıktı: 494 token/s (kod, 32 eşzamanlı istek).
- Düz yazı tepe çıktı: 280 token/s (32 eşzamanlı istek).
- Tek istek: Yaklaşık 58 token/s düz yazı, yaklaşık 96 token/s kod.
- İstem işleme: Yaklaşık 4.764 token/s.
- İlk token: Yaklaşık 0.2 s (boşta).
- Bellek kullanımı: 476 GB.
Bu kurulumun maliyetine gelince, her 128 GB NVIDIA DGX Spark ünitesi, depolama kapasitesine ve bulunabilirliğe bağlı olarak şu anda 5.500 ila 9.000 dolar arasında satılıyor. Dolayısıyla, kurulumun maliyeti şunları içeriyor:
- Dört adet 128 GB ünite, tipik olarak 22.000-36.000 dolar.
- Halka bağlantı için QSFP doğrudan takılabilen kablolar: birkaç yüz dolar.
- Raf/raf, ek fanlar, güç dağıtımı ve çeşitli aksesuarlar: birkaç yüz dolar daha.
Bu, kurulumun toplam maliyetinin 25.000 ila 40.000 dolar arasında olacağı anlamına geliyor. Oldukça pahalı olsa da, bu kurulumu 24/7 çalıştırabilir, yalnızca minimum elektrik ücreti ödeyebilirsiniz (her ünite yük altında yaklaşık 400-600 W tüketiyor) ve OpenAI veya Anthropic gibi hizmetlerden alınan aboneliklerdeki API maliyetleri ve yük sınırlamalarıyla uğraşmak zorunda kalmazsınız.