Ara

Rubin GPU’lar Tanıtıldı: Yapay Zeka Performansında 10 Kat Artış ve Detaylı Mimari Açıklaması!

NVIDIA, yapay zeka alanında çığır açacak Rubin GPU mimarisini tüm detaylarıyla tanıttı. Yeni nesil Rubin GPU'lar, yapay zeka iş yüklerinde önceki nesil Blackwell'e kıyasla inanılmaz bir performans artışı vaat ediyor.

NVIDIA Rubin GPU'larla Veri Merkezlerini Yeniden Şekillendiriyor, Dünyanın En Hızlı Yapay Zeka Performansını Sunuyor

Rubin GPU, NVIDIA'nın yeni nesil veri merkezi platformlarının temelini oluşturuyor. Yıllarca süren geliştirme sürecinin ardından genel kullanıma sunulan bu yonga, globaldeki büyük teknoloji firmalarına ulaşmaya başladı. Yapay zeka ekosistemini şekillendirecek bu süper güçlü yonganın arkasındaki mimariyi NVIDIA nihayet tüm detaylarıyla paylaştı.

NVIDIA'ya göre, Rubin yongası enerji birimi başına Blackwell'e kıyasla 10 kat daha yüksek yapay zeka işlem kapasitesi sunuyor. Bu başarı, üç ana mimari değişiklikle elde ediliyor:

  • Gelişmiş Tensör Çekirdekleri ve Genişletilmiş Hassasiyet Yetenekleri
  • Yeni HBM4 Bellek Alt Sistemi
  • 3. Nesil Transformer Motoru

Şimdi bu heyecan verici mimarinin detaylarına göz atalım.

Rubin Mimarisi Detaylı İnceleniyor: Milyarlarca Transistörlük Bir Canavar

NVIDIA'nın Rubin yongası, TSMC'nin 3nm (N3P) işlem düğümünde üretiliyor ve yüksek yoğunluk ile verimlilik özellikleri sunan iki reticle-limitli yonga içeriyor. Bu iki yonga, NVIDIA'nın Yüksek Bant Genişliği Arayüzü (NV-HBI) aracılığıyla tek bir birleşik pakette birbirine bağlanıyor. Yongada, Blackwell GB300 çipine göre %62'lik bir artışla toplam 336 milyar transistör bulunuyor.

Her bir Rubin GPU'nun içinde, toplam 224 SM (Streaming Multiprocessor) ve 896 Tensör Çekirdeği bulunan 8 GPC (Graphics Processing Cluster) yer alıyor. Her GPC için 28 SM ve 112 Tensör Çekirdeği beklenirken, blok diyagramına göre 30 SM'li ve 26 SM'li olmak üzere iki farklı GPC tipi bulunuyor.

Her yongada dört adet GPC bulunuyor. Bunlar, iki adet büyük merkezi olmayan L2 önbellek bloğuna, bir Gigathread Motoruna, dört adet HBM kanalına (yonga başına 4096-bit) ve bir NVLink arayüzüne bağlı. Yongada ayrıca ana bilgisayar CPU'su ile arayüz oluşturmak için bir PCIe Gen6 denetleyicisi ve NVLink anahtarıyla 3600 GB/s bağlantı sağlayan NVLink v6 IO bulunuyor. MIG denetleyicisi GPU'yu birden fazla iş yükü için bölüyor ve hızlandırılmış kod çözme için NV-DEC de mevcut.

Yonga ayrıca TEE-I/O aracılığıyla Gizli Bilişim (Confidential Computing) özelliği sunarak, yapay zeka iş akışlarında veriyi depolama, iletim ve kullanım sırasında güvence altına alıyor.

Daha Hızlı Veri Hareketi İçin Pazardaki En Hızlı HBM4

Bellek tarafında, NVIDIA Rubin HBM4'ü kullanıyor; bu da en yeni HBM standardı. Günümüz yapay zeka ortamında daha hızlı veri hareketinin kritik önemi artıyor ve Rubin, 288 GB kapasite ile sekiz adet 12-Hi yığın (yığın başına 36 GB, DRAM başına 3 GB) sunarak bu ihtiyaca tam olarak yanıt veriyor. Bu yığınlar, 22 TB/s'lik zirve bant genişliği sağlayarak pazardaki en hızlı HBM4 çözümü unvanını kazanıyor.

NVIDIA ayrıca, karmaşık verileri yonga içinde verimli bir şekilde taşımak için yeni ve geliştirilmiş Tensör Bellek Hızlandırıcısı'nı (TMA) kullanıyor. NVLink 6 ise tüm GPU'lar arası iletişim için 3600 GB/s ölçeklendirme hızı sağlıyor. NVLink-C2C arayüzü CPU-GPU iletişimi için 1800 GB/s, PCIe Gen6 x16 hatları ise ana bilgisayar CPU bağlantısı için 256 GB/s bant genişliği sunuyor.

HBM4 Token Üretimini Hızlandırıyor

Rubin için tasarlanan HBM4 bellek, maksimum güç ve işlem verimliliği sağlayarak daha hızlı kod çözme ve token üretme yeteneklerine olanak tanıyor. Modern iş yüklerinin çoğu, uzun bağlamlar, büyük KV önbellekleri ve etkileşimli token üretimi ile zaman harcadığından, bant genişliği daha da kritik hale geliyor. Blackwell'in bellek çözümüne kıyasla 2.8 kat artışla (22 TB/s'ye karşılık 8 TB/s), HBM4 çözümü şunları sunuyor:

  • Kapasite: Modelin bellekte kalmasını, daha büyük bağlam pencerelerini, daha büyük KV önbelleklerini ve gereksiz KV-önbellek boşaltması olmadan daha yüksek eşzamanlılığı destekler.
  • Bant Genişliği: Model ağırlıklarının ve KV durumunun işlem motorlarını verimli tutacak kadar hızlı hareket etmesi gereken token-token üretim aşamasını destekler.
  • Bellek Alt Sistemi: TMA ve bellek yerelliği stratejileri, yazılımların bellek alt sistemini verimli kullanmasına yardımcı olur ve karmaşık veri düzenleri için yüksek elde edilen bant genişliğini destekler.

HBM4, çok trilyon parametreli modelleri desteklemek, KV önbellek boşaltma zahmeti olmadan bağlam uzunluğunu uzatmak ve çok daha yüksek eşzamanlılık oranlarını ve uzun vadeli çıkarım iş yüklerini desteklemek için esastır.

Gelişmiş Tensör Bellek Hızlandırıcısı ile MoE ve Token'ları Hızlandırma

Rubin ayrıca, MoE modellerinde uzman sayısı arttıkça uzman ağırlıklarını verimli bir şekilde bulup taşıyan geliştirilmiş bir Tensör Bellek Hızlandırıcısı (TMA) ile birlikte geliyor. TMA, gelişmiş tanımlayıcı işleme sayesinde veri taşıma ek yükünü azaltarak yazılımın daha verimli yönlendirme ve çalışma yapmasını sağlıyor. Inline Descriptor, TMA için güncellenmiş destek sunuyor ve çekirdeğin aynı düzene sahip tensörler için tek bir birleşik tanımlayıcı tutmasını ve çalışma zamanında TMA komutundaki bellek işaretçisi ve adım gibi alanları doğrudan geçersiz kılmasını sağlıyor.

Bunun sonucunda, uzman sayısı artsa bile MoE model ölçeklendirmesi daha verimli hale geliyor. Bu da yonganın daha yüksek işlem hacmi için çıkarım hesaplamalarına daha fazla zaman ayırmasını sağlıyor.

Daha Yüksek İşlem Hacmi İçin Daha Hızlı Tensör Çekirdekleri

Gelişmiş Tensör Çekirdekleri, saat döngüsü başına iki kat daha fazla işlem gücü sunmak üzere güçlendirildi. Bu, bir tensör çekirdeğinin K Boyutu boyunca işleyebileceği veri miktarının iki katına çıkarılmasıyla elde ediliyor. Bu, işlem gücü sınırlı çekirdekler ve bellek/gecikme sınırlı çekirdekler için faydalıdır.

Daha büyük bir K boyutunun faydası, daha az K döngüsü tekrarı gerektirmesidir. Örneğin, Blackwell'de dört K tekrarı gerektiren bir GEMM, Rubin yongalarında sadece iki tekrarla tamamlanabilir.

Aktivasyon seyrekliği ile adaptif sıkıştırmanın birleştirilmesiyle dikkat mekanizmasında iyileştirmeler ve softmax işlem gücünde artışlar da bulunuyor. Dikkat pipeline'ı, ara dikkat skorlarını oluşturmak için yoğun bir QK^T hesaplamasıyla başlar.

Rubin, ara veriyi Tensör Bellek'ten yapılandırılmış 2:4 seyrek sıkıştırılmış bir forma yükleyebilir, hem sıfır olmayan değerleri hem de bunları verimli bir şekilde kullanmak için gereken meta verileri üretebilir, aynı zamanda skorların yazma maliyetini ve depolama gereksinimlerini azaltır. Bu, daha sonraki dikkat aşamalarının daha az veri üzerinde çalışırken modelin geri kalanı tarafından beklenen yoğun çıktı formatını korumasını sağlar.

Rubin'in temel Blackwell'e göre üstel işlem gücü yeteneklerinde de bir artış var. Rubin, GB200'e kıyasla SM başına saat başına 2 kat daha fazla FP32 işlem gücü (GB300 ile aynı), BF16/FP16 işlem gücü ise temel Blackwell'e (GB200) kıyasla dört kat ve Blackwell Ultra'ya (GB300) kıyasla iki kat daha fazla işlem gücü sunuyor.

Rubin ayrıca bağımlı çekirdekler arasında daha ince taneli koordinasyona olanak tanır. Bu, tüketici işlerinin, daha büyük bir üretici iş kümesinin tamamlanmasını beklemek yerine, gerekli girdi verileri mevcut olduğunda daha erken başlamasına izin verir.

Sonuç olarak, daha sıkı bir GPU zaman çizelgesi, azaltılmış boşluklar ve bağımlı çekirdekler arasında daha iyi örtüşme elde edilir. Bu, özellikle aktivasyonların model boyunca sıralı olarak hareket ettiği ve çekirdekten çekirdeğe gecikmenin kullanıcı başına saniyedeki token'ları doğrudan etkilediği yapay zeka çıkarımı için değerlidir.

DSX MaxLPS ile Güç Verimliliğinde Artışlar

Günümüz yapay zeka veri merkezleri için kritik bir diğer faktör de güç verimliliği. Vera Rubin NVL72 sistemleri son teknoloji ürünüdür ve sabit bir güç zarfı içinde maksimum token çıktısını en üst düzeye çıkarmak için tasarlanmış tek bir yürütme alanına güç yönlendirme ve enerji depolama ile Akıllı Güç Düzleştirme gibi yeni özellikler sunuyor.

Geçici güç dalgalanmaları, yapay zeka fabrikalarındaki mevcut kapasiteyi boşa harcayarak genel işlem hacmini düşürebilir. Bunu ele almak için Vera Rubin sistemleri, bu geçici dalgalanmaları emerek önceki nesle göre ortalama güç tüketimini yaklaşık %10 oranında azaltan SoC (şarj durumu) akıllı güç düzleştirme güç kaynaklarıyla donatılmıştır. Ayrıca, maksimum güç gereksinimlerini sürdürebilen akıcı bir güç profili sunarak 50ms'lik zirve gücü %20 oranında azaltıyorlar.

Yapay zeka fabrikaları için DSX MaxLPS'i içeren NVIDIA DSX OS, GPU'lar, raflar, sıvı soğutma ve iş yüklerini kapsayarak, aynı güç bütçesi içinde %40 daha fazla GPU sunulmasını sağlayan, her bir dağıtımın işlem hacmini artıran planlama, yaşam döngüsü yönetimi ve sağlık otomasyonu için bir operasyonel katman sunuyor.

Tüm bu özelliklerin birleşimi, Rubin'i yapay zeka veri merkezleri için son teknoloji bir yonga haline getiriyor ve gelecekteki yapay zeka yetenekleri için, yapay zeka çıkarım iş akışlarına ve ötesine uzanan yeni bir yolculuk başlatacak.

Önceki Haber
NVIDIA'dan Yapay Zeka Devrimi: Vera CPU, x86'ya Meydan Okuyor!
Sıradaki Haber
The Witcher 3: Songs of the Past Genişlemesi Tanıtılıyor: Nintendo Switch 2 Oyuncuları Hayal Kırıklığına Uğradı

Benzer Haberler: