Ara

Nvidia Rubin Mimarisi: Yapay Zeka Çıkarımında Yeni Dönem Başlıyor!

Nvidia'nın merakla beklenen Vera Rubin platformu, yılın ilerleyen zamanlarında teknoloji dünyasında yerini alacak. Yapay zeka (YZ) dünyası, artık büyük ölçekli eğitimlerden ziyade, yapay zeka ajanlarının (agentic AI) çıkarım (inference) taleplerine odaklanıyor. Yapay zeka ajanlarının ürettiği token'ların hızlı, verimli ve düşük maliyetle sunulması, günümüzün en önemli gündem maddelerinden biri haline gelmiş durumda. Bu bağlamda Nvidia, Rubin mimarisindeki iyileştirmeleriyle dikkat çekiyor.

Daha önce Vera CPU'nun yapay zeka ajan iş yüklerini nasıl hızlandırdığına dair detayları paylaşan Nvidia, şimdi de Rubin mimarisinin yeni özelliklerini ve bu özelliklerin GPU'dan rack seviyesine kadar çıkarım verimliliğini nasıl artırmayı hedeflediğini açıklıyor. Tam Vera Rubin NVL72 rack-ölçekli sistem, 36 Vera CPU ve 72 Rubin GPU'dan oluşuyor. Ancak bugünkü odak noktamız, GPU'nun kendisi.

Rubin, Nvidia Yüksek Bant Genişliği Arayüzü (High Bandwidth Interface) kullanarak tek bir pakette iki işlem birimini birleştiriyor. Bu sayede 224 Akışlı Çoklu İşlemci (SM) ve toplam 896 Tensör Çekirdeği ile birlikte 288 GB HBM4 bellek ve 22 TB/s bellek bant genişliği sunuyor.

Çıkarım odaklı bir hızlandırıcı olarak Nvidia, Rubin'in 50 sparse PFLOPS'luk NVFP4 çıkarım verimliliğini öne çıkarıyor. Ancak bu, GPU'nun işleyebildiği birçok veri türünden yalnızca biri. İşte bu çipin öne çıkan bazı özellikleri:

Rubin Tensör Bellek Hızlandırıcısı: Büyüyen MoE Modelleri Verimli Yönetiyor

Nvidia, Tensör Bellek Hızlandırıcısı'ndaki (TMA) verimlilik iyileştirmelerini vurguluyor. TMA, bellek adresi hesaplamalarını yapan ve doğrudan dizilerin verilerini GPU'nun paylaşılan yerel belleğine yükleyen özel bir motor olarak görev yapıyor.

Günümüzün önde gelen YZ modelleri, her parametrenin çıktı token'ı başına aktif olduğu yoğun modellerden, yalnızca belirli uzman alt ağlarının aktif olduğu uzmanlar karışımı (MoE) mimarisine doğru evriliyor. Bu modellemede, yönlendirici (router) sayesinde hangi uzmanların belirli bir girdiyi işlemede daha uygun olduğuna karar veriliyor.

MoE uzman ağırlıkları, GPU'lar arasında dağıtılarak sınırlı GPU HBM kapasitesi verimli bir şekilde kullanılabiliyor. Nvidia'ya göre Rubin'in TMA'sı, günümüzün önde gelen modellerindeki artan uzman sayısının getirdiği zorlukları yönetmek için geliştirilmiş durumda.

Blackwell GPU'lardaki TMA, her uzmanın konumu için bellekte ayrı MoE tanımlayıcıları tutmak zorundaydı. Bu da, uzman sayısı arttıkça bu uzman ağırlıklarının yerini bulma ve taşıma maliyetlerinin daha fazla işlem gücü gerektirmesi anlamına geliyordu. Rubin TMA, artık GPU çekirdeklerinin tek bir birleşik MoE tanımlayıcısını çalışma zamanında doğrudan TMA komutunda tutmasını ve güncellemesini destekliyor. Bu, MoE tanımlayıcısı meta verilerinin hesaplanmasını azaltarak veri hareketi için gereken işlem yükünü hafifletiyor. Bu yaklaşım, pahalı YZ hızlandırıcınızın zamanının büyük çoğunluğunu harcaması gereken çıkarım hesaplamaları için GPU döngülerini serbest bırakıyor.

İki Katına Çıkarılan K-Boyut Verimliliği: Tensör Çekirdeği Çıktısı İki Katına Katlanıyor

Rubin, Tensör Çekirdeği'ndeki temel matris işlemleri performansını da iyileştiriyor. Bu çekirdeklerin K boyutunda (iki matrisin çarpılmasında paylaşılan iç boyut) gerçekleştirebildiği iş miktarını ikiye katlıyor. Matematiksel detaylara çok derinlemeden girmeden, K boyutunun büyüklüğü, Tensör Çekirdeği'nin çarpılan iki matrisin elemanları üzerinde kaç kez döngü yapması gerektiğiyle doğrudan ilişkilidir.

Nvidia'nın örneğine göre, Blackwell üzerinde dört döngü gerektiren bir sonuç matrisinin hesaplanması, Rubin'de yalnızca iki döngüde tamamlanabiliyor. Nvidia, bu iyileştirmenin verimlilik, bellek ve gecikme açısından sınırlı çekirdekler (kernels) için geniş çaplı faydalar sağladığını ve hem bağlam işleme hem de çıkarım aşamaları için faydalı olduğunu belirtiyor.

Softmax Performansı Blackwell'e Göre 4 Kata Kadar Artıyor

Rubin, Transformer tabanlı büyük dil modellerinin (LLM) temelini oluşturan dikkat mekanizmasının performansını da iyileştirmeye odaklanıyor. Daha gelişmiş modeller artık bir milyon tokene kadar bağlam uzunluklarını destekliyor ve bu kadar uzun girdi dizilerinde dikkat hesaplamalarını hızlı bir şekilde gerçekleştirmek, çıkarım performansını artırmanın anahtarıdır.

Softmax, dikkat hesaplamalarında temel bir işlemdir. Rubin'deki geliştirilmiş Tensör Çekirdeği verimliliğini karşılamak için Nvidia, GPU SM'lerinin Özel Fonksiyon Birimi'nde (SFU) softmax verimliliğini bir kez daha artırdı. SFU'nun transandantal matematik yeteneklerine dayanması nedeniyle, softmax verimliliği sonraki çıkarım işleri için bir darboğaz oluşturabilir. Nvidia, Blackwell Ultra SFU'daki iyileştirmelerle bu sınırlamayı zaten ele almıştı. Blackwell Ultra, birinci nesil Blackwell GB200'e kıyasla FP32 ve BF16/FP16 üstel (exponential) verimliliğini iki katına çıkarmıştı.

Rubin, FP32 üstel matematikte Blackwell'e kıyasla 2 kat hız artışını koruyor ve bu düşük hassasiyetli veri türleri için Blackwell'e kıyasla 4 katlık bir verimlilik artışı sağlayarak, Blackwell Ultra'ya kıyasla BF16/FP16 üstel hesaplamaları bir kez daha iki katına çıkarıyor.

Daha İnce Taneli Bağımlılık Yönetimi, Daha İyi Tensör Çekirdeği Kullanımı

Rubin, Blackwell'e kıyasla bağımlı çekirdekler arasında daha ince taneli koordinasyon fırsatları sunarak Tensör Çekirdeği kullanımını artırıyor. Nvidia'nın belirttiği durumlardan biri, bir LLM için aktivasyonların üretilmesidir; burada bir çekirdek, bir sonraki çekirdeğin veri olarak kullanacağı veriyi üretir ve depolar.

Blackwell GPU'larda, bir iş parçacığı bloğundaki uzun süren bir üretici çekirdeği (örneğin bir küme içindeki CUDA yapısı), bu iş parçacığı bloklarındaki sonraki bir tüketici çekirdeğinin yürütülmesini geciktirebilir. Üretici çekirdeğin diğer iş parçacığı blokları işlerini bitirmiş olsa bile.

Rubin, çekirdekler arasında daha ince taneli bağımlılık çözümü sunar. Böylece tüketici çekirdek, üretici çekirdeğin her iş parçacığı bloğundan gelen verinin tamamının kullanılabilir olmasını beklemek yerine, üretici çekirdeğin her iş parçacığı bloğundan gelen çıktı verisi kullanılabilir hale gelir gelmez bireysel iş parçacığı bloklarında yürütülmeye başlayabilir. Bu daha ince taneli yönetim, daha iyi GPU kullanımı, daha düşük çekirdekler arası gecikme süresi ve nihayetinde kullanıcı başına daha fazla token saniyede (tokens per second) ile sonuçlanır.

Daha Verimli GPU'lar Arası İletişim, Daha Düşük NVLink Giderleri

Şimdiye kadar tartıştığımız tüm iyileştirmeler, tek bir GPU üzerinde işlemlerin nasıl yapıldığıyla ilgilidir. Ancak Vera Rubin NVL72 rack-ölçekli hızlandırıcı, rack içindeki NVLink yapısı üzerinden bağlı birçok GPU'dan oluşuyor. Model ağırlıkları, anahtar-değer önbelleği verileri ve GPU'lar arası senkronizasyon mesajları bu yapı üzerinden hareket eder. Bu nedenle giderleri ve gecikmeyi düşük tutmak, maksimum performansı elde etmek için kritik öneme sahiptir.

CUDA çekirdekleri çalıştıran GPU'lar, Nvidia Kolektif İletişim Kütüphanesi (NCCL) API'sini kullanarak rack'teki diğer GPU'larla doğrudan iletişim başlatabilir, böylece giderler azalır. Nvidia, GPU'nun bu işlemleri doğrudan işlem çekirdeğinin bir parçası olarak gerçekleştirmesi nedeniyle, bu iletişimlerin verimli bir şekilde yürütülmesinin performans için kritik olduğunu belirtiyor.

Blackwell sisteminde, GPU'lar arasındaki bir NVLink aktarımı veri depolama işlemleri ve ardından bir bellek engeli ve atomik bayrak gerektirebilir. Rubin mimarisi, rack genelinde verileri paylaşmak için gereken koordinasyon ve senkronizasyon trafiğini azaltan 'sayılan yazmalar' (counted writes) adında bir özellik sunuyor.

Rubin'de bellek engeli ve atomik işlemler, alıcı GPU'daki tek bir sayaç güncellemesiyle değiştirilir. Bu, ağ trafiğini ve gecikmeyi azaltır ve koordinasyon giderleri için bekleme süresini azaltarak işlem kullanımını iyileştirir.

Özetle, ajan yazılımları, araç çağırma, kod derleme ve daha fazlası için Vera CPU'nun yüksek tek iş parçacıklı performansı ile birleşen Rubin GPU'daki iyileştirmeler, kritik çıkarım operasyonlarında performans artışı sağlarken, yonga içi ve rack genelindeki veri hareketleri için verimliliği artırıyor. Bu da Nvidia'nın vizyonladığı giderek daha ajan odaklı hale gelen gelecekte, rack ve veri merkezi ölçekli sistemlerin çıkarım performansını artıracağına ve token başına çıkarım maliyetlerini düşüreceğine işaret ediyor. Vera Rubin sistemlerinin bu sonbaharda teslim edilmeye başlanmasıyla birlikte, bu GPU'nun neler yapabileceğini görmek için heyecanlıyız.

Önceki Haber
Nvidia'nın Gizli Mühendislik Üssü Ortaya Çıktı: Vera Rubin NVL72, OpenAI Yükleri ve 800VDC Güç Teknolojisi Gözler Önünde
Sıradaki Haber
Nvidia'dan Yapay Zeka Veri Merkezleri İçin Devrim Niteliğinde CPU: Vera Tanıtıldı!

Benzer Haberler: