Yapay zeka alanındaki gelişmeler hız kesmeden devam ederken, NVIDIA'dan dikkat çekici bir hamle geldi. Şirket, Agentic AI ve Reinforcement Learning sistemleri için özel olarak tasarladığı yeni işlemcisi Vera CPU'yu duyurdu. Bu yeni işlemci, tek çekirdek ve tek iş parçacığı performansında x86 mimarisine ciddi bir rakip olmaya hazırlanıyor.
Yapay Zeka İş Yükleri İçin Yeniden Tasarlanan CPU: NVIDIA Vera
Agentic AI iş yüklerindeki artış ve model yeteneklerini geliştirmek için önemli bir ölçeklenme mekanizması olarak öne çıkan reinforcement learning, CPU'ları yapay zeka sistemlerinin vazgeçilmez bir bileşeni haline getirdi. Hızlı bir CPU olmadan (yürütme, değerlendirme, orkestrasyon), GPU'lar yeterli bağlamla beslenemez ve bu da önemli verimsizliklere yol açar. İşte bu noktada NVIDIA, bu darboğazları ortadan kaldırmak ve sektörün talep ettiği verimi sağlamak amacıyla özel olarak ajanlar için tasarlanmış bir CPU olan Vera'yı geliştirdi.
Gelin, özel Arm çekirdeklerine dayanan NVIDIA'nın en yeni ve en gelişmiş yapay zeka CPU'su Vera'nın tüm mimarisine yakından bakalım.
Vera CPU'nun İç Yapısı
NVIDIA'nın Vera CPU'su, özel Armv9.2 IP'sini kullanan Olympus Çekirdek mimarisine dayanıyor. Yüksek performanslı tek bir yongada hesaplama sunan bu mimari, 2. Nesil NVIDIA Scalable Coherency Fabric (SCF), Confidential Computing (TEE-I/O Uyumlu) ve x16 PCIe Gen6 CXL 3.1 gibi teknolojileri barındırıyor.
NVIDIA Scalable Coherency Fabric'in temel faydaları şunları içeriyor:
- CPU kümeleri arasında düşük gecikmeli iletişim
- Paylaşılan sistem düzeyindeki önbellek kaynaklarına verimli erişim
- Bellek denetleyicilerine yüksek bant genişlikli bağlantı
- NVLink-C2C ve hızlandırıcı altyapısıyla doğal entegrasyon
Marka Tahmin özelliği, döngü başına 2 dal alan Neural & Special-Purpose Predictors'a sahip. 10-Genişlikte Komut Çözme, Yenilikçi Grafik ve Gelişmiş Öndamla Önbelleği, 96 KB L1D, 64 KB L1I, 2 MB L2 ve 164 MB L3 önbelleğe sahip. Her çekirdek 14 GB/s bant genişliğine erişebiliyor. NVLink C2C ara bağlantısı, 1.8 TB/s'ye kadar tutarlı CPU-GPU bant genişliği sunuyor.
Vera'da toplamda 88 adet Olympus "yüksek performanslı" çekirdek ve 176 adet NVIDIA Spatial Multi-threading iş parçacığı bulunuyor. Çip, maksimum tek iş parçacığı performansı sunmak ve binlerce yazılım ortamında verimli eşzamanlılık sağlamak üzere tasarlanmış geniş, yüksek IPC'li bir mikro mimariyi entegre ediyor.
Vera'ya güç veren Olympus çekirdeği, CPU'nun hesaplama motoru olarak tanımlanıyor. Tek bir hedefle sıfırdan inşa edildi: Düzensiz, dal ağırlıklı, gecikmeye duyarlı ve yüksek eşzamanlı yazılımlar için IPC'yi (Döngü Başına Komut) en üst düzeye çıkarmak. Grace ile karşılaştırıldığında Vera, IPC'de %50'lik bir kazanç elde ediyor. Vera CPU mimarisinin dört temel bileşeni bulunuyor:
- Ön Uç: Optimize Edilmiş Dal Tahmincileri
- Orta Çekirdek: Kritik Yol Hızlandırma
- Yürütme Motoru: Karmaşık Vektör Optimizasyonu
- Önbellek Alt Sistemi: Gecikmeye Duyarlı Komut ve Veri Yolları
Olympus çekirdeğinin blok diyagramı şu şekilde:
Olympus Neural Branch Predictor
Olympus çekirdeğinin incelenmesine başlarken, öncelikle karmaşık, dal ağırlıklı yazılımlarda tahmin doğruluğunu artırmak üzere tasarlanmış Neural Branch Predictor ile başlıyoruz. NBP, büyük çalışma zamanı ortamları, yorumlayıcılar, veritabanları, derleyiciler ve ajan iş yüklerinde yaygın olan daha uzun menzilli kontrol akışı davranışını ve istatistiksel olarak yanlı dal desenlerini öğrenir. Dal tahmini iyileştirmeleri, Olympus'un ön ucunun kullanışlı komutlarla beslenmesini sağlayarak daha yüksek komut verimi ve daha tutarlı performans elde edilmesini mümkün kılar.
Olympus Mid-Core
Olympus'taki Orta Çekirdek, komutları yürütülebilir işlemlere dönüştürürken komut düzeyinde ve bellek düzeyinde paralelliği en üst düzeye çıkarır. Olympus Orta Çekirdek, bu darboğazların arkasında gizlenmiş bağımsız işleri tanımlamak ve yürütmek üzere tasarlanmıştır, bu da yürütme kaynaklarının daha yüksek kullanımını ve genel IPC'nin iyileştirilmesini sağlar. Orta Çekirdek, geniş bir yeniden adlandırma ve tahsis motoruna sahiptir ve büyük bir yeniden sıralama tamponu ile kapsamlı fiziksel kayıt kaynakları tarafından desteklenir. Orta Çekirdek Kayıt yeniden adlandırması, komutlar arasındaki yanlış bağımlılıkları ortadan kaldırarak işlemcinin ek paralellik ortaya çıkarmasına ve gerçek işleyenler hazır olur olmaz komutları yürütmesine olanak tanır. Büyük bir komut penceresi, Olympus'un komut akışında önemli ölçüde daha uzağa bakmasını sağlayarak diğer komutlar belleği veya dal çözümlemesini beklerken faydalı işler bulmasına olanak tanır.
Olympus ayrıca bağımlılıkları kırmak için şu teknolojilere ev sahipliği yapar:
- Bellek Yeniden Adlandırma: Veri ilişkisinin tahmin edilebildiği veya belirlenebildiği durumlarda, bağımlı komutların bir yük tamamlanmadan önce yürütülmesine izin vererek yük-yük bağımlılık zincirlerini hızlandırır. Bu, özellikle işaretçi ağırlıklı yazılımlar, grafik geçişleri, çalışma zamanı çerçeveleri ve karmaşık nesne yönelimli iş yükleri için faydalıdır.
- Değer Tahmini: Kararlı bağımlılık zincirlerini tanımlar ve gelecekteki değerleri üretilmeden önce tahmin eder, bu da doğruluğu daha sonra doğrulanırken bağımlı komutların spekülatif olarak yürütülmesine olanak tanır. Bu yetenek, tekrarlayan yazılım desenleri ve sıralı veri yapıları için özellikle etkilidir.
- Taşıma eleme ve değer optimizasyonu: Daha yüksek kullanım elde etmek için kullanılan tekniklerdir.
Olympus Execution Engine
Olympus çekirdeğindeki yürütme motoru, Agentic AI çalışma zamanları, RL ortamları, veritabanları ve daha fazlası dahil olmak üzere çeşitli iş yüklerinde yüksek komut verimini sürdürmek üzere tasarlanmıştır. Komutlar yeniden adlandırma ve planlama aşamalarından geçtikten sonra, tam sayı aritmetiği, dal işleme, vektör hesaplama ve bellek işlemleri için optimize edilmiş özel yürütme kaynaklarına dinamik olarak gönderilir. Geniş bir yürütme arka ucu ve derin sıralı olmayan motorun birleşimi, iş yüklerinin bazı bölümleri bellek erişimi, dal çözümlemesi veya uzun bağımlılık zincirleri nedeniyle yavaşlasa bile Olympus çekirdeklerinin ilerlemeye devam etmesini sağlar.
Bu nedenle, Yürütme Motoru için NVIDIA, 8 basit Tamsayı ALU, 2 Karmaşık ALU ve 4 özel dal yürütme birimi barındırıyor. Basit ALU'lar yaygın aritmetik ve mantıksal işlemleri ele alırken, karmaşık ALU'lar çarpma, bölme, CRC ve kaydırma ağırlıklı iş yükleri gibi daha yüksek gecikmeli işlemleri hızlandırır. Özel dal birimleri, kontrol akışı kararlarını hızla çözmek ve boru hattı kesintisini en aza indirmek için gelişmiş dal tahmini alt sistemine entegre edilmiştir. Bu kombinasyon, ajanların akıl yürütme, durum değerlendirme ve eylemleri gerçekleştirme sürecinde sıklıkla düzensiz kontrol akışı ve sık dallanma sergileyen modern ajan iş yükleri için özellikle faydalıdır.
Vektör ve yapay zeka odaklı hesaplama için Olympus, FP8 hassasiyetini destekleyen iki kripto özellikli vektör hattı dahil olmak üzere altı adet 128 bit SVE vektör yürütme birimini entegre eder. Bu birimler, veri işleme, makine öğrenmesi ön işleme, sıkıştırma, şifreleme, bilimsel hesaplama ve analitik çerçevelerde yaygın olarak bulunan vektörleştirilmiş iş yüklerini hızlandırır. Arm Scalable Vector Extension (SVE) desteği, hem geleneksel HPC iş yüklerinin hem de gelişmekte olan yapay zeka veri işleme boru hatlarının verimli yürütülmesini sağlar.
Yürütme Motoru, dört yük hattı ve 2 depolama hattı aracılığıyla yüksek bant genişlikli bir bellek alt sistemine sıkıca entegre edilmiştir. Birlikte bu kaynaklar, Olympus'un hem hesaplama yoğun hem de bellek yoğun iş yükleri arasında yüksek kullanım oranını korumasını sağlar.
NVIDIA, Vera CPU'larda Spatial Multi-Threading adında yeni bir çoklu iş parçacığı çözümü kullanıyor. Geleneksel SMT'ye (Simultaneous Multi-Threading) kıyasla NVIDIA'nın yaklaşımı, daha dar bir çekirdeğe dayanmak yerine kaynakların Olympus çekirdeği içindeki iki donanım iş parçacığı arasında bölüştürülmesini sağlıyor. Bu sayede Vera, gerektiğinde yüksek verimli tek iş parçacıklı bir çekirdek sunarken, iş parçacığı ikilisi yönetimi üstleniyor. 88 çekirdek ve 176 iş parçacığı ile NVIDIA'nın Vera'sı, hem yüksek tek iş parçacıklı performans hem de yoğun vGPU tarzı dağıtımlar sunan esnek bir CPU'dur.
Spatial Multithreading, geleneksel SMT yaklaşımlarına kıyasla determinizmi, izolasyonu ve hizmet kalitesini iyileştirir. Sonuç, daha tutarlı gecikme ve verim sağlarken çok sayıda eşzamanlı ajan görevini çalıştırabilen bir CPU mimarisidir.
Vera Bellek Alt Sistemi - LP5X, DDR DIMM'lere Göre Güç Tüketimini Düşürüyor
NVIDIA, Vera CPU'ları için sekiz denetleyici ile birleştirerek ve 1.2 TB/s'ye kadar bant genişliği sunarak LPDDR5X bellek kullanmayı tercih etti. LPDDR5X bellek, veri merkezi sınıfı ECC (Hata Düzeltme Kodu) ile geliyor ve platformun geleneksel DDR4 tabanlı sunuculara kıyasla güç tüketimini önemli ölçüde azaltmasını sağlıyor. Çip, 1.5 TB'a kadar LPDDR5X kapasitesi sunuyor.
SOCAMM2 form faktöründe LPDDR5X belleğin kullanılması, güç verimliliğini artırmada da önemli bir rol oynuyor. Bu bellek türü için belirlenen üç ana hedef şunlar:
- Yüksek Bant Genişliği: Modern yapay zeka, analitik ve HPC iş yüklerini desteklemek için gereken bellek bant genişliğini sağlamak.
- Güç Verimliliği: Toplam platform gücünü azaltmak için LPDDR5X teknolojisiyle watt başına bant genişliğini en üst düzeye çıkarmak.
- Kurumsal Hizmet Verilebilirliği: Hiper ölçekli ve kurumsal dağıtımlar için uygun, modüler, sahada değiştirilebilir bir bellek mimarisi sunmak.
Vera'daki LPDDR5X bellek 9600 MT/s hızında çalışarak her Olympus çekirdeğine 14 GB/s'ye kadar bellek bant genişliği sunuyor. Bellek kapasiteleri 256 GB'tan 1.5 TB'a kadar ölçeklenebiliyor.
LP5X'in kullanılmasının önemli bir nedeni de güç zarfını düşürmektir. DDR5 (DIMM, RDIMM, MRDIMM) gibi geleneksel DRAM standartları daha yüksek bant genişliği sunsa da, çok daha yüksek güç tüketirler. RDIMM platformları 100W'ın üzerinde, MRDIMM çözümleri ise bant genişliği yoğun iş yüklerinde 200W'ın üzerinde güç tüketebilir. Buna karşılık SOCAMM2, tamamen dolu bir sistem için sadece 30-40W tüketirken 1.2 TB/s'ye kadar hızlara ulaşıyor.
IO'lar - PCIe 6.4, 2. Nesil NVLink, Çift Soket Ölçeklenebilirliği ve Gizli Hesaplama
Giriş/Çıkış (IO), Güvenlik ve Ölçeklendirme ön cephesinde NVIDIA Vera CPU'ları şu gibi birçok teknolojik yenilik sunuyor:
- İkinci Nesil NVLink-C2C: CPU'dan GPU'ya ve CPU'dan CPU'ya iletişim için yüksek bant genişlikli tutarlı ara bağlantı.
- İki Soketli Ölçeklendirme: Ölçeklenebilir çift soketli sistemler için yüksek hızlı tutarlı işlemciden işlemciye bağlantı.
- PCI Express 6.4: Depolama, ağ ve hızlandırıcı cihazlar için yüksek performanslı G/Ç bağlantısı.
- Compute Express Link (CXL) 3.1: Bellek genişletme, havuzlama ve bestelenebilir sistem mimarilerini desteklemek için PCIe altyapısını genişletir.
- Gizli Hesaplama: 2 soket ve NVL raf boyunca güvenli ölçeklenebilir ortam.
PCIe ile başlayarak, Vera en son PCIe 6.4 standardından yararlanıyor ve her bir çip 88 adede kadar PCIe hattı sunuyor; çift soket yapılandırmaları ise 176 hat sunuyor. Bunlar 64 GT/s'ye kadar hızlarda çalışarak PCIe 5 standardının verimini ikiye katlıyor ve AIC'ler ile depolama çözümleri için yeterli bant genişliği sağlıyor. Vera ayrıca aşağıdaki tabloda ayrıntılı olarak belirtildiği gibi geniş bir PCIe hat bölümlendirme dizisi ile birlikte geliyor:
CXL 3.1'e yapılan daha fazla genişletme, standart LPDDR5X çözümünün ötesinde CXL Tip-3 bellek cihazlarının desteğiyle yeni nesil bellek genişletme ve bestelenebilir altyapı sağlar.
Vera, gizli VM izolasyonu ve güvenli cihaz ataması için bir temel oluşturan Arm CCA, RME-DA ve RME-CDA'yı destekler. VM başına şifreleme anahtarları, Vera CPU üzerinde çalışan kiracılar arasında kriptografik izolasyon sağlarken, TDISP özellikli cihazlar için destek güvenilir yürütme ortamını CPU'nun ötesine genişletir.
Sektörün, TDISP'yi GPU'lar gibi tutarlı cihazlar için etkinleştiren ilk Gizli Hesaplama CPU'su olan Vera, güçlü iş yükü izolasyonunu korurken, takas tamponları veya gereksiz veri kopyaları olmadan yüksek performanslı, tutarlı erişim sağlar. Güvenlik, güvenilirlik ve kullanılabilirlik cephesinde Vera şunları sunar:
NVIDIA'nın Vera CPU'su, bir sonraki dönem ajan yapay zeka ve reinforcement learning iş yüklerini desteklemek üzere özel olarak tasarlanmış, işlemci tasarımında çığır açan bir ilerlemeyi temsil ediyor. Özel Armv9.2 teknolojisi ile yenilikçi Olympus çekirdek mimarisinden yararlanan Vera, gelişmiş sinirsel dal tahmini, bellek ve değer tahmini gibi gelişmiş orta çekirdek paralellik teknikleri, vektör yeteneklerine sahip güçlü bir yürütme motoru ve optimize edilmiş bir önbellek alt sistemi içeren yüksek IPC'li bir mikro mimari aracılığıyla olağanüstü tek iş parçacığı performansı sunuyor. Spatial Multi-Threading yaklaşımı, geleneksel SMT'ye kıyasla üstün determinizm ve izolasyon sağlarken, yüksek bant genişlikli LPDDR5X bellek, ikinci nesil NVLink-C2C, PCIe 6.4, CXL 3.1 ve kapsamlı gizli hesaplama özelliklerinin entegrasyonu, sorunsuz CPU-GPU orkestrasyonu, devasa ölçeklenebilirlik ve geliştirilmiş güvenlik sağlıyor. Yürütme, değerlendirme ve veri hareketindeki geleneksel darboğazları ortadan kaldırarak Vera, seleflerine göre %50'ye kadar daha iyi IPC elde ediyor ve karmaşık, eşzamanlı yapay zeka ortamları için özel olarak tasarlanmış benzersiz verimlilik, verim ve düşük gecikme performansı sunarak onu gerçek bir x86 alternatifi ve gelecek yapay zeka sistemleri için bir temel taşı konumuna getiriyor.