Yapay zeka alanındaki en güncel performans verilerini sunan MLPerf Inference v6.1 sonuçları yayınlandı. Bu yeni sürümde, yapay zeka segmentindeki güncel eğilimlerle uyumlu çeşitli iş akışlarını içeren bir dizi test yer alıyor. Her zamanki gibi, teknoloji devleri AMD, NVIDIA ve Intel, en yeni donanımlarının performans sonuçlarını paylaştı.
AMD ve NVIDIA Yapay Zeka Performansıyla Öne Çıkıyor, Intel'den Xeon ve Arc Pro Hamleleri
DeepSeek R1 testinde AMD, 512 adet Instinct MI355X GPU'dan oluşan bugüne kadarki en büyük küme yapılandırmasını sundu. Bu yapılandırma, hem çevrimdışı hem de sunucu kullanım senaryolarında performansta liderliği ele geçirdi. NVIDIA'nın GB300 ve GB200 modelleri ise 288 GPU'luk yapılandırmalarda test edildi ve GB300 yapılandırması, MI355X platformuna oldukça yakın bir performans sergiledi.
Ayrıca, bu testlerde NVIDIA'nın Vera Rubin (VR200) GPU'sunun 72 ve 36 GPU'luk yapılandırmalarla ilk kez test edildiğini görüyoruz. 72 GPU'luk yapılandırma, aynı sayıda GPU'ya sahip bir GB300 yapılandırmasından %95'e kadar daha hızlı olurken, 36 GPU'luk yapılandırma ise 72 GPU'luk bir GB200 yapılandırmasından daha iyi bir performans gösterdi. Bu, Vera Rubin için erken bir ön inceleme niteliğinde ve ilerleyen dönemlerde MLPerf testlerinde daha fazla sonuç görmeyi bekliyoruz.
GPT-OSS 120B testinde de AMD, en büyük 512 GPU'luk yapılandırmasıyla bir kez daha çevrimdışı ve sunucu senaryolarında liderliği aldı. NVIDIA'nın GB300 "Grace Blackwell Ultra" yapılandırması ise 72 ve 8 GPU'luk segmentlerde öne çıktı. AMD'nin MI350P'si de 8 GPU'luk yapılandırmalarda MI300X'ten daha hızlı bir performans sergiledi. Intel de testlere Arc Pro B70 ile katılırken, NVIDIA'nın RTX PRO GPU'ları da 8 ve 4 GPU'luk yapılandırmalarda test edildi.
Llama2 70B testinde NVIDIA'nın Blackwell GPU'ları, 72 GPU'luk yapılandırmalarla dikkat çekti. NVIDIA GB300, 8 GPU'luk yapılandırmalarda AMD MI355X'i geride bırakırken, Instinct platformu GB200 Blackwell çözümünden daha iyi bir performans gösterdi. AMD'nin MI350P'si, NVIDIA RTX PRO ve Intel Arc Pro da bu testte yerini aldı. İş istasyonu platformlarının da MLPerf sonuçlarına dahil olması olumlu bir gelişme.
Son olarak, Llama 3.1-8B testinde NVIDIA GB300 (8 GPU'luk yapılandırma), AMD MI355X (8 GPU'luk yapılandırma) karşısında %17'ye kadar daha hızlı bir performans sergiledi.
Elbette, bu sonuçlar oldukça etkileyici olsa da, yapay zeka alanındaki hızlı gelişmeler nedeniyle bu performansların kısa süre içinde değişebileceğini unutmamak gerekir. Sürekli devam eden yazılım ve donanım optimizasyonları, sadece performansı artırmakla kalmayıp verimliliği de yükselterek platformların daha fazla ölçeklenmesine olanak tanıyor.
MLPerf Inference v6.1, tek bir kazanan yerine rekabetçi ve hızla gelişen bir alanı gözler önüne seriyor. AMD'nin 512 GPU'luk MI355X kümesi, DeepSeek R1 ve GPT-OSS 120B'de büyük ölçekte performansı belirlerken, NVIDIA'nın ilk Vera Rubin ön incelemesi şimdiden büyük bir sıçrama vaat ediyor: 72 GPU'luk bir VR200 sistemi, eşdeğer bir GB300 rafını neredeyse ikiye katlarken, 36 GPU'luk bir kurulum bile 72 GPU'luk GB200'ü geride bıraktı.
Daha yaygın olan 8 ve 72 GPU'luk boyutlarda ise tablo daha karışık. GB300, Llama 2 70B ve Llama 3.1 8B'de genellikle lider olurken, AMD bazı GPT-OSS çalıştırmalarında rekabetçi veya daha iyi bir performans sergiliyor. MI350P, RTX PRO ve Intel Arc Pro B70 ise iş istasyonu donanımlarının artık bu alanda dikkate alınması gerektiğini gösteriyor. Intel ayrıca Xeon'u testteki tek bağımsız CPU olarak konumlandırdı.
Asıl önemli olan, yazılımın sayıları ne kadar hızlı ileri taşıdığı. NVIDIA, v6.0'dan bu yana yapılan yazılım çalışmalarıyla 1.6 kata kadar kazanç sağladığını belirtiyor; AMD, aynı MI355X silikonunu bir döngü içinde iyileştirdi; Intel ise aynı donanımda Arc Pro sonuçlarını yükseltti. Bu skorlar birer anlık görüntü niteliğinde, performansın tavanı değil. Rubin'in piyasaya sürülmesiyle, ROCm ve CUDA'nın gelişimiyle ve daha fazla kümenin çevrimiçi olmasıyla, bir sonraki MLPerf turu yine farklı görünecek; ki endüstrinin istediği de tam olarak bu.