Ara

AMD’den NVIDIA’ya Çıkarm: Cerebras Teknolojisiyle Yapay Zeka Hızını 5 Katına Çıkarıyor!

Yapay zeka alanında rekabet kızışıyor. NVIDIA'nın Groq'un LPU (Dil İşleme Birimi) teknolojisiyle dikkat çekmesinin ardından, AMD de Cerebras ile yaptığı işbirliğiyle karşılık veriyor. İki dev şirket, Cerebras'ın Wafer-Scale Engine (Yonga Ölçekli Motor) teknolojisini AMD'nin Helios çözümüne entegre ederek yapay zeka çıkarım performansında devrim yaratmayı hedefliyor.

LPU ve Yonga Ölçekli Motor Karşılaştırması

Groq'un LPU'ları, yüzlerce, hatta binlerce özel çipi bir araya getirerek çalışıyor. Her bir çip, devasa Matris Çarpımı (MXM) ve Vektör (VXM) birimlerinin yanı sıra yüksek hızlı SRAM belleği barındırıyor. Bu mimaride, yapay zeka model ağırlıkları doğrudan SRAM'e gömülerek bellek önbelleği konsepti bypass ediliyor. Groq'un derleyicisi ise her bir hesaplamayı hassas bir şekilde planlayarak, verilerin SRAM'den sürekli ve titizlikle işlenmesini sağlıyor, bu da son derece hızlı çıkarım sonuçları doğuruyor.

Buna karşılık Cerebras'ın Wafer-Scale Engine'i, tek bir dev, birbirine bağlı silikon yonga üzerinde bir yapay zeka süper bilgisayarının bellek ve işlem gücünü topluyor. Yüz binlerce işlem çekirdeği ve onlarca GB'lık SRAM, verilerin harici ağ darboğazlarına takılmadan verimli bir şekilde hareket etmesini sağlıyor.

LPU'lar, SRAM'in küçük ve izole havuzlarını kullanırken, modelin farklı parçaları çok sayıda özel çipe dağıtılıyor. Cerebras'ın Wafer-Scale Engine'i ise orta boyutlu bir modeli veya büyük bir modelin önemli parçalarını tek bir SRAM bloğu içinde barındırabiliyor. Ayrıca, Cerebras'ın yaklaşımı hem eğitim hem de çıkarım iş yükleri için esneklik sunuyor.

AMD, En Gelişmiş Yapay Zeka Uygulamaları İçin Gereken Ultra Düşük Gecikmeyi Sunmak Üzere Helios'u Cerebras'ın Yonga Ölçekli Motoru ile Entegre Ediyor

AMD'nin vizyonuna göre, Helios yüksek performanslı ve ölçeklenebilir bir işlem gücü sağlarken, Cerebras'ın Wafer-Scale Engine teknolojisi ultra hızlı, ultra düşük gecikmeli kod çözme ve token üretimi sunacak. Bu iki işlem motorunun birleşimiyle, watt başına saniyede 5 kata kadar daha fazla token üretilmesi bekleniyor.

Bu işbirliği, hacim bazlı iş yüklerinin yüksek token üretimi gereksinimlerini, kodlama ve diğer ajan tabanlı görevlerin değer verdiği daha hızlı yanıt süreleriyle dengeliyor.

AMD, bu konuda şunları ekliyor:

NVIDIA, 256 adet birbirine bağlı Groq 3 LPU hızlandırıcı, tam sıvı soğutma ve 315 PFLOPS çıkarım gücü sunan LPU tabanlı rack-scale (raf ölçekli) çözümünü piyasaya sürüyor.

Bununla birlikte, AMD ve Cerebras arasındaki bu işbirliği, Groq 3 LPX'in nispeten sabit LPU'larına kıyasla çok daha esnek bir raf ölçekli ürün sunuyor.

Önceki Haber
Intel'in Yeni Nesil Teknolojisi 14A Üretimi Hızlanıyor: 2028'de Yüksek Hacimli Üretime Başlıyor
Sıradaki Haber
Türk Telekom'un 'Müşteri Hizmetleri Kâbusu': Yapay Zeka 'Ölüm Döngüsü'ne Soktu!

Benzer Haberler: