OpenAI, yapay zeka alanındaki atılımlarına bir yenisini ekleyerek, kendi tasarladığı ve NVIDIA'nın hakimiyetini sarsma potansiyeli taşıyan yeni çipi Jalapeno'yu tanıttı. Mevcut modellerini NVIDIA GPU'lar üzerinde çalıştırmasının ardından, Jalapeno çipini kendi geliştirdiği Gluon kernel programlama diliyle birleştiren şirket, teknoloji devinin yıllardır kurduğu CUDA hakimiyetine meydan okuyor. Bu durum, adeta ezeli rekabette dengelerin nasıl değiştiğini gösteriyor.
OpenAI Jalapeno Çipinin Mimari Yapısı
Teknoloji analistleri tarafından yapılan detaylı bir incelemeye göre, OpenAI'ın Jalapeno ASIC'i, ölçek ekonomisinde önemli kazanımlar sağlayan yenilikçi bir mimariye sahip. Bu yeni mimari, TSMC'nin N3P üretim sürecinde üretilmiş tek bir retikül boyutunda işlemci yongasını, bir N3E I/O çipleti ve HBM4 bellek (muhtemelen Samsung'dan) ile birleştirerek, paket başına 15.4 TB/s bellek bant genişliği sunuyor.
Çekirdekler ve bellek, eşleşen 'dilimlere' ayrılmış durumda. Bu sayede her çekirdek dilimi, kendine atanmış HBM dilimine düşük gecikmeli yerel bir erişim sağlıyor ve yüksek bant genişlikli bir ağ ile birbirine bağlanıyor.
Yapay zeka modelleri genellikle veriyi satır satır işlemezler. Bunun yerine, milyarlarca sayıyı matrisler veya tablolar halinde organize ederek işlerler. Bu nedenle, matris motoru, bu tablo tabanlı matematik problemlerini hızlandırmak için tasarlanmış 'ağır işçi' konumunda. Geleneksel yapay zeka hesaplamaları 16-bit veya 8-bit sayıları kullanırken, Jalapeno'nun MXFP sayısal formatları, AI matematik verilerini 4-bit'e kadar sıkıştırarak bellek ihtiyacını önemli ölçüde azaltıyor.
Jalapeno'nun matris motorları, ağırlık sabitli (weight-stationary) sistolik bir diziye sahip. Geleneksel CPU'larda, çip sürekli olarak bellekten veri okur, hesaplama yapar ve sonucu belleğe geri yazar. Bu durum bir darboğaz oluşturur. Sistolik dizi ise, bir insan kalbi gibi çalışır: veri, birbirine sıkıca bağlı işlem hücrelerinin bir ızgarasına akar ve harici belleğe sürekli okuyup yazma yapmadan doğrudan bir hücreden diğerine geçer. Ayrıca, AI hesaplamaları genellikle gelen veriyi (kullanıcı girdisi gibi) sabit dahili değerlerle (modelin ağırlıkları) çarpmayı içerir. Jalapeno'nun matris motorları ağırlık sabitli olduğu için, çip model ağırlıklarını işlem ızgarasına bir kez yükler ve sabitler.
Bu ağırlıkları sabit tutarak, veriyi ızgara boyunca akıcı bir şekilde pompalamak (sistolik dizi) ve sayıları sıkıştırmak (MXFP), Jalapeno'nun veri akışı darboğazlarını ortadan kaldırdığı anlamına gelir.
Matris motorlarının yanı sıra, OpenAI'ın Jalapeno çipi, kontrol kodunu çalıştırmak, belleği yönetmek ve tüm operasyonu koordine etmek için 64-bit skaler çekirdekleri de içeriyor. Bu skaler çekirdekler, sırası bozuk (Out-of-Order) yürütme hatlarına sahip ve bir L1 önbellek ile eşleştirilmiş durumda. Bu, bu çekirdeklerin veri bekleme sırasında durmasını engeller. Sırası bozuk skaler çekirdekler, matematik motorlarının önünde çalışarak verileri özel donanım kuyruklarına aktarır. Böylece, katı, sırası bozuk matris ve vektör çekirdekleri hazır olduğunda, sayılar önlerinde bekliyor olur.
Son olarak, çip, yüksek hassasiyetli matematik gerektiren ve matris motorlarındaki sıkıştırmanın sonuçları bozabileceği durumlarda devreye giren FP32/INT32 vektör çekirdeklerine sahip. Bu çekirdekler, tek bir komutu aynı anda bir sayı satırının tamamına uygulayabilir. Bu özellik, bir sonraki kelimenin olasılıklarını belirlemek (softmax katmanları) veya veri katmanlarını normalleştirmek için faydalıdır.
OpenAI, sadece Jalapeno çipini değil, aynı zamanda aşağıdaki bileşenlerden oluşan tam bir raf ölçeğinde çözüm de geliştiriyor:
- CPU Ana Raf (Katsu): Bu raf, 16 adet farklı ana CPU tepsisi barındırır. Her bir Katsu tepsisi, iki adet Turin sınıfı AMD EPYC işlemci, 1.5TB standart DRAM sistem belleği, yerel NVMe SSD depolama ve 400G ön ağ bağlantıları ile donatılmıştır.
- ASIC Hızlandırıcı Raf (Vindaloo): Ana rafın hemen sağına yerleştirilen bu raf, 16 adet karşılık gelen hızlandırıcı tepsi içerir. Her Vindaloo tepsi, 8 adet Jalapeno ASIC barındırır ve tek bir raf dağıtımında toplam 128 adet Jalapeno çipi bulunur.
- İki rafı birbirine bağlamak için, sunucu kabinetlerinin önünden yatay olarak uzanan 8 adet harici, yüksek hızlı PCIe Direct Attach Copper (DAC) kablosu, her Katsu ana tepsi ile eşleşen Vindaloo ASIC tepsisini doğrudan birbirine bağlar.
- Her 128 çiplik ASIC rafı, 4-bit (MXFP4) işlem gücünde 1.7 ExaFLOPs'a kadar performans sunar ve raf başına 27.5 TB yeni nesil HBM4 bellek içerir. Her bir Jalapeno paketi, inanılmaz 15.4 TB/s bellek bant genişliğine ulaşmak için altı adet 12 katmanlı HBM4 yığınını kullanır.
OpenAI'nin Jalapeno Çipi Rekabette Fark Yaratıyor
Yapılan test sonuçlarına göre Jalapeno, çıkarım (inference) iş yükleri için en verimli çip olma özelliğini taşıyor. InferenceX benchmark testlerinde, OpenAI'ın GPT-OSS 120B, DeepSeek R1 670B ve Kimi K2.5 1T modelleriyle yapılan testlere dayanarak, mevcut en iyi NVIDIA GB200/GB300 sonuçlarına göre watt başına 1.5 ila 1.9 kat daha fazla yapay zeka işi gerçekleştirdiği ve uçtan uca gecikmenin 1.7 ila 3.6 kat daha düşük olduğu gözlemlendi. En kritik nokta ise, çipin tek bir model ailesi için özel olarak optimize edilmemiş olması ve herhangi bir modeli kolaylıkla çalıştırabilme yeteneğine sahip olması.
Yapılan analizlere göre, Jalapeno TSMC'nin N3P üretim sürecinde üretilen tek bir retikül boyutunda işlemci yongası üzerinde 13.4 PFLOPs MXFP4 işlem gücü sunuyor. Benzer boyutta ve aynı üretim sürecinde üretilmiş tek bir Rubin işlemci yongası için ise 17.5 PFLOPs yoğun Rubin NVFP4 performansı bulunuyor.
Dahası, OpenAI Jalapeno'yu 700W TDP (Termal Tasarım Gücü) olarak derecelendirirken, aktif yapay zeka iş yükleri sırasında sürekli güç tüketimi genellikle 550W veya altında kalıyor.
Jalapeno'nun bu başarısını, modelin bir seferde yalnızca bir belirteç (kelime veya kelime parçası) işlediği Tek Tokan Tahmini (STP - Single-Token Prediction) mimarisiyle elde etmesi dikkat çekici. Bu, ASIC'in performans rakamlarını şişirmek için çoklu tokan tahmini (MTP) veya spekülatif kod çözme gibi mimari hilelere dayanmadığı anlamına gelir. Spekülatif kod çözmenin tokan başına maliyette yaklaşık 3 kat iyileşme sağladığını belirtmek gerekir.
Son bir not olarak, Jalapeno'nun HBM4 kullanırken, GB200 ve GB300 sistemlerinin HBM3E kullandığını belirtmekte fayda var. Bu durum, hafif de olsa OpenAI'ın ASIC'i lehine bir avantaj sağlıyor.