Ara

Qualcomm CEO’dan Şaşırtıcı Tahmin: 2028’de Telefonlarda 100 Milyar Parametreli Yapay Zeka Modelleri Çalışacak!

Akıllı telefonlarda daha büyük yapay zeka modellerini çalıştırmanın önündeki en büyük engel bellek kapasitesi. Mevcut DRAM durumu göz önüne alındığında, 16 GB sınırını kısa sürede aşmamız pek olası görünmüyor. Ancak Qualcomm CEO'su Cristiano Amon, kısa süre sonra sürekli olarak 100 milyar parametreli büyük dil modellerini (LLM) çalıştırabilen telefonların olduğu bir döneme gireceğimize inanıyor. Amon, yapay zeka şirketlerinin bu başarıyı elde edebilecek akıllı telefonlar üzerinde çalıştığını doğruluyor. Daha yoğun modelleri çalıştırmanın pratikliği konusunda ise Amon, telefon üreticilerinin özellikle tedarikin kısıtlı olduğu ve fiyatların tavan yaptığı durumlarda bol miktarda RAM entegre edeceğini belirtti.

2028'e Kadar Akıllı Telefonlarda 100 Milyar Parametreli LLM'leri Çalıştırmanın Tek Yolları: Flash Bellekten Akış veya Seyrek MoE Yapay Zeka Modellerini Çalıştırmak

Fireside Alpha'ya konuşan Cristiano Amon, 100 milyar parametreli LLM'leri çalıştırabilen akıllı telefonlar isteyen yapay zeka şirketlerinin isimlerini açıklamadı. Ancak cihazların bu yapay zeka modellerini 2028'de çalıştırabileceğine dair iddialı açıklaması kesinlikle olağanüstü bir görev. Bellek krizi nedeniyle, akıllı telefon üreticilerinin birçoğu daha yüksek RAM varyantlarını sunmaktan kaçındı, oysa sadece bir yıl önce Android cihazlar tam 24 GB LPDDR5X bellek ile övünüyordu.

Sayıları hesaplasak bile, 4-bit niceleme (quantization) ile sıkıştırılmış 100 milyar parametreli bir modeli çalıştırmak, bir akıllı telefonun işletim sistemi, uygulamalar ve önbellek için yeterli bellek alanı bırakarak en az 50 GB RAM'e sahip olmasını gerektirir. 2-bit nicelemeli bir model hala imkansız bir hedef çünkü akıllı telefonların yalnızca 100 milyar parametreli LLM için 25 GB belleğe sahip olması gerekecek. DRAM maliyeti ve tedarik engellerinin de bu duruma eklendiğini varsaysak bile, daha yoğun modelleri sürekli çalıştırmanın aşırı ısınmaya yol açarak termal kısıtlamalara neden olduğu gerçeğini henüz hesaba katmadık.

Yongaset (chipset) paketlemesindeki bir kaymayla bu soruna bir ölçüde yanıt verilmiş olsa da, 100 milyar parametreli modelleri ciddi şekilde çalıştırmak için daha benzersiz yaklaşımlar benimsenmediği sürece asıl bellek darboğazı varlığını sürdürecektir. Örneğin, agresif niceleme bellek gereksinimlerini önemli ölçüde azaltabilir, bu da 1-bit varyantların DRAM'e sığabileceği anlamına gelir. Ne yazık ki, LLM'lerin kalitesi, özellikle akıl yürütme görevlerinde, 4-bit nicelemenin ötesine geçildiğinde önemli ölçüde düşer.

Başka bir alternatif ise MoE (Uzmanlar Karışımı) ve uzman boşaltma (expert offloading) yöntemidir. Bu yöntemde, her bir token (kelime parçacığı) için uzmanların yalnızca küçük bir kısmı aktif olur ve RAM'de kalırken, geri kalanı flash depolamada bulunur. Flash depolama demişken, cihazların dahili belleğinde LLM'leri çalıştırmaya yönelik araştırmalar yapılmış olsa da, çıkarım (inference) hızları UFS ve NVMe depolamanın DRAM'den daha yavaş olması nedeniyle düşebilir.

20 milyar ila 30 milyar parametreli sıkıştırılmış bir model, akıllı telefonlarda çalışırken 100 milyar parametreli bir modelin kalitesine yaklaşabilir. Bu, şirketler için en pazarlanabilir strateji gibi görünüyor çünkü en gerçekçi olanı budur. Ne yazık ki, Qualcomm CEO'sunun bu tür açıklamalarda bulunup bir yol haritası çizmemesi, akıllı telefonlarda daha yoğun modelleri çalıştırma hedefine bizi yaklaştırmayacak olsa da, bu cihazların daha büyük makinelerle aynı yeteneklere sahip olduğunu hayal etmek yine de güzel bir düşünce.

Önceki Haber
RTX Spark Gücüyle Tanışın: Surface Laptop Ultra'nın En Üst Donanımı Stokları Tüketti!

Benzer Haberler: