Meta, bir zamanlar öncülük ettiği ancak daha sonra önceliklerini yanlış belirlediği için büyük ölçüde terk ettiği açık ağırlıklı yapay zeka modelleri kategorisine, piyasaya sürdüğü Muse Glimmer açık ağırlıklı modeliyle güçlü bir dönüş yapıyor. Yaratıcı hileler kullanan bu model, tek bir tüketici GPU'suna sığabilmesi ve sorgulara yıldırım hızında yanıt verebilmesiyle dikkat çekiyor.
Muse Glimmer'ın Tek Tüketici GPU'suna Sığması İçin Damıtma Kullanıldı, Küçük Bir Yardımcı Model Yanıt Sürelerini Hızlandırıyor
Meta, Google'ın Gemma 4 ve Alibaba'nın Qwen 3.6 gibi modelleriyle rekabet etmeyi amaçlayan, 30 milyar parametreli açık ağırlıklı yapay zeka modeli Muse Glimmer'ı piyasaya sürdü.
Bilgi olmayanlar için, ağırlıklar bir modelin herhangi bir kavrama ne kadar önem vermesi gerektiğini belirtir ve modelin bilgi tabanının tüm genişliğini temsil eder.
Meta'nın Muse Glimmer'ı iki ana nedenden dolayı öne çıkıyor. Birincisi, 30 milyar parametreli bir modeli tam hassasiyette (fp16) çalıştırmak için sadece model ağırlıkları için yaklaşık 60GB (30x10⁹x2) belleğe ihtiyaç duyulur. Ancak Meta, daha büyük bir modelin (Muse Spark) daha küçük bir modeli eğiterek birçok yeteneğini aktarması anlamına gelen damıtma yoluyla nicelleştirme kullanarak, model ağırlıkları için bellek gereksinimlerini 20GB'a düşürmeyi başardı. KV önbelleği için gereken 2GB ila 4GB ile birlikte, bu gereksinimler 24GB veya 32GB'lık bir tüketici ekran kartının Muse Glimmer'ı rahatlıkla çalıştırabilmesi için yeterince mütevazıdır. Meta'ya göre, bu damıtma yoluyla model sıkıştırması performansta fark edilebilir bir etki yaratmıyor.
İkincisi, token üretimi (yanıt süreleri) hızlandırmak için Muse Glimmer, DFlash drafter modeli adı verilen küçük bir yardımcı model kullanıyor. Bu model, metnin tüm bölümlerini tahmin ediyor, böylece Muse Glimmer cevabı tek seferde kontrol edebiliyor, doğru metin yanıtlarını korurken hatalı olanları atıyor. Bir cevabı kontrol etmek, bir cevabı üretmekten çok daha hızlı olduğu için, bu düzenleme bir RTX 5090 kartında 3.1 kat, M5 Max'te 1.8 kat ve M4 Max'te 1.5 kat daha hızlı yanıt verilmesini sağlıyor. Bu veriler Meta tarafından açıklandı.
Elbette, Meta'nın Muse Glimmer'ı Batı açık ağırlıklı yapay zeka modeli manzarası için daha uygun bir zamanda gelemezdi. Ne de olsa, OpenRouter'dan alınan verilere göre, Çin yapay zeka modelleri yakın zamanda haftalık 34.25 trilyon token seviyesini ilk kez geçti, DeepSeek'in V4 Flash modeli ise şaşırtıcı bir şekilde %570 haftalık büyüme kaydetti.
03 Ağustos'ta başlayan haftaya ait en son OpenRouter veri setine göre, küresel yapay zeka modeli kullanımı haftalık bazda %21.48 artışla 69 trilyon tokene ulaştı. Bu toplamın 34.25 trilyonu Çin modellerine aitken, ABD modelleri bu kümülatif rakama yalnızca 9.17 trilyon token katkıda bulundu. Kritik olarak, bu Çin modellerinin küresel sayıyı on beşinci ardışık hafta boyunca önde götürmesiydi.
Sonuç olarak, Meta'nın Muse Glimmer'ının Çin açık ağırlıklı yapay zeka modellerinin amansız yükselişi üzerinde gözle görülür bir etkisi olup olmadığını görmek için gelecek haftanın rakamlarına yakından bakacağız.