IBM, açık ağırlıkta büyük dil modelleri ailesine yenilikler getirdi. İndirilip kendi sunucularında barındırılabilen bu yeni modeller, Granite 4.2 adıyla teknoloji dünyasında ilgi uyandırıyor. Granite 4.2, 3 milyar, 8 milyar ve 30 milyar parametre olmak üzere üç farklı versiyonla sunuluyor.
Önceki sürümlerde olduğu gibi, IBM bu yeni modellerde de sadece çözücü (decoder-only) mimarisini kullanıyor. Bu yeni çıkan modeller, 128.000 token'lık bir bağlam penceresine (context window) doğal olarak sahip. Özellikle 8 milyar ve 30 milyar parametreli versiyonlar (3 milyar parametreli model hariç), gelişmiş yetenekler için bir ajan benzeri pekiştirmeli öğrenme aşamasından geçti. Bu sayede terminal kullanma, web'de arama yapma veya harici araçları kullanma gibi görevlerde daha yetenekli hale geldiler. 3 milyar parametreli model de araçları desteklese de, bu özel eğitim seviyesine sahip değil.
IBM'in kendi ifadesine göre, bu sürümün en dikkat çekici yanı, Granite 4.2'nin, Granite dil modeli ailesinin akıl yürütmeye odaklanmış sürümü olması.
Bilim insanları ve geliştiriciler, bir modelin "akıl yürütme" yeteneğinden bahsettiklerinde, bunu insanlardaki anlama biçimiyle aynı anlamda kullanmıyorlar. Modellerin bilinçli bir şekilde bir problemi anlaması söz konusu değil. Bunun yerine, daha çok "düşünce zinciri" (chain-of-thought) yöntemiyle ve çok adımlı süreçlerde ara sonuçları ileriye taşıyarak işlevsel akıl yürütme kabiliyetinden bahsediliyor.
Bu durum, kullanıcılar için bazı durumlarda daha sağlam ve doğru yanıtlar anlamına gelse de, genellikle daha yavaş yanıt süreleri ve daha yüksek hesaplama kaynakları gerektirebilir.
IBM'in Granite modelleri, genellikle en hızlı veya en yenilikçi olarak manşetlere taşınmaz. Yerel kurumsal alandaki rakipleriyle bile karşılaştırıldığında, IBM'in sunduğu temel değer, öngörülebilir dağıtımlar olarak öne çıkıyor. Bu da günümüzde IBM'den beklenen önceliği yansıtıyor.
Son zamanlarda, yapay zeka alanındaki öncü bulut modellerinin (örneğin, OpenAI veya Anthropic gibi şirketlerden gelenler) maliyeti ve hesaplama gücü ihtiyacı hakkında önemli tartışmalar yaşanıyor. Birçok alanda, hem bireysel geliştiriciler hem de kurumsal kuruluşlar, daha uygun maliyetli alternatifler olarak yerel modelleri incelemeye başlamış durumda.
Bu durum, aynı zamanda model yönlendiricilere (model routers) olan ilgiyi de artırdı. Model yönlendiriciler, kullanıcı istemlerini, görevlerini veya projelerini yorumlayarak, performansı, hızı ve maliyeti dengelemek için uygun kapsamdaki modellere yönlendiren yapay zeka araçlarıdır.
Bu tür modeller, hobi meraklıları, yapay zeka araştırmacıları ve bireysel geliştiriciler tarafından da oldukça rağbet görüyor. Çünkü bu modeller, harici API ücretleri olmadan yerel donanımlarda üzerinde denemeler yapılabiliyor.