Bir teknoloji meraklısı, yerel büyük dil modelleri (LLM) için gürültülü ve artık pek kullanılmayan bir kurumsal ekran kartını (GPU) yeniden hayata döndürdü. Bu sayede, sadece 266 dolarlık bir harcamayla toplam ekran kartı belleğini (VRAM) 32 GB'a çıkardı. Özellikle çip kıtlığı döneminde bu, oldukça başarılı bir sonuç.
Oscar Molnar'ın aktardığına göre, 16 GB HBM2 belleğe sahip ucuz bir Nvidia Tesla V100 SXM2 modeli temin edildi. Ardından, bu kartı standart bir bilgisayar yuvasına takmak için bir SXM2-PCIe adaptörü ve kartın çim biçme makinesi kadar ses çıkaran soğutucusunu sessizleştirmek için bir PWM modifikasyonu yapıldı. Bu sayede, büyük yerel LLM projeleri için gerekli VRAM artışı sağlandı. Piyasada bu tür Tesla V100 GPU'lar, özellikle Çin'den alım yapıldığında 140 doların altında bulunabiliyor.
Elbette, bu bol VRAM'li Tesla V100 SXM2 kartını alıp doğrudan bilgisayarınıza takmak yeterli olmuyor. Molnar, eBay'den yaklaşık 66 dolara bir SXM2-PCIe adaptörü satın aldığını belirtiyor.
Ancak işler burada bitmiyor. Bu ekran kartının standart soğutucusunun çıkardığı "cehennemden gelen fan" sesi olarak tanımladığı gürültüden rahatsız olan maceraperest, karmaşık bir modifikasyona girişti. Geleneksel soğutucu, 82 desibel gibi yüksek bir ses seviyesine ulaşıyordu. Molnar bu sesi "çöp öğütücü ile çim biçme makinesi arasında bir yerde" olarak tanımlıyor. Mevcut fan kablolarının yeniden yönlendirilip anakartın PWM fan girişine bağlanmasıyla, fanın %10 gibi düşük bir hızda bile tam yükte Tesla V100'ü 50°C altında tutabildiği görüldü. Bu da sorunu çözdü.
27 Milyar Parametre Bir Dil Modeli Saniyede 32 Token ile Çalışıyor
Donanım ve modifikasyonlar tamamlandıktan sonra, Molnar 32 GB VRAM'e sahip bir sisteme kavuştu. Bu, örneğin RTX 4080'in 16 GB VRAM'ine kıyasla iki katı bir bellek demek. Tesla V100 modellerinin 32 GB VRAM'li olanlarının da bulunduğunu ancak fiyatlarının iki katına çıktığını belirtiyor.
Bu 32 GB VRAM'i LLM'ler için kullanmak pek zor olmamış. Kullanılan sistemde, hem Volta hem de Ada mimarilerini destekleyen eski bir Nvidia sürücüsü ile NixOS kullanılmış. Yapılan testlerde, 27 milyar parametreye sahip bir dil modeli saniyede 32 token hızında çalıştırılmış. Bu hızın "etkileşimli kullanım için yeterince hızlı" olduğu ve çoğu bulut tabanlı API alternatifinden daha iyi olduğu ifade ediliyor.