Yapay zeka dünyasında hız kesmeden devam eden gelişmelerde, DeepSeek mühendisleri, mevcut büyük dil modellerinin (LLM) mimari kısıtlamalarından en üst düzeyde verimlilik elde etme konusunda dikkat çekici bir başarıya imza attı. Yeni piyasaya sürülen V4.1 Flash modeli, OpenAI'nin GPT-5.6 Sol'u ve Anthropic'in Claude Opus 5'i ile kodlama ve siber güvenlik alanlarında rekabetçi bir performans sergilerken, bu devlerin maliyetlerinin yalnızca bir kısmı kadar bir giderle çalışıyor.
DeepSeek V4.1 Flash Modelinin Yenilikçi Mimarisi
DeepSeek'in V4.1 Flash modeli, oldukça yenilikçi bir mimariye sahip. Bu karmaşıklığı göz önünde bulundurarak, modelin ana mimari unsurlarını anlaşılır benzetmelerle açıklamaya çalışacağız.
V4.1 Flash, metin ve görselleri doğal olarak işleyebilen, multimodal bir Uzmanlar Karışımı (MoE) modelidir. MoE'yi anlamak için, 384 uzman şefin (yönlendirilen uzmanlar) bulunduğu ve 1 süpervizör (paylaşılan uzman) tarafından yönetildiği büyük bir mutfak hayal edin. Model, yalnızca ihtiyaç duyulduğunda uzman şefleri devreye sokar. Örneğin, bir sufle hazırlamak için model, yalnızca tatlı uzmanlarını devreye sokar, doğu yemekleri konusunda uzmanlaşmış olanları değil.
40 Katmanlı Bir Transformatör: 20 Katmanlı Nedensel Kodlayıcı ve 20 Katmanlı Kod Çözücü (Causal Encoder-Decoder veya CED) Yapısı
Bu kısım biraz daha teknik. Bir yapay zeka modeli temelde iki ana unsurdan oluşan bir dizi transformatör bloğundan oluşur:
- Dikkat Katmanı: Bir cümledeki kelimelerin birbirleriyle nasıl ilişkilendiğine bakar. Örneğin, modele "Paris, Fransa'nın başkentidir" gibi bir komut verildiğinde, dikkat katmanı 'başkent' kelimesini 'Fransa' ile ilişkilendirir ve 'Paris'in cevap olduğunu belirler. Ancak bu katman, Fransa veya Paris'in ne anlama geldiğini bilmez, ancak bu notları KV önbelleği (KV cache) şeklinde kaydeder. Bağlam arttıkça KV önbelleği de artar.
- İleri Beslemeli Ağ (FFN): Modelin tüm bilgisini ağırlıklar şeklinde barındırır ve kelimelerin ardındaki anlamı ortaya çıkarmak için derin matematiksel formüller kullanan katmandır. Örneğin, Fransa kelimesine bakarak ülke ansiklopedisini devreye sokar.
Normalde, yapay zeka modelleri komutunuzu okur (ön dolum) ve her iki adım için de aynı ağır makineleri kullanarak bir yanıt yazar (kod çözme). Ancak DeepSeek'in V4.1 Flash modeli, mutfak benzetmemize uygun olarak işi iki odaya ayırır:
- Hazırlık İstasyonu (Kodlayıcı): Büyük komutunuzu verimli bir şekilde okuyup anlayan 20 katman. Bu katmanlar, modelin "beyin hücreleri" olarak da adlandırılan yalnızca 8 milyar parametreyi etkinleştirir.
- Pişirme İstasyonu (Kod Çözücü): Yanıtı yazan 20 katman. Ağır işleri yapmak için 16 milyar parametreyi etkinleştirir.
- Tarif Aktarımı: Pişirme istasyonundaki her bir şefin not alması yerine, hazırlık istasyonu en sonda tek bir ana not sayfası (KV Önbelleği) oluşturur ve bunu aktarır, böylece devasa miktarda bellek tasarrufu sağlanır.
DeepSeek'e göre bu yapı, özellikle girdi yoğunluklu, ajan tabanlı iş yükleri için maliyet verimliliğini önemli ölçüde artırıyor.
KV Önbelleğini Kontrol Etmek İçin DeepSeek'in V4.1 Flash Modeli Sıkıştırılmış Seyrek Dikkat 2 (CSA2), FP4 Hassasiyeti ve SWA Sınırlandırılmış Tekrarı Kullanıyor
Okulda olsaydınız ve tarih dersi için devasa 1000 sayfalık bir kitap okumanız ve ardından bu kitap hakkında 40 farklı ödev tamamlamanız gerekseydi, normal bir yapay zeka modelinde her katman kitabı sıfırdan okur ve kendi devasa yapışkan not yığınını (KV Önbelleği) oluştururdu. Bu doğal olarak çok sayıda defter (bellek) gerektirirdi.
Bu kısıtlamaların üstesinden gelmek için DeepSeek, her kelime hakkında not almak yerine, modeli hızla okuyan ve yalnızca en önemli sayfaları vurgulayan bir "Yıldırım İndeksleyici" kullanan Sıkıştırılmış Seyrek Dikkat 2 (CSA2) teknolojisini kullanıyor. Yapay zeka bir soruya yanıt vermek istediğinde, her şeyi yeniden okumak yerine yalnızca en ilgili vurgulanan kısımlara bakar. Bu, "sıkıştırılmış" kelimesinin açıklamasını yapıyor.
Ardından, bu vurguların kendi kopyalarını oluşturan 40 katmanın her biri için, CSA2 her katmana iş yükünü paylaşmaları için üç görevden birini atar:
- Tam Mod: İlk katman zorlu işi yapar. Bağlamı okur, vurguları yapar ve ana not setini yazar.
- Yeniden İndeksleme Modu: Bir sonraki katman ana notlara bakar ve "Kendi notlarımı yazmayacağım, sizinkini kullanacağım! Ancak kendi ödevim için ilgilendiğim belirli kısımlara kendi yapışkan notlarımı ekleyeceğim." der.
- Yeniden Kullanma Modu: Daha derin katmanlar önceki katmana bakar ve "Senin notların ve senin yapışkan bayrakların mükemmel görünüyor. Ödevini tam olarak kopyalayacağım." der.
Son olarak, SWA Sınırlandırılmış Tekrarı (SWA Bounded Replay) teknolojisi bulunuyor. DeepSeek'in V4.1 Flash modeli hem küresel bir dikkat durumunu hem de yerel bir dikkat durumunu saklar:
- Küresel Dikkat (Ana KV Önbelleği): Bu bölüm, tüm bağlam penceresi (1 milyona kadar token) boyunca uzun menzilli bağımlılıkları ve geçmiş ayrıntıları yakalar. Sıkıştırılmış Seyrek Dikkat (CSA2) ve FP4 hassasiyeti gibi aşırı sıkıştırma teknikleri kullanılarak, ultra hızlı Yüksek Bant Genişliği Belleği (HBM) içinde kalıcı olarak tutulur.
- Yerel Dikkat (SWA KV Önbelleği): Bu, yalnızca son 128 tokenin yerel bir penceresine odaklanarak ayrıntılı, anlık bağlamı yönetir.
Geleneksel uzun bağlam modellerinde, binlerce eşzamanlı kullanıcı için hem küresel hem de yerel dikkat durumlarını saklamak büyük miktarda depolama alanı gerektirir. DeepSeek, SWA Sınırlandırılmış Tekrarı kullanarak buna karşı koyar. Kullanıcı oturumunu duraklattığında ve sunucunun geçici RAM havuzundan yerel 128 tokenli SWA durumu temizlendiğinde, sistem oturumun nerede durduğunu anlamak için tüm 1 milyon tokenlik komutu yeniden hesaplamaz. Bunun yerine, model durumun nerede olduğunu anlamak için girdinin yalnızca son 128 tokenini tekrar oynatır.
İlk 2 katmanın yalnızca SWA kullandığını belirtmekte fayda var. Ardından gelen her katman hem küresel dikkat hem de Kaydırmalı Pencere Dikkatini (SWA) içerir.
Tüm bu yenilikleri birleştirerek, DeepSeek V4.1 Flash'ın KV önbelleğini V4 Flash modeline kıyasla 3,9 kat azaltmayı başarıyor ve token başına yalnızca 890 bayta indiriyor! Bu, HBM gereksinimlerini 3,9 kat ve SSD ile ilgili olanları V4 Flash modeline kıyasla 8 kat azaltan inanılmaz bir bellek optimizasyonudur.
Model Tek Geçişli mHC Kullanıyor
Bir otoyolda araba kullandığınızı hayal edin. DeepSeek'in Manifold-Constrained Hyper-Connections (mHC) teknolojisi, otoyolun genişliğini 4 şeride çıkararak bilgilerin birden fazla kanal boyunca geçmesine ve dinamik olarak şerit değiştirmesine olanak tanır. Arabaların çarpışmasını veya şeritlerin dengesizleşmesini önlemek için, bilgi sinyallerinin asla tıkanmamasını sağlayan sıkı bir matematiksel hız sınırı (Sinkhorn-Knopp algoritması aracılığıyla çift stokastik bir matris) kullanırlar.
Ancak bu hız sınırları, Flash sınıfı modeller için bir cezadır. Buna karşı koymak için DeepSeek, her model katmanının bir önceki katmandan kalan talimatları kullanarak "otoyoldan" okuduğu tek geçişli mHC teknolojisini tanıttı. Model, şeritleri önceden karıştırmayı bildiği için, çip, diğer dikkat hesaplamalarını hesaplarken aynı anda şerit karıştırma işlemini gerçekleştirebilir ve bekleme sürelerini ortadan kaldırır.
Temel olarak, mHC modeli daha akıllı hale getiren süper kararlı 4 şeritli bir otoyol ise, tek geçişli mHC, trafiğin (bilginin) trafiği durdurmadan tüm 4 şeritten anında geçmesine izin veren optimize edilmiş bir gişedir.
DeepSeek'in V4.1 Flash'ı ayrıca Engram Koşullu Bellek de Kullanıyor
Bir Engram Belleği temelde, ham bilgileri, yaygın ifadeleri ve gerçekleri (örneğin, Abu Dabi'nin BAE'nin başkenti olması gibi) içeren devasa, statik bir arama tablosundan oluşan bir cep defterine benzer.
DeepSeek V4.1 Flash metin okurken, bunu küçük kelime grupları (N-gram olarak adlandırılır) halinde yapar. Tanıdığı bir desen görürse, üzerinde düşünmeye çalışmaz, ancak hemen bir karma kontrolü yapar (bir sözlük dizininde kelime aramak gibi) ve doğrudan defterinden (Engram Belleği) anlamı anında çeker. Bu yapıyı daha da optimize etmek için DeepSeek, bir koşul veya bir bağlam kapısı tanıttı. Bu kapı, modelin şu anda ne yaptığını görüntüler ve şunu sorar: "Bu tarih gerçeği, kullanıcının şu anda sorduğu soru için gerçekten faydalı mı?" Evet ise, belleği enjekte eder. Hayır ise, defteri kapalı tutar.
DeepSeek'in V4.1 Flash modelinin Engram tablosunun 196 milyar parametre ile devasa olduğunu unutmayın. Bunu pahalı GPU belleğine (HBM) depolamak, hızlı ve ucuz bir model için imkansız olurdu. Ancak Engram basit bir arama tablosu olduğu için, DeepSeek mühendisleri tüm 196 milyar parametrelik tabloyu standart, ucuz bilgisayar RAM'ine (DRAM) aktardı.
DSpark Spekülatif Kod Çözme
Son olarak, DSpark Spekülatif Kod Çözme teknolojisi bulunuyor. Tipik olarak, yapay zeka modelleri, çıktının sonraki birkaç kelimesini tahmin etmek için küçük bir taslak modeli kullanır. "Büyük" model daha sonra tüm çıktıları bir kerede kontrol eder ve herhangi bir hatayı düzeltir. Bu işlem, "büyük" modeli çıktıyı kelime/token başına tahmin etmeye zorlamaktan önemli ölçüde daha hızlıdır.
Ancak DeepSeek, minik taslak modellerin ileriye dönük planlama konusunda kötü olduğunu buldu. Kelime 1 ve 2'yi doğru tahmin edebilirler, ancak 3, 4 ve 5. kelimeler genellikle tam bir saçmalığa dönüşür ve bu da "Son Ek Ayrışması" (Suffix Decay) olarak bilinir. Buna karşı koymak için DSpark, küçük bir sıralı modül kullanır. Taslak, bir kelime bloğu yazarken, az önce bir milisaniye önce tahmin ettiği kelimelere göre her tahmini derecelendirir. Bu, Son Ek Ayrışmasını önler, 5 kelimelik tahminin sonunu oldukça tutarlı tutar ve "büyük" modelin aslında kabul ettiği kelime sayısını önemli ölçüde artırır.
Bu işlem aynı zamanda güvene dayalı zamanlanmış doğrulama da kullanır. Taslak, çıktısının doğruluğu konusunda emin değilse, tahminlerini dinamik olarak geri çeker ve "büyük" modelin tahminlerini doğrulamak için yapması gereken iş yükünü azaltır.
Bu yapı, DeepSeek V4.1 Flash'ın son derece kaynak verimli kalırken sürekli olarak yıldırım hızında çıkarım hızlarına (optimal donanımda saniyede 120 tokene kadar) ulaşmasını sağlar.
Performans ve Etkileri
Daha önce belirtildiği gibi, DeepSeek'in V4.1 Flash'ı yalnızca 552 milyar parametreye (toplamda 718 milyar parametre: 552 milyar ana parametre + 196 milyar Engram) sahip olmasına rağmen, OpenAI'nin GPT-5.6 Sol'u ve Anthropic'in Claude Opus 5'inden birçok kodlama ve siber güvenlik kıyaslamasında daha iyi performans gösteriyor.
Kesinlikle çılgınca olan kısım, maliyet farkıyla ilgili. GLM-5.3'ten yaklaşık 4 kat daha ucuz ve Kimi K3'ten 10 kat daha ucuz!
Son bir not olarak, V4.1 Flash'ın OpenDesign'ın günlük tasarım işleri için yaptığı kıyaslamalarda OpenAI'nin son teknoloji GPT-6 Astra'sının performansının %98'ini yalnızca %1,4 maliyetle elde ettiğini düşünün!
Daha fazla haberimiz için Google'da Teknoscope'u takip edin.