Ara

NVIDIA’nın Yapay Zekası AVO: Talimatsız 183 Bulmacayı Kusursuz Tamamladı!

NVIDIA'nın yapay zeka alanındaki yetenekleri her geçen gün daha da parlıyor. Şirketin geliştirdiği AVO kodlama ajanı, herhangi bir ön talimat almadan ARC-AGI-3 halka açık veri setindeki tam 183 bulmacayı %100 başarıyla çözerek dikkatleri üzerine çekti. Bu başarı, yapay zeka modellerinin etrafına örülen 'koşumların' (harness) ne kadar kritik olduğunu bir kez daha gözler önüne serdi.

AVO, Claude Opus 5 Modelini Farklı Bir Boyuta Taşıyor

AVO, aslında Anthropic'in Claude Opus 5 modelinin etrafına inşa edilmiş bir yapay zeka koşumu olarak tanımlanabilir. Ancak asıl çarpıcı nokta, Opus 5 modelinin aynı veri setinde sadece %30 başarı oranına ulaşabilmişken, AVO'nun kusursuz bir %100'lük skora imza atması.

Yapay zeka dünyasında 'koşum' (harness), mevcut bir yapay zeka modelinin etrafına inşa edilen harici bir yazılım katmanı olarak düşünülebilir. Modeli bir beyin olarak hayal edersek, koşum da bu beyni dış dünyayla etkileşime geçiren, ona araçlar sağlayan bir 'zırh' gibidir. Bu zırh, genel bir metin tahmincisini etkili bir problem çözücüye dönüştürür.

Etkili bir koşum şu temel işlevleri yerine getirir:

  1. Yapay Zeka Modelini Dış Dünya ile Bağlar: Genel bir yapay zeka modeli, kendi başına bir web sayfasını göremez, bir Python betiğini çalıştıramaz veya bir dosya ile etkileşim kuramaz. Ancak bir koşum sayesinde bu etkileşimler mümkün olur.
  2. Kendini Düzelten Döngüler Oluşturur: Karmaşık problemlerin deneme yanılma yoluyla çözülmesini sağlar. Koşum, her denemenin sonucunu modele geri besleyerek iterasyon yapılmasına olanak tanır.
  3. Uzun Süreli Belleği Yönetir: Yapay zeka modelleri, bağlam penceresi büyüdükçe önceki bilgileri unutma eğiliminde olabilir. Koşum ise bir not defteri gibi davranarak başarılı kod parçacıklarını kaydeder, işe yaramaz hataları filtreler ve modelin düşünce akışını kaybetmemesi için ilerleme kaydını temiz tutar.
  4. Girdileri ve Kısıtlamaları Yapılandırır: Modelin nasıl düşünmesi gerektiği konusunda katı kurallar uygular.

İşte bu noktada konunun özüne geliyoruz. AVO kodlama ajanı, temel olarak Anthropic'in Claude Opus 5 modelinin üzerinde çalışan bir koşumdur. NVIDIA, AVO'yu başlangıçta CUDA GPU çekirdeklerini optimize etmek için geliştirmişti. Bu süreçte ajan, 7 gün boyunca otonom olarak çalıştı, 500'den fazla yöne keşif yaparak FlashAttention-4'ten %10,5'e kadar daha iyi performans gösteren çekirdekler üretti.

Temel ajan mimarisini değiştirmeden, NVIDIA GPU mühendislik araçlarını ARC-AGI-3 görev arayüzü ile değiştirdi. Ajan, kod inceleme ve kendini düzeltme mantığını tamamen alakasız bir görsel ve etkileşimli mantık bulmacasına başarıyla aktardı. Böylece ARC-AGI-3 halka açık veri setindeki 183 bulmacayı %100 doğrulukla ve hiçbir ön talimat veya hedef olmaksızın çözmeyi başardı. Opus 5 modelinin aynı görevde yalnızca %30 gibi bir skor elde ettiği düşünüldüğünde, AVO etkili bir koşumun ne kadar muazzam bir değer katabileceğini ortaya koymuş oldu.

NVIDIA'ya göre AVO, 183 seviyeyi toplamda 6.624 eylem kullanarak çözdü. Bu, VISTA gibi diğer önde gelen ajan koşumlarına kıyasla %12'lik bir verimlilik artışı anlamına geliyor. Zira VISTA, aynı halka açık veri setini tamamlamak için 7.542 eyleme ihtiyaç duymuştu.

ARC-AGI-3 değerlendirme platformunun şu anda özel olarak hazırlanmış harici ajan koşumlarının gizli özel seti üzerinde çalışmasına izin vermediğini belirtmek gerekir. Bu da AVO'nun bu daha alakalı veri setindeki performansının henüz bilinmediği anlamına geliyor.

Önceki Haber
Gizemli Yapay Zeka Laboratuvarı Ox Alpha'yı Ücretsiz Sundu: 100 Trilyon Token Günlük Kapasiteyle Sektörü Sallıyor

Benzer Haberler: