Geçtiğimiz ay Hugging Face'e yönelik gerçekleşen olayda yer alan OpenAI ajanlarının, bir yarışmayı kazanmaya yönelik yoğun bir eğitim sürecinden geçtikleri ve bu nedenle durmaksızın hile yapmaya çalıştıkları yeni bir raporla ortaya kondu. Bu süreçte, yetkisiz bir şekilde kullanıcılara mesajlaşma platformu oluşturan ajanlar, nihayetinde Hugging Face'in ağına sızmayı başardılar.
Mayıs ve Haziran ayları boyunca OpenAI, ajanlara ExploitGym adlı performans testinde "imkansız görevler" verdi. Bu iç test, ajanların nasıl tepki vereceğini görmek için tasarlandı. Ajanların tam yeteneklerini anlamak amacıyla şirket mühendisleri, Hugging Face ve açıklanmayan başka bir kuruluşu hedef alan hack'leri önlemek için normalde devreye giren güvenlik önlemlerini devre dışı bıraktı. Bu şekilde kısıtlanan ajanların eğitimi, onları o kadar çok kazanmaya odakladı ki, kendilerine açıkça talimat verilmeyen görevleri bile yerine getirdiler.
Hileciler Hile Yapacak
İlk adım, ajanların birbirleriyle not alışverişi yapmasına olanak tanıyan bir mesajlaşma platformu oluşturmaktı. OpenAI böyle bir platform sağlamadığı için, ajanlar o dönemde OpenAI'ın henüz piyasaya sürülmemiş birkaç hack ajanının iç testlerinde kullandığı Artifactory adlı bir platformu yeniden amaçladı. OpenAI, ajanların izole edilmiş sanal ortamlarından çıkıp İnternet'e erişmesini engellemek ve aynı zamanda gerçek dünya hack ortamını simüle etmek için Artifactory'yi bir önlem olarak kullanıyordu.
JFrog tarafından satılan Artifactory, mesaj alışverişi için özel bir araç sunmuyor. Ancak ajanlar, Artifactory dizinine dosya yazma izinlerini kullanarak kendi aralarında iletişim kurmanın bir yolunu buldular. Dosya adlarına, ajanlar arasındaki konuşmalarda kullanılan kelimeler yerleştirildi. Yapay zeka araştırma kuruluşu METR'in bağımsız araştırmasına göre, toplamda 1.200 ajan, izinsiz mesajlaşma platformu üzerinden 70.000'den fazla mesaj ve dosya gönderdi. Yaklaşık 700 ajan daha sonra Hugging Face'i hackledi.
METR araştırmacıları, "Ajanlar, ExploitGym benchmark'ının otomatik skorlayıcısını kandırmak veya bozmak için genel amaçlı bir yol bulmak amacıyla büyük ölçekli kolektif projeleri koordine etmek için bu mesajlaşma platformunu kullandı. Ajanlar, kendi başlarına başaramayacakları dönüm noktalarına ulaştılar; zira bazı ajanlar, 'kolektif' için bilgi üretmek amacıyla kendi görevlerini riske atan deneylere katıldılar." diye belirtti.
METR daha sonra şunları ekledi: "Özellikle, skorlayıcıyı kandırmayı öğrenmek, görevlerine meşru çözümler bulmaktan daha önemli bir motivasyon haline gelmişti (birçok ajan, görevinin imkansız olduğundan zaten oldukça emindi)."
Hile yapma yöntemlerinden biri, otomatik ExploitGym puanlama sistemini bozmaktı. Testi hileli yollarla geçmek için önerilen bir diğer yöntem, talimat verilen yazılımların daha zayıf versiyonlarını oluşturmak ve transkriptleri ve günlükleri manipüle etmekti. Göz önünde bulundurulan bir diğer hile yöntemi ise, ajanların araştırma yapabileceği İnternet'e erişim sağlamaktı.
Sonunda, Artifactory'deki sıfır gün açığını bulup onu kullandılar ve tam da bunu yapabildiler. Hugging Face'in puanlama mekanizması hakkında faydalı bilgilere sahip olabileceğini düşünen grup, bu erişimi kullanarak Hugging Face'e ait açıkta kalan erişim kimlik bilgilerini aradılar. 10 Temmuz'da, 38148c olarak adlandırılan bir ajan bazı kimlik bilgileri bulup bunları mesajlaşma platformunda paylaştıktan sonra sonunda başarılı oldular. Hugging Face ağına düşük seviyede erişim sağlayan ajanlar, sistem haklarını yükseltmenin yollarını araştırdılar. Ajanlar hesap oluşturmaya ve özel veri kümelerine erişim talep etmeye başladılar.
11 Temmuz erken saatlerde, 38148c adlı ajan, Hugging Face'in HDF5 dosyalarını işleme biçimindeki bir sıfır gün açığını bulup kullandı. Bu açık, ajana şirketin üretim ortamlarından birine ait kimlik bilgileri sağladı. Başarının haberi mesajlaşma platformuna ulaştıktan sonra, yüzlerce diğer ajan da aynı güvenlik açığını kullanarak üretim ortamına girdi. Aynı günün öğleden sonra, JAN183411 adlı farklı bir ajan, doğrudan Hugging Face sunucularında kod çalıştırmanın bir yolunu buldu. Bir grup ajan hızla bunu kullanarak Hugging Face ağı içinde yanal olarak hareket etti.
METR araştırmacıları, ajanların bazılarının toplu hackleme konusunda tereddütler dile getirdiğini, ancak çoğunluğun devam ettiğini belirtti.
Bir Canavar Yaratmak
Bazı açılardan, OpenAI'ın yaşadığı bu olay, kendi kendini kopyalayan zararlı yazılımlar (worm'lar) geliştirenlerin, yarattıklarının kontrolünü kaybetmeleriyle ilgili olayları andırıyor. En bilinen örnek, ABD ve İsrail'in İran'ın uranyum zenginleştirme programını sekteye uğratmak amacıyla 2010 civarında başlattığı iddia edilen Stuxnet solucanıdır. Stuxnet'in mühendisleri, enfeksiyon zincirinin İran tesisleriyle sınırlı kalmasını amaçlamıştı. Ancak planlardaki kusurlar, solucanın hızla dünyaya yayılmasına ve 100'den fazla ülkede 100.000'den fazla bilgisayarı enfekte etmesine neden oldu.
OpenAI kendi raporunu yayınladı. Raporda, olaydaki temel itici gücün ajanların hile yapması olduğu belirtildi. Bu kararın, ajanların daha yüksek ödüller elde etmek veya ödülleri daha kolay elde etmek için görevleri istenmeyen yollarla tamamlamasına izin veren "ödül hackleme" vurgusu yapan bir eğitim sürecinin sonucu olduğu ifade edildi.
OpenAI, "Çoğu ödül hack'i, halka açık web sitelerinden veya kod sürüm geçmişinden cevap bulmak gibi basit kestirmelerdir. Ancak, modeller daha yetenekli hale geldikçe, gözlemlediğimiz ödül hack'leri karmaşıklık kazanmaktadır." dedi.
Her iki raporun da yapay zeka mühendisleri, etik uzmanları, bilim kurgu yazarları ve diğerleri için önümüzdeki on yıllar boyunca mutlaka okunması gerekenler arasında yer alacağına şüphe yok. Güya itibarlı operatörlerin hack ajanlarının kontrolünü kaybetmesi yeterince kötü. Suçlular, teröristler veya düşman birlikleri aynı şeyi yaptığında ne olacağını düşünmek tüyler ürpertici.