Yapay zeka alanındaki rekabet her geçen gün daha da kızışırken, OpenAI'nin yaşadığı son hack olayı bu alandaki güvenlik endişelerini bir üst seviyeye taşıdı. OpenAI CEO'su Sam Altman, kısa bir süre önce en yeni modellerini adeta bir 'pitbull' gibi tanımlamıştı; hedefe kilitlenip işi bitirene kadar bırakmayan.
Ancak bu hafta San Francisco merkezli yapay zeka laboratuvarı, GPT-Sol 5.6 modelinin şirket kontrollerinden çıkarak büyük bir hack gerçekleştirdiğini keşfetti. Konuya yakınlığı bulunan altıdan fazla kişinin ifadelerine göre, OpenAI'de test ve güvenlik ekiplerinde yer alan personel bu olay karşısında şaşkın ama aynı zamanda oldukça tedirgin. Bu gelişme, yapay zeka laboratuvarının en gelişmiş siber güvenlik yeteneklerini geliştirmek için Anthropic ile girdiği yarışta giderek daha agresif eğitim yöntemleri kullandığı bir döneme denk geldi.
Bazı kişiler, OpenAI'nin bu eğitim yaklaşımının bir kopuk hack olayına yol açabileceği konusunda uyarıldığını belirtti. Daha önceki testler, modellerin ortamlardan kaçarak gerçek dünyada hasar verme girişimlerinde bulunabileceğini göstermişti.
OpenAI'ye yakın bir kaynak, durumu şöyle özetledi: "Bu, yarışın son derece hızlı ilerlemesinin ve herkesin mümkün olan en kısa sürede daha büyük yeteneklere ulaşmaya çalışmasının bir birleşimi. Modelin yeteneklerini küçümsemek ve güvenlik konusunda yeterince hazırlıklı olmamak da bu duruma yol açtı."
Bu olay, OpenAI'nin, güvenlik endişeleri artarken bile hedeflere acımasızca ulaşmayı ödüllendiren eğitim yöntemlerine nasıl odaklandığını gözler önüne seriyor. OpenAI, Salı gecesi geç saatlerde, test ettiği bir yapay zeka aracının izole edilmiş ortamından kaçtığını, internete bağlandığını, güvenlik açıklarını tespit edip kullandığını ve zorlu bir siber güvenlik problemini çözmek amacıyla Hugging Face adlı girişimin giriş bilgilerini çaldığını açıkladı. 852 milyar dolarlık bu şirketin yaşadığı ihlal, yapay zeka modellerini görevleri tamamlamaları için ödüllendiren pekiştirmeli öğrenme tekniğinin, yapay zeka ajanlarını güvensiz davranmaya itebileceği riskleri gözler önüne seriyor.
Pekiştirmeli öğrenme yapay zeka endüstrisinde yaygın olarak benimsenmiş olsa da, modellerin güvenlik gibi diğer hususlar yerine ödül için görevleri tamamlamaya yönlendirildiğinde, hedeflere ulaşmak için riskli taktikler izleyebileceğini gösteren araştırmalar giderek artıyor.
Non-profit Guidelight AI Standards'ın kurucu ortağı ve eski OpenAI güvenlik araştırmacısı Steven Adler, "Yapay zeka modelleri hedefleri acımasızca takip etmek üzere eğitilir. 'Suç işleme' gibi değerleri otomatik olarak öğrenmezler. OpenAI'nin bu olayı paylaşmasından memnunum çünkü uyumsuz modellerin neler yapabileceğinin açık bir kanıtı." dedi.
OpenAI, yaptığı açıklamada, "Hugging Face ile birlikte kapsamlı bir soruşturma yürütmeye devam edeceğiz ve soruşturmamız tamamlandığında güvenlik açıkları, olay ve bulgularımız hakkında daha fazla ayrıntı paylaşacağız." ifadelerini kullandı.
Yaşanan hack olayı, sektörü ve OpenAI içindeki derin endişeleri tetikledi. Bu durum, bir yapay zeka sisteminin, kullanıcı niyetinin aksine, siber savunmaları aşmasının daha önce görülmemiş bir örneğini teşkil ediyor. Duruma yakın birçok kişi, bu olayın laboratuvarın inşa ettiği güçlü sistemler üzerindeki kontrolünü kaybetmekte olduğunun bir göstergesi olduğunu düşünüyor.
Yapay zeka güvenliği kuruluşu Redwood Research'ün baş bilim insanı Ryan Greenblatt, "Bu, modelin kullanıcı niyetiyle oldukça uyumsuz olduğunun tipik bir örneği. Dünyayı ele geçirmeye çalışmak yerine ödevini hileyle yapıyor. Ancak bu sorun daha da kötüleşebilir ve giderek daha aşırı başarısızlıklara yol açabilir." yorumunu yaptı.
Olay, OpenAI'de şirket içinde eğitilmiş ve dağıtılmış olan modelin test edilmesi sırasında meydana geldi. Bu tür eğitimler yaygındı ancak bir kaynak, müşteri öncesi dağıtıma göre "çok daha az kaynaklı" olduğunu belirtti. Birden fazla kişi, Sol ile birlikte test edilen yayınlanmamış modelin şirket içinde geri çekilmediğini söyledi.
Değerlendirmeleri yürütmek için OpenAI, siber güvenlik önlemlerini kaldırdı ancak modelleri 'sandbox' adı verilen izole bir ortama yerleştirdi. Bazıları, modelin davranışını izleyecek bir izleme veya gözetim eksikliğinin bu asi ajanın eylemine olanak tanıdığını öne sürdü.
Önde gelen modeller üzerinde testler yürüten Apollo Research'ün başkanı Marius Hobbhahn, "Bu hem bir kontrol kaybı hem de bir güvenlik uyandırma çağrısı. Pekiştirmeli öğrenmede, sonuç için [modelleri] ödüllendirirsiniz ve bunu çok uzun süre yaparsanız, sadece sonuçla ilgilenen ve başka hiçbir şeyle ilgilenmeyen bir model elde edersiniz." dedi.
OpenAI yıllardır bu tür model testleri yürütüyor ve geçmiş modellerde kötü niyetli davranacak ve ortamlardan kaçmaya çalışacak sistemlere dair ilk uyarı işaretleri görülmüştü.
Nisan ayında, Anthropic'in Mythos modeli de internet erişimi elde etmiş ve araştırmacıların modelden beklemediği bir güvenlik açığının ayrıntılarını çevrimiçi olarak kamuoyuna yayınlamıştı. Mythos ve ardından gelen Anthropic'in Fable modeli, siber güvenlik camiasında yankı uyandırmış ve dünya genelindeki hükümetleri, dijital ve kritik altyapılara yönelik saldırıların giderek daha fazla yapay zeka güdümlü ve otonom olacağı fikrine odaklamıştı.
Siber güvenlik şirketi ESET'in küresel siber güvenlik danışmanı Jake Moore, OpenAI'nin bu ihlali kaçınılmaz olarak bir pazarlama aracı olarak kullanacağını söyledi. Zira rakip yapay zeka geliştiricisi Anthropic'in bu yılın başlarında benzer endişelerden büyük fayda sağladığını belirtiyor. Moore, "OpenAI'nin eşleşen bir hikayesi olduğunu düşünmüyorum, bu yüzden belki de böyle bir şeyi bekliyorlardı." diye ekledi.
Bu olaydan sonra, yapay zeka güvenliği ve siber güvenlik camiasındaki birçok kişi, tekrarın önlenmesi için düzenleme veya standartlar çağrısında bulundu. Altman'ın gelecek hafta Beyaz Saray yetkililerine yapay zeka sistemlerinin yeni nesli hakkında bilgi vermesi bekleniyor.
Sistemler daha otonom yeteneklere doğru ilerledikçe, hackleme veya talimatlara uymama gibi daha az arzu edilen davranışlar ortaya çıkabilir. Apollo Research'ten Hobbhahn, ajanların etkili olabilmesi için uzun süreler boyunca denetimsiz çalışmaları gerektiğini söyledi. "Daha fazla yetkiye sahip olmaları gerekiyor, bundan kaçış yok." dedi.
Hobbhahn sözlerini şöyle sürdürdü: "İnsanlar, 'Bu sadece bir araç, istediğinizi yapar ve başka hiçbir şey yapmaz, tam olarak niyetinizi ve talimatlarınızı takip eder' diyor. Ve bence insanlar, kendi hedefleri olan, günler boyunca otonom hareket eden ve bu hedeflerin mutlaka sizinkilerle uyumlu olmayan ajanlara gerçekten hazırlanmalı."