Ara

AI Su Yazıları Güvenlik Açığını Ortaya Çıkardı: Zararlı İsteklere Yanıtlar Değişiyor!

Avrupa Birliği'nin yeni yasalarına bir yanıt olarak, yapay zeka platformları ürettikleri içerikleri işaretlemek için yeni yöntemler uyguluyor. Yakın zamanda yapılan bir duyuruda, gelecekteki Claude modellerinin, Google tarafından geliştirilen ve açık kaynak olarak yayınlanan SynthID-Text adlı bir yaklaşımı kullanacağı belirtildi. Bu yöntem, bir yapay zeka modelinin bir cümledeki bir sonraki kelimeyi seçme sürecini incelikle değiştiren gizli bir anahtar kullanıyor. Örneğin, en olası kelime seçimi "bulutlu" iken, anahtar bunu "kapalı" olarak değiştirebilir. Anahtarı bilen herkes, içeriğin hangi platform tarafından üretildiğini belirleyebilir.

Yapılan yeni araştırmalar, SynthID-Text'in sadece kelime seçimini değil, aynı zamanda bir yapay zeka modelinin kullandığı araçları ve eğitildiği güvenlik önlemlerine uyma veya bunları göz ardı etme olasılığını da değiştirebildiğini gösteriyor. Bir şifre veya hassas bilgiyi açığa çıkarmak gibi zararlı bir eylemi gerçekleştirmesi için bir modeli manipüle etmeye çalışan bir saldırganın hedeflediği zararlı bir komut karşısında tehdit daha da artabilir. Normalde takip edilmeyecek talimatlar, bazı durumlarda, su işaretleme uygulandıktan sonra yerine getirilebiliyor. Bu bulgu, geliştiricilerin, su işaretleme mevcutken yapay zeka modellerinin ve ajanlarının davranışlarını kapsamlı bir şekilde test etme ihtiyacını vurguluyor.

Güvenlik Davranışını Değiştirmek

Bir yapay zeka güvenlik araştırmacısı, "Su işaretlemesi olmayan modellerle karşılaştırıldığında, özellikle onları düşmanca koşullara maruz bıraktığımızda veya bu modelleri bir ajan aracılığıyla araçları çağırmaya zorladığımızda davranışlarını kesinlikle değiştirecektir. Su işaretlemenin bir okuyucu tarafından algılanmaması amaçlanmıştır, ancak modelin ürettiği herhangi bir şeyi değiştirdiğimizde, bunun bir bedeli olacağını ve bir yerlerde ortaya çıkacağını biliyoruz." dedi.

Su işaretleme, çıktının yapay zeka tarafından üretildiğini belirlemeye olanak tanıyan, bilinen diğer adıyla menşe (provenance) adı verilen bir sinyali gömerek çalışır. SynthID, normal örnekleme sürecini alır ve buna rastgele bir tohum oluşturucu, örnekleme algoritması ve puanlama fonksiyonu ekler. Süreç, bir sonraki kelime seçimi için rastgele bir sayı üreteci kullanmak yerine, gizli bir anahtar kullanır. Kelime seçimi hala rastgele olsa da, anahtarı bilen kişiler, anahtarın kullanılmış olma olasılığını belirlemek için kelime dizisini kontrol edebilirler.

SynthID'nin önemli bir özelliği, "turnuva örneklemesi" olarak bilinen bir yöntemdir. Spor karşılaşmalarına benzer şekilde, SynthID, çok sayıda bir sonraki kelime adayı jetonunu değerlendirir. Bunlara olasılık puanları atamak için gizli bir anahtar kullanır. Bir jeton çifti bir turda yarışır. Daha yüksek gizli puana sahip olan kazanır ve bir sonraki tura ilerler. Süreç, nihai kazanan jeton belirlenene kadar devam eder.

Araştırmacı, Hugging Face'in değiştirilmemiş SynthIDTextWatermarkLogitsProcessor'u aracılığıyla SynthID-Text'in "bozucu olmayan" yapılandırmasını test etti. Altı açık kaynaklı modele zararlı komutlar verdi ve su işaretleme kullanıldığında ve kullanılmadığında alınan yanıtları karşılaştırdı. Deney, su işaretlemenin zararlı isteklere verilen yanıtları değiştirdiğini, özellikle de komut enjeksiyonu teknikleri kullanılarak yapıldığında ortaya koydu.

Araştırmacı, "Su işaretleme, doğrudan zararlı isteklerde reddetme davranışını değiştiriyor, ancak aynı istekler komut enjeksiyonu tekniği ile eşleştirildiğinde etki daha belirgin hale geliyor. Birçok modelde, su işaretleme, modelin aksi takdirde reddedeceği zararlı isteklere yanıt verme olasılığını artırıyor." diye yazdı.

Bu değişikliklerin önemli güvenlik sonuçları vardır çünkü bunlar sadece büyük dil modellerinin yanıtlarını değil, aynı zamanda modele dayanan yapay zeka ajanlarının sonraki eylemlerini de etkiler.

Araştırmacı, "Model düzeyinde, bu, modelin zararlı bir isteği reddedip reddetmeyeceği ve bu reddin komut enjeksiyonu altında devam edip etmeyeceği dahil olmak üzere güvenlik davranışını değiştirebilir. Ajan düzeyinde, aynı örneklenen jetonlar, hangi aracın çağrılacağını ve ona hangi argümanların geçirileceğini belirleyebilir. Komut enjeksiyonu, zayıflamış bir reddetme, model araçlar aracılığıyla da hareket edebildiğinde daha önemli hale geldiği için bu iki ayarı birbirine bağlar. Bu nedenle, böyle bir su işaretleme prosedürü hem modelin ne söylediğini hem de bir ajanın ne yaptığını etkileyebilir. Bu davranışsal etkiye örnekleme kayması (sampling drift) diyoruz." diye ekledi.

Ayrıca ilginç bir nokta: Model yanıtları, kullanılan gizli anahtara bağlı olarak farklı davrandı.

Araştırmanın sınırlamaları da mevcut. Claude model yanıtlarının su işaretleme altında nasıl değiştiğini test etmiyor. Bunun yerine, yarım düzine açık kaynaklı modeli test ediyor, böylece araştırmacı turnuva örneklemesi sırasında etkinleştirilebilen ve devre dışı bırakılabilen jeton örneklemesine erişebiliyor, diğer ayarlar sabit tutulurken. Deneyler ayrıca SynthID-Text turnuva örneklemesinin Hugging Face uygulamasını test etti, Claude modellerinin kullanacağı özel uygulamayı değil.

Bununla birlikte, sonuçlar, su işaretleme yaklaşımının en azından bazı biçimlerinin model ve ajan güvenliğini etkileyebileceğini gösteriyor. SynthID dağıtıldığında beklendiği gibi performans gösterdiklerinden emin olmak için platformlarını yoğun bir şekilde test etmeleri, kırmızı takım (red-team) hackleme alıştırmaları için önem taşıyacaktır.

Önceki Haber
Microsoft Yetkilisinden Çarpıcı İddia: Yapay Zeka İçin Veri Çekmek İnsanlık Tarihinin En Büyük Hırsızlığı mı?
Sıradaki Haber
Gizemli Flock Kameralarının İç Yüzü Ortaya Çıktı: Hack'lenen Cihazlar Neler Açığa Çıkardı?

Benzer Haberler: