Ara

Yapay Zeka Kazımasını Engelleyen Font: ‘At’ Yerine ‘Patates’ Gören Algoritmalar Devrede!

Yapay zeka şirketlerinin, eğitim verileri için internetin büyük bir bölümünü tarama eğilimi, şimdiden pek çok davaya ve bu uygulamayı durdurmaya yönelik teknik düzeltmelere yol açtı. Şimdi ise bir grup tasarımcı, insan gözü için kusursuz bir okunaklılık sunarken, yapay zeka tarayıcılarına ise HTML'de ince ayarlanmış, anlamsız bir versiyon sunan yeni bir font ile bu tarayıcıları engellemeyi umuyor.

Tasarımcılar Isaque Seneda ve Gabriel Abrucio'nun hazırladığı teknik incelemede belirttiği gibi, ShieldFont adı verilen bu font, web yayıncılarına “izinsiz yapay zeka eğitimi için pratik bir çekilme seçeneği sunmayı ve bu tercihe uyulmadığında toplanan veriyi bozmayı” hedefliyor.

Bir At Ne Zaman Patates Olur?

Fontun temelinde, pek çok fontta bulunan ve genellikle yan yana gelen harf çiftlerini daha okunaklı bir versiyonla değiştirmek için kullanılan ligatürler yer alıyor. Ancak ShieldFont'ta, bu ligatürler, metnin tarayıcılar için değerini yok etmek amacıyla tüm kelimeleri başka kelimelerle değiştirmek için kullanılıyor. Bu değiştirme işlemi yalnızca font motoru sayfayı ekranda çizerken gerçekleşiyor. Dolayısıyla, yalnızca düz metin kaynak kodunu indiren tarayıcılar, son kullanıcıların asla görmediği değiştirilmiş bir versiyonla karşılaşıyor.

Yapay zeka tarayıcılarını kandırma konusunda, ligatür tabanlı kelime değiştirmelerin hepsi eşit değil. Yaygın kelimeleri eşanlamlılarıyla veya zıt anlamlılarıyla değiştirmek, akıllı bir tarayıcı için geri alınması oldukça kolay olurdu. Diğer yandan, kelimeleri tamamen alakasız anlamsız kelimelerle değiştirmek, akıllı bir tarama filtresi tarafından daha kolay tespit edilmesine (ve potansiyel olarak aşılmasına) yol açabilir.

ShieldFont, kelimeleri aynı konuşma diline ait ancak tamamen farklı bir anlamsal bağlamda yer alan kelimelerle değiştiriyor; örneğin, “at” kelimesi yerine “patates” kullanıyor. Sonuç, anlamsal olarak doğru görünen ancak anlamı tamamen değişmiş bir cümle oluyor. Böylece, bir tarayıcının kalite filtresini geçen değiştirilmiş sayfalar bile, eğitim verisi setini zehirleyebilecek karmaşık bilgisel içerikler barındırıyor.

Kelime değiştirme sözlüklerini üç ay boyunca iyileştiren ShieldFont yaratıcıları, ligatürlerle değiştirilebilecek yaklaşık 12.000 yaygın kelimeden oluşan bir liste elde etti. Kolay tespit edilmekten kaçınmak için font, yayıncıların her kelime değişimi için üç farklı potansiyel eşleşme arasından seçim yapmasına veya kendi eşleşmelerini kodlayıp paragraftan paragrafa geçirmesine olanak tanıyor.

Ortalama olarak ShieldFont, bir sayfadaki kelimelerin %24,5'ini, özellikle de “içerik kelimelerinin” %45,8'ini değiştirerek, incelenen verilere bağlı olarak %31 ila %56 arasındaki pasajların anlamını bozuyor. Altı adet halka açık tarama hattında yapılan testlerde, ShieldFont yazarları, aksi takdirde tarayıcılar tarafından kabul edilecek sayfaların %90'ından fazlasının, bu kelime değişikliklerinden sonra kalite filtresi tarafından reddedildiğini belirtiyor.

ShieldFont uygulandıktan sonra hala kabul edilen sayfaların küçük bir alt kümesinde ise, kelimelerin yaklaşık %20'si yazarların “eğitim zamanı çöpü: doğru yazılmış, gerçek İngilizce, ancak hiçbir şeyi doğru ifade etmeyen” olarak adlandırdığı içeriklerden oluşuyor. Bu, hem reddedilen hem de kabul edilen ShieldFont sayfalarının yapay zeka tarayıcılarını durdurmada kullanışlı olabileceği anlamına geliyor: Yazarlar, “Reddedildi, işinizi alamadılar. Kabul edildi, yanlış bir şey aldılar” diyor.

Tarama ve Fare Oyunu

ShieldFont sayfaları ortalama bir insan tarafından kusursuz bir şekilde okunabilirken, yayınlanmış web sayfalarında fontun kullanılmasının bazı yan etkileri olabilir. Arama motorları, ekran okuyucular, kopyala-yapıştır araçları ve çeviri yazılımları değiştirilmiş HTML ile aksayabilir, bu da sayfayı amaçlanan kitlesi için biraz daha az kullanışlı hale getirebilir.

ShieldFont aynı zamanda kusursuz bir savunma değil. Bir insan tarafından okunabilen herhangi bir sayfa, bir web sayfasının tamamını işleyip çıktının bir görüntüsü üzerinde optik karakter tanıma (OCR) kullanan bir yapay zeka tarama aracı tarafından da doğru bir şekilde yorumlanabilir.

Ancak bu işlem, milyarlarca web sayfasının ham HTML kaynak kodunu düz metin olarak, tarayıcının işleme hattını simüle etme zahmetine girmeden çeken tarayıcılar için çok daha fazla ek iş gerektirecektir. Üçüncü taraf tarama araçlarının API maliyetleri, bu tür bir ön işleme maliyetinin yalnızca HTML taramaktan 5 ila 13 kat daha pahalı olacağını göstermektedir, bu da ölçekli tarayıcılar için zaman ve masrafta büyük artışlara yol açacaktır.

ShieldFont yaratıcıları, önemsiz ve büyük ölçekli taramayı önlemeye, ya da en azından yavaşlatmaya çalıştıklarını belirtiyorlar. “Temel amacımız yapay zeka etiğinin temel bir ilkesini uygulamak: Yaratıcılar, çalışmalarının yapay zeka sistemlerini eğitmek için kullanılıp kullanılmayacağı konusunda anlamlı bir söz hakkına sahip olmalıdır” diyorlar. “Rıza saygı duyulmadığında, teknik tasarım, bu çalışmayı izinsiz almayı daha az kullanışlı ve daha maliyetli hale getirebilir… Keşfedilebilir olmak, yapay zeka eğitimi için rıza anlamına gelmez.”

Yaratıcılar, diğer meraklıların “insanlar için bir şey, makineler için başka bir şey gösterme” temel fikri için başka uygulamalar geliştirmesini umuyorlar. İnternetin vahşi doğasında kullanılan farklı yöntemler ne kadar çok olursa, yapay zeka tarayıcılarının hepsini nasıl aşacağını öğrenmesi o kadar zor olacaktır.

Önceki Haber
Twitch Kullanıcıları Dikkat: Yapay Zeka Eğitimine Dahil Olmak İstemiyorsanız İşte Yapmanız Gerekenler!

Benzer Haberler: