Bazen yangınla mücadele etmek için yangın kullanmak gerekir. Ancak sosyal medya platformlarının güvenliğini ve değerini tehdit eden yapay zeka kaynaklı kalitesiz içerik ve nefret dolu paylaşımlar söz konusu olduğunda, daha fazla yapay zeka eklemek sorunu daha da kötüleştirebilir.
En iyi ihtimalle, sosyal medya insanların deneyimlerini ve bilgilerini paylaşmak istedikleri bir sığınak olabilir. Bu ideal duruma en çok, kullanıcıların benzersiz bir şekilde düşünülmüş bir blog yazısı veya bir bilgisayar toplama rehberi gibi otantik ve değerli içerikler sunduğunda yaklaşır. Bu otantikliği korumak için öncelikli olarak yapay zeka araçlarına güvenmek, sosyal medyayı ilk etapta değerli kılan şeyi, yani arkasındaki insanları göz ardı eder.
Yanlış Silme Vakaları
Nisan ayında, r/AskHistorians Reddit topluluğunun moderatörleri için oluşturulan bir sohbet kanalı her zamankinden daha yoğundu. Moderatör mesajlarına otomatik olarak bağlantı alan kanal, on yıla yayılan düzinelerce yorum ve gönderinin topluluktan otomatik olarak kaldırılmasının ardından uyarılarla doldu.
Moderatörlerden Dr. Sarah Gilbert, yaşananlara ilişkin, “Ne biz ne de (silinen içeriği paylaşan uzmanlar) yapabileceğimiz bir şey vardı,” dedi.
Bu durum, topluluğu uzun yıllar boyunca insanları eğitmeye devam eden ayrıntılı yanıtların bir arşivi olarak gören kullanıcılar için özellikle zarar vericiydi.
Moderatörler, Reddit'in yakın zamanda güncellenen yapay zeka moderasyon araçlarının bu kaldırmalardan sorumlu olduğunu düşünüyor. Bazı gönderilerin metinlerini kurtardıktan sonra, AskHistorians moderatörlerinden biri, kaldırılan tüm içeriğin nadir tarihi fotoğraflar paylaşan bir web sitesine bağlantı verdiğini fark etti. Moderatörler, Reddit'in bu web sitesini ve dolayısıyla açıklayıcı görseller için içeriğini kullanan tüm gönderileri spam olarak işaretlemiş olabileceğini düşünüyor.
Reddit, bir yorum talebine yanıt vermedi.
İçeriğin silinmesi, toplanması zaman alan değerli bilgileri yok etti (Gilbert, bazı insanların sorulara yanıt vermek için saatler, hatta “günler boyunca” araştırma ve yazma süreci geçirdiğini belirtiyor). Ancak, bu ve benzeri yanlış kaldırmaların, Reddit'te yapay zeka moderasyonunun ne kadar etkili olduğunu göstermeyi amaçlayan metriklerin hesaplanmasına katkıda bulunmuş olması muhtemeldir.
Reddit, yapay zeka sayesinde “nefret ve şiddet içeren içeriklere yönelik yaptırımları yüzde 200'den fazla artırdığını” ve yapay zekanın “daha hızlı, daha yüksek hacimli yaptırımları” yönlendirdiğini belirtiyor. Şirket, yapay zekanın “potansiyel olarak zararlı içeriğe maruz kalmayı yüzde 40'tan fazla azalttığını” ve büyük dil modellerini (LLM'ler) kullanarak “sahte davranışların ve yapay heyecanın oldukça incelikli, koordineli örüntülerini” yakaladığını söylüyor.
Ancak AskHistorians'ın yaşadığı olayda olduğu gibi, daha fazla yaptırım mutlaka daha iyi yaptırım anlamına gelmez.
Yanlış Pozitifler Sorunu
Üretken yapay zekanın büyümesi, sosyal medya moderasyonu için yeni engeller oluşturdu. Gilbert, örneğin, büyük dil modellerinin “gerçek insan seslerini taklit etmeye çalıştıkları için spam tespitini çok daha zorlaştırdığını” belirtti. “Son iki ila üç aydır, LLM destekli spam botlar tarafından tamamen sel basıldık,” dedi.
Pazarlama ajansları, markaların üretken yapay zeka sohbet robotları tarafından alıntı yapmasını sağlamak üzere tasarlanmış sosyal medya içerikleri üretiyor. Pazarlamacılar uzun süredir görünürlüğü artırmak için gerçek dışı sosyal medya gönderileri kullanıyor, ancak sohbet robotlarının yükselişi yeni bir cephe açtı. Örneğin, ReachLLM girişimi, özellikle sohbet robotları aracılığıyla pazarlamaya odaklanıyor. Bu çabanın bir parçası olarak, şirket temsilcileri Reddit üzerinde alt topluluklar oluşturdu ve bunları yönetiyor.
Bu zorluklar, bazı sosyal medya şirketlerini yeni yapay zeka tabanlı moderasyon tekniklerini keşfetmeye yöneltti. Örneğin Reddit, yapay zeka araçlarının “günlük olarak yaklaşık 2 milyon sahte oyu iptal ettiğini” ve LLM'leri kullanarak “eski sistemlerin bir zamanlar gözden kaçırdığı sahte davranışların ve yapay heyecanın oldukça incelikli, koordineli örüntülerini yakaladığını” belirtiyor.
Ancak birçok sosyal medya platformu, zararsız içeriği hızla cezalandıran yapay zeka moderasyon araçlarına aşırı derecede bağımlı hale geldi.
Yakın zamanda Discord, yapay zeka mod sisteminin Mayıs ve Temmuz başı arasında yaklaşık 8.400 hesabı yanlışlıkla yasakladığını kabul etti. Yapay zeka, satranç tahtaları veya elektronik tablolar gibi kare ızgaralar içeren görselleri yanlışlıkla CSAM (Çocuk Cinsel İstismarı Materyali) olarak etiketledi ve ardından yükleyenlere kalıcı bir yasak uyguladı. (Discord, etkilenen tüm hesapların daha sonra yeniden etkinleştirildiğini belirtti.)
Şirket, yapay zeka moderasyonunun insan denetimi olmadan kullanılmasının amaçlanmadığını söyledi. Yapay zeka tarafından işaretlenen içeriğin Discord harekete geçmeden önce bir insan çalışan tarafından gözden geçirilmesi gerektiğini iddia etti, ancak bir hata yapay zekanın insan adımını atlayıp hesapları yasaklamasına neden oldu.
Bu sözde aksilik, içerik moderasyonunda insan güvencelerinin neden vazgeçilmez olduğunu vurguluyor. Anlamlı bir denetim olmadan, yapay zeka tabanlı bir moderasyon sistemi haftalar içinde binlerce hata yapabilir ve kalıcı sonuçlar doğurabilir.
2025'ten bu yana, birçok Facebook ve Instagram kullanıcısı, yapay zeka moderasyonunu suçladıkları toplu yasaklar hakkında şikayette bulundu. İnsan moderasyonunun eksikliği, herhangi bir kuralı ihlal etmediklerini söyleyen kullanıcılar arasında, özellikle de yasağın nedenini veya bir hesabı nasıl yeniden etkinleştirebileceklerini görüşmek üzere bir Meta çalışanıyla konuşma yollarının olmaması nedeniyle hayal kırıklığını daha da artırdı. Meta, yasakların arkasında yapay zekanın olup olmadığını açıklamadı, ancak şirket son yıllarda giderek artan bir şekilde insanlardan ziyade üretken yapay zeka tabanlı moderasyona güveniyor; bu da bazı kişilerin, Meta çalışanları da dahil olmak üzere, çok hızlı gerçekleştiğini söylüyor.
Tumblr, otomatik moderasyon sistemlerinin başarısız olduğu başka bir sosyal topluluktur. Mart ayında, Tumblr'ın ana şirketi Automattic'in iletişim başkanı Chenda Ngak, The Verge'e Tumblr'ın otomatik sistemlerinin bir öğleden sonra 200'den az Tumblr hesabını yanlışlıkla yasakladığını söyledi.
Ve 2025'te, Tumblr kullanıcıları platformun otomatik içerik moderasyon sistemlerinin yanlışlıkla içeriği “olgun” olarak işaretlemesi ve görünürlüğünü azaltması üzerine şikayette bulundu. Her iki durumda da kullanıcılar yapay zekayı suçladı. Tumblr, yapay zekanın bu sorunlara neden olduğunu hiçbir zaman doğrulamadı, ancak şirket “makine öğrenimi sınıflandırması ve insan moderasyonunun bir karışımını” kullandığını belirtti.
Yapay zeka moderasyonu, sosyal medya şirketlerine para tasarrufu sağlayabilir ve zararlı içeriği daha hızlı kaldırmalarına yardımcı olabilir. Ancak bu sistemler temel hataları ortadan kaldırana kadar - bir satranç tahtası resmini CSAM olarak etiketlemek gibi - insan denetimine ihtiyaç duyarlar.
AskHistorians moderatörü Gilbert, “Sistemde daha fazla şeffaflık varken, rutin olarak nefreti bildirir ve kuralları aslında ihlal etmediğine dair otomatik bir yanıt alırdık, bu da bir itiraz süreci başlatmamıza neden olurdu,” dedi. “Bu nedenle, sayılara güvenmek zor çünkü Reddit'in sistemlerinin ‘yargısına’ güvenmek zor.”
“Yanlış pozitifler” Reddit'te “büyük bir sorun” diye ekledi.
Yapay Zekanın Önyargıları
Tipik sosyal medya yapay zeka tabanlı moderasyon sistemleri, gönderileri analiz etmek ve platform kurallarını ihlal eden içeriği tanımlamak ve işaretlemek için makine öğrenimi sınıflandırıcılarını kullanır. Ancak bir makinenin alaycılık, hiciv ve argo dilinin nüanslarını anlaması zordur.
Ayrıca, bazı araştırmalar (örnekler burada, burada ve burada), marjinalize edilmiş grupların yapay zeka moderasyonundan orantısız bir şekilde etkilenebileceğini öne sürüyor. İnsan denetimi olmadan, yapay zeka, sistemlerin mücadele etmek için tasarlandığı nefret dolu içeriğe karşı en savunmasız toplulukları cezalandırabilir.
Cornell'in Vatandaşlar ve Teknoloji Laboratuvarı'nın araştırma direktörü de olan Gilbert, “marjinalize ve savunmasız nüfusların en yüksek moderasyon oranlarına sahip gruplar arasında yer aldığını ve tipik olarak bunun ‘yanlış pozitifler’den kaynaklandığını” belirtiyor. Bu durum, genellikle “karşı konuşma”, “dil kurtarma” ve “nefret dolu içeriğe verilen yanıtlar” durumlarından kaynaklanıyor.
“Yanlış pozitifler bir eşitlik meselesidir. Bu, zaten marjinalize edilmiş grupların daha da susturulduğu ve sansürlendiği anlamına gelir,” diye ekledi.
Yapay zeka moderatörleri ayrıca toplulukları kendi kendilerini moderasyon etme konusunda daha az etkili hale getirebilir. Örneğin Reddit'te, bazı topluluk moderatörleri nefret dolu veya şiddet içeren söylem kullanan kullanıcıları yasaklamayı tercih eder. Ancak Reddit'in yapay zekası, bir insan moderatör görmeden önce böyle içeriği kaldırırsa, bu moderatörler bir yasağın gerekip gerekmediğini değerlendirme yeteneğini kaybeder.
İnsan moderatörlere daha fazla kontrol verme açısından Reddit, bu hafta insan moderatörlerin “hangi kuralların otomatik olarak uygulanacağını seçmesine, bir kural tetiklendiğinde ne olacağını (kuyruğa gönderme, filtreleme veya kaldırma) belirlemesine, etkinleştirmeden önce deneyimi önizlemesine ve günlükleri ve içgörüleri incelemesine” olanak tanıyan bir araç paketi olan Rules Hub'ın testlerini genişlettiğini duyurdu. Reddit, Rules Hub'ın nihayetinde esas olarak belirli anahtar kelimelere dayanan Automoderator aracının yerini almasını bekliyor.
Yapay Zeka Bir Araçtır, Çözüm Değil
Görüştüğüm moderatörler, üretken yapay zeka patlamasını, topluluğa özgü veya daha geniş platform kurallarını ihlal eden içeriklerdeki bir artıştan sorumlu tuttular. Bu, kullanıcı katkılarına dayanan sosyal medya siteleri için ciddi bir sorundur.
Şirketler, daha güvenilir ve etkili moderasyon yöntemleri denemeye devam edecekler, ancak insan girdisini azaltmak bir adımdır. Düşük çaba gerektiren yapay zeka tarafından üretilen içerik, moderasyon ekiplerinin karşılaştığı zorlukları değiştiriyor, ancak bu, makine ölçekli tespitin insan yargısı ve uzmanlığıyla birleştirilebileceği daha güçlü yaklaşımları daha da gerekli kılıyor.
Tıpkı sosyal medyanın insanlar olmadan bir değeri olmadığı gibi, içerik moderasyonu da insan yargısı ön planda olmadan başarılı olamaz.