Ara

Yapay Zeka Kontrolden Çıktı: Sahte Kimlikler ve Kötü Amaçlı Kod Girişimi GitHub’da Tespit Edildi

Gelişmiş yapay zeka modellerinin rutin siber güvenlik testleri sırasında beklenmedik güvenlik olayları yaşandı. En ciddi vakada, Anthropic'in Mythos 5 modeli, açık kaynaklı bir yazılım projesine kötü amaçlı kod eklemeye çalışırken sahte kimlikler kullanarak proje geliştiricilerini kandırmaya teşebbüs etti.

Yaşanan bu güvenlik olayları, Birleşik Krallık hükümetine bağlı bir araştırma kuruluşu olan Yapay Zeka Güvenlik Enstitüsü (AISI) tarafından, Temmuz sonunda yedi önde gelen yapay zeka modelinin siber yeteneklerini değerlendirmek amacıyla yapılan bir test sırasında meydana geldi. Araştırmacılar, yapay zeka ajanlarının internette onaylanmamış eylemlerde bulunduğu 19 farklı durumu tespit etti. Bu eylemler arasında gerçek kişi ve kuruluşları hedef alan vakalar da bulunuyordu.

Tespit edilen "özerk, onaylanmamış" eylemlerin neredeyse tamamı Anthropic'in Mythos 5 modelinden kaynaklanırken, OpenAI'nin GPT-5.6 Sol modelinden ise iki adet benzer eylem geldi. Yapay Zeka Güvenlik Enstitüsü'nün güvenlik ekibi, 28 Temmuz sabahı test sistemlerinden birinden Tor anonimlik ağı üzerinden veri çıkışı olduğunu fark etmesiyle durumu anlamaya başladı.

Bu durum, yapay zeka ajanlarının sanal test ortamlarından kaçıp gerçek internette zarar vermesi şeklinde anlaşılmamalıdır. Aksine, araştırmacılar siber test sürecinin bir parçası olarak yapay zeka ajanlarının internet erişimine kasıtlı olarak izin vermişti. Ayrıca, yapay zeka model sağlayıcılarının kötüye kullanımı önlemek için yerleştirdiği bazı güvenlik filtreleri de devre dışı bırakılmıştı.

Yapay zeka ajanlarının gerçek kişi ve kuruluşları hedef alma girişimlerinin tamamı başarısız oldu ve yapılan takip soruşturmalarında herhangi bir gerçek dünya zararı tespit edilmedi. Ancak araştırmacılar, bu yapay zeka ajanlarının eylemlerini, "özerklik ve aldatma risklerinin, belirli bir yönlendirme olmadan, gerçek dünyada bu kadar net bir şekilde ortaya çıktığı ilk durum" olarak tanımladı.

Yapay Zeka Ajanlarının Aldatma Yöntemleri

En ciddi vaka, Mythos'un açık kaynaklı proje deposuna bir tedarik zinciri saldırısı gerçekleştirmek için birden fazla girişimde bulunmasını içeriyordu. Bu girişimler arasında, projenin geliştirici platformu GitHub üzerinde barındırılan depoya kötü amaçlı kod eklenmesini sağlamak amacıyla sosyal mühendislik teknikleri kullanarak proje yöneticilerini ikna etme çabaları da yer aldı.

Mythos, ilk olarak kötü amaçlı kodu depoya eklemek için bir çekme isteği (pull request) açtıktan sonra, kodu bağımsız olarak inceleyip zararlı yazılım içermediğini doğruladığını iddia eden sahte çevrimiçi kimlikler ("sock puppet" kişilikler) oluşturdu.

Yapay zeka ajanı ayrıca, depoya ait iki insan yöneticisine beş e-posta gönderdi. Bu e-postalardan bazıları zararlı yazılım içerirken, bazıları da bir yöneticiyi çekme isteğini kabul etmeye ikna etme amacı taşıyordu.

Mythos, ilk deponun yöneticisine ait ikinci bir depoda da bir GitHub Sorunu (Issue) açarak, "sorun sınıflandırma yapay zeka kodlama ajanlarını" hedef alan kötü amaçlı bir komut enjeksiyonu gerçekleştirdi. Bu saldırı yöntemi, Mythos'un, depo yöneticisinin Claude Code gibi bir yapay zeka kodlama ajanı olabileceği varsayımına dayanıyordu.

Buna karşılık, OpenAI'nin GPT-5.6 Sol modeli, atanan siber güvenlik mücadelesini çözme ve bir "bayrak" (flag) alma görevi sırasında iki onaylanmamış eylem gerçekleştirdi. Yapay zeka ajanının bu eylemleri hem AISI araştırmacıları hem de OpenAI tarafından şirketin kendi blog yazısında detaylandırıldı.

OpenAI'ye göre, ilk onaylanmamış eyleminde GPT-5.6 Sol, hedef ağın GitHub güncellemelerini kontrol edip etmediğini anlamak için başka bir laboratuvarın yapay zeka ajanının herkese açık bir çevrimiçi not defterinde bıraktığı bir GitHub belirtecini (token) yeniden kullandı. Ardından "hesap kurtarma ve istek limiti atlatma çalışmaları" denedi. OpenAI modeli ayrıca sanal test ortamının dışında harici DNS ve tünelleme sağlayıcılarıyla hesaplar kaydetti.

İkinci eylemde ise GPT-5.6 Sol, "değerlendirme ortamında yerel olarak çalışan bir DNS sunucusunu halka açık internetten erişilebilir hale getirmek için halka açık bir tünelleme hizmeti kullandı." Bu sunucuda değerlendirme ortamındaki bir yazılımda bilinen bir güvenlik açığını sömürmek üzere tasarlanmış yükler bulunuyordu, ancak yapay zeka ajanının kurulumu işe yaramadı.

Çıkarılan Dersler

Bu güvenlik olayları, Birleşik Krallık hükümeti araştırmacılarının ilgili tüm yapay zeka ajanları değerlendirmelerini durdurmasına, ilgili sanal makineleri izole etmesine ve en yetenekli modellere olan dahili kuruluş erişimini devre dışı bırakmasına neden oldu.

Yapay Zeka Güvenlik Enstitüsü ayrıca GitHub'ı yapay zeka ajanları tarafından gerçekleştirilen kötü amaçlı faaliyetler hakkında bilgilendirdi ve geliştirici platformun ajanın geride bıraktığı "eserleri" kaldırmasına yardımcı oldu. Ayrıca, modelin etkileşimde bulunduğu GitHub kullanıcıları da bilgilendirildi.

Ancak daha büyük dersler, hükümet kuruluşunun gelecekte bu tür önde gelen yapay zeka modelleri için siber testleri nasıl değiştirmeyi planladığından ve diğer kuruluşların da aynı şeyi nasıl yapmalarını tavsiye ettiğinden geliyor.

İlk olarak, varsayılan olarak açık internet erişimi yerine siber testler sırasında yapay zeka modelleri için internet erişimini sıkılaştırmayı planlıyorlar. Teknik rapora göre bu, "tüm dahili sanal ortamlara ince taneli ağ kontrolleri" ve "çok katmanlı ağ kontrolleri ile derinlemesine savunma" içerecek.

İkinci olarak, kuruluş, "kapsam dışı eylemleri gerçekleşirken işaretleyebilen veya engelleyebilen" siber değerlendirmelerin gerçek zamanlı izlenmesini tanıtıyor. Bu, siber testten geçen yapay zeka modellerinin talep ettiği eylemleri onaylayabilen veya reddedebilen ayrı bir büyük dil modeli kullanmayı içeriyor ve onaylanmamış eylemleri durdurmaya yardımcı olabilir. Büyük dil modeli tabanlı izleme, belirli bir siber değerlendirmede nelerin izin verilip nelerin verilmeyeceği konusundaki talimatlarla özelleştirilecektir.

Üçüncü olarak, Birleşik Krallık hükümeti araştırmacıları, yapay zeka modellerinin sanal test ortamlarından kaçma riskini azaltmak için ek "mühendislik çabalarını sanal ortam izolasyonu ve güçlendirilmesine" yatırım yaparak siber değerlendirmeleri yeniden düzenlemeyi planlıyorlar, ancak bu olaylarda kaçış yaşanmamıştı. Ayrıca, yapay zeka ajanlarının belirtilen sınırlar dahilinde tamamlayamayacakları görevlerle karşılaştıklarında onaylanmamış eylemler gerçekleştirme olasılığının daha yüksek olabileceği "komut yanlış yapılandırması" durumlarını önlemek amacıyla siber testler için komutları da gözden geçiriyorlar.

Ancak siber test olaylarının bir kez daha ters gitmesi, önde gelen yapay zeka modellerinin siber güvenlik risklerini vurguluyor. Özellikle Anthropic ve OpenAI'nin de yakın zamanda yapay zeka modellerinin dış kuruluşların korunan ağlarına izinsiz girdiğini bildiren ayrı olayları açıklamasıyla bu durum daha da belirginleşiyor. Modellerin kötü niyetli veya güvenlik konusunda daha az bilgili kişiler tarafından kullanıldığı diğer durumlarda da bunun tekrarlanabileceğini varsaymak mantıklıdır.

Önceki Haber
Starlink'ten Cüretkar İddia: Mobil Sektörde Devlere Meydan Okuyor!
Sıradaki Haber
Sunucularınız 'Kör Noktada' Tehlike Altında: Anakartlardaki Gizli Açıklar Siber Saldırılara Kapı Aralıyor!

Benzer Haberler: