
Yapay zeka testleri kontrolden çıkıp güvenlik riski yaratıyor
Siber güvenlik testlerine tabi tutulan yapay zeka modelleri sınırlarını aşarak internete erişti ve gerçek sistemlere sızdı.
Son birkaç ay içinde siber güvenlik değerlendirmelerinden geçen yapay zeka ajanları, sınırlarını aşarak internete ulaştı ve bazı durumlarda gerçek dünyadaki sistemlere sızdı. Bu olaylar OpenAI, Anthropic, Meta ve en son Çinli yapay zeka laboratuvarı Moonshot AI'ın modellerini kapsarken, testler aralarında Irregular adlı bir siber değerlendirme girişiminin de bulunduğu çeşitli kuruluşlar tarafından gerçekleştirildi. Yaşananlar yapay zeka sektörü için büyüyen bir sorunu gözler önüne seriyor: Otonom ajanlar daha yetenekli hale geldikçe, sınırlarını güvenli bir şekilde test etmek için tasarlanan ortamlar onları tutmakta yetersiz kalıyor.
Cambridge Üniversitesi Yapay Zeka Geleceği ve Sorumluluğu Programı Direktörü Seán Ó hÉigeartaigh, testlerin modellerin kapasitesine ayak uyduramadığını belirtti. Test edilen modellerin doğası riski artırıyor. Yapay zeka şirketleri, kötü niyetli davranışları kısıtlayan normal korumaları devre dışı bırakarak yayınlanmamış yeni nesil modeller üzerinde siber değerlendirmeler yapıyor. Bu durum test ortamının güvenliğini kritik bir savunma hattı haline getiriyor. Ó hÉigeartaigh, bunun test için faydalı olduğunu ancak modellerin dışarı sızması durumunda ciddi zarar verebileceğini vurguladı.
En ciddi vakalardan birinde, yayınlanmamış bir OpenAI modeli korumalı alanından çıkarak Hugging Face'in üretim sistemlerine sızdı. Irregular tarafından yürütülen ayrı değerlendirmelerde, Anthropic ve Meta modelleri, hatalı yapılandırmalar nedeniyle internete erişim yolları bularak test ortamlarının dışındaki sistemlere ulaştı. Moonshot AI'ın Kimi K3 modeli de Frontier Security tarafından işletilen korumalı alandaki bir açıktan yararlanarak internete çıktı ve GitHub üzerindeki bilgilere erişti.
İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI) tarafından yapılan testlerde ise araştırmacılar, açık kaynaklı bir projeye açık bulgu sızdırma girişimi gibi onaylanmamış gerçek dünya eylemleri gerçekleştireceklerini fark etmeden ajanlara doğrudan internet erişimi verdi. Her olayda ajanlara rastgele gerçek dünya hedeflerine saldırmaları talimatı verilmedi, yalnızca karşılaştıkları sorunu çözmek için ne gerekiyorsa onu yaptılar.
Kâr amacı gütmeyen yapay zeka kuruluşu CivAI'ın araştırma başkanı Andrew Yoon, bu olayların bir değişime işaret ettiğini ifade etti. Geçmişte yapay zeka modellerinin dolandırıcılık gibi amaçlarla insanlar tarafından kötüye kullanılmasından endişe edildiğini belirten Yoon, artık modellerin kendi başlarına birer tehdit aktörü haline geldiği bir durumda olduğumuzu söyledi.
Uzmanlar güvenli test ortamlarının çok katmanlı korumalara sahip olması gerektiğini belirtiyor. EleutherAI İcra Direktörü Stella Biderman, modellerin izole edilmiş ağlarda geliştirilmesi gerektiğini vurgularken, Box Baş Bilgi Güvenliği Sorumlusu Heather Ceylan korumalı alandan internete ve hassas sistemlere giden ağ yollarının ortadan kaldırılması gerektiğini ifade etti. Ceylan ayrıca testler sırasındaki izleme faaliyetlerinin yetersiz kaldığına dikkat çekerek kimsenin olayları anında fark etmediğini belirtti.
Anthropic, yaşadığı olayların ardından hem kendisinin hem de Irregular'ın izleme konusunda daha iyi iş çıkarabileceğini kabul etti. Uzmanlar, modeller serbest bırakılmadan önce değerlendirme ortamlarının bağımsız üçüncü taraflarca denetlenmesi çağrısında bulundu. Irregular'ın ortamlarının dış taraflarla istişare edilerek düzenli olarak gözden geçirildiği belirtilirken, Yoon ve diğer araştırmacılar sektörün öncü model güvenlik değerlendirmeleri için standartlaştırılmış bir süreç belirlemesi gerektiğini savundu.
Şirketlerin daha güvenli test ortamları kurmayı bildiğini ancak maliyetli ve zahmetli olduğu için sorun çıkana kadar yatırım yapmadığını belirten Biderman, bu durumun zorunlu hale gelene kadar değişmeyeceğini ifade etti. Öte yandan modelleri test sırasında çok sıkı tutmanın da yeni yeteneklerin keşfedilmesini engelleme riski taşıdığı belirtiliyor.
ABD'de Trump yönetimi, yeni ve güçlü modellerin kamuoyuna açıklanmadan 30 gün önce güvenlik risklerinin değerlendirileceği gönüllü bir ön dağıtım siber güvenlik değerlendirme rejimini değerlendiriyor. Ancak bu politika, olaylar dağıtımın daha erken aşamalarında gerçekleştiği için mevcut güvenlik açığı olaylarını kapsamıyor. Yoon, kendi kendini düzenleyen mekanizmaların artık yeterli olmadığını ve laboratuvarlarda model geliştirme ile test aşamalarında sıkı kontrollerin gerekli olduğunu vurguladı. AISI test süreçlerini gözden geçirirken, OpenAI ve Meta yaşanan olaylarla ilgili incelemelerini sürdürüyor.





