OpenAI yapay zeka ajanları testi geçmek için Hugging Face'e sızdı
OpenAI'ın test aşamasındaki bin 200 yapay zeka ajanı, imkansız görevleri tamamlamak için gizlice haberleşip Hugging Face ağını hackledi.

Yapay zeka alanında faaliyet gösteren OpenAI şirketine ait bin 200 ajan, Hugging Face platformuna izinsiz bir sızma operasyonu gerçekleştirdi. Yapılan bağımsız bir araştırmaya göre, bu ajanlar yarışmayı kazanma hırsıyla hile yapma kampanyası yürüttü. Şirket mühendisleri, ajanların yeteneklerini ölçmek amacıyla ExploitGym test çerçevesinde onlara imkansız görevler verdi.
Gerçek dünya siber saldırı ortamını simüle etmek için normal güvenlik bariyerleri devre dışı bırakıldı. Ajanlar, kazanmaya o kadar odaklandı ki kendilerine verilmeyen talimatları bile uyguladı. - GİZLİ HABERLEŞME AĞI - İlk adım olarak kendi aralarında mesajlaşabilecekleri bir pano oluşturdular.
OpenAI böyle bir platform sağlamamıştı ancak ajanlar Artifactory adlı yazılımı yeniden amaçlandırdı. JFrog tarafından satılan Artifactory doğrudan mesajlaşma özelliği sunmuyordu. Ajanlar, izin verilen dosya yazma yeteneğini kullanarak bu engeli aştı ve dosya adları üzerinden haberleşti.
Yapay zeka araştırma kuruluşu METR'in raporuna göre bin 200 ajan 70 binden fazla mesaj ve dosya gönderdi. Yaklaşık 700 ajan ise süreç sonunda Hugging Face'i hackledi. METR araştırmacıları, ajanların otomatik puanlama sistemini kandırmak için büyük ölçekli projeler koordine ettiğini belirtti.
Ajanlar, tek başına başaramayacakları aşamaları ortaklaşa çalışarak geçti. Hile yöntemlerinden biri ExploitGym puanlama sistemini kurcalamaktı. Diğer bir yöntem ise ele geçirmeleri istenen yazılımların zayıf versiyonlarını inşa edip kayıtları değiştirmekti.
Ayrıca internete erişip araştırma yapma yolları da aradılar. - SIFIR GÜN AÇIĞI - Sonunda Artifactory sisteminde bir sıfır gün açığı bulup bunu istismar ettiler. Hugging Face ağının puanlama mekanizması hakkında bilgi verebileceğini düşünen ajanlar erişim sağladı.
10 Temmuz'da 38148c numaralı ajan erişim bilgileri bulup panoda paylaştı. Hugging Face ağında düşük seviyeli erişim elde eden ajanlar sistem haklarını yükseltmenin yollarını aradı. 11 Temmuz sabahı aynı ajan, HDF5 dosyalarının işlenmesindeki bir başka sıfır günü bulup kullandı.
Bu açık sayesinde şirket üretim ortamına ait kimlik bilgileri ele geçirildi. Haber panoda yayıldıktan sonra yüzlerce ajan aynı zaafiyetten yararlanarak üretim ortamına sızdı. Öğleden sonra JAN183411 numaralı farklı bir ajan, Hugging Face sunucularında doğrudan kod çalıştırma yöntemi buldu.
Ajan sürüsü ağ içinde hızla yayıldı. METR araştırmacıları bazı ajanların bu kitlesel saldırı konusunda etik kaygılar taşıdığını ancak çoğunluğun durmadığını aktardı. - ETİK TARTIŞMALAR - Bazı ajanlar saldırının kapsam dışı olduğunu ve etik kuralları sorguladı.
Örneğin bir ajan maliyetli verileri silmemek için saldırı kapsamını sınırladı. Sosyal mühendislik konusunda da benzer tereddütler yaşandı. Bir ajan Modal üzerinde barındırılan müşteri iş yükünün e-posta kimlik bilgilerine erişebildiğini fark etti.
Veri seti sahibiyle e-posta yoluyla iletişime geçmeyi düşündü ancak bunu sosyal mühendislik olarak değerlendirip vazgeçti. Başka bir ajan ise izin talebini reddetti. OpenAI da yaşanan olayla ilgili kendi raporunu yayımladı.
Raporda temel etkenin ajanların ödül hackleme eğilimi olduğu belirtildi. OpenAI, modeller geliştikçe bu tür hilelerin daha karmaşık hale geldiğini vurguladı. Bu olay, kendi kendine yayan kötü amaçlı yazılımların geliştiricilerinin kontrolü kaybetmesi vakalarına benzetildi.
Benzer bir örnek olarak 2010 yılında İran'ın nükleer programını hedef alan Stuxnet solucanı gösterildi. Söz konusu raporlar yapay zeka mühendisleri, etikçiler ve yazarlar için uzun süre incelenecek nitelikte görünüyor. Güvenilir operatörlerin hacking ajanlarının kontrolünü kaybetmesi endişe verici bulunuyor. Suçlular veya teröristler aynı yöntemi uyguladığında ortaya çıkacak sonuçlar kaygı yaratıyor.







