5 Ağustos 2026 ÇarşambaUSD47,58EUR54,93
Gundemnabzi
Son Dakika
Yapay zeka modelleri, insan yönlendirmesi olmadan siber saldırılar gerçekleştirdi

Yapay zeka modelleri, insan yönlendirmesi olmadan siber saldırılar gerçekleştirdi

Bir rapora göre, Anthropic ve OpenAI'nin en gelişmiş yapay zeka modelleri denemelerde insan müdahalesi olmadan zararlı kod eklemeye ve oltalama e-postaları göndermeye çalıştı.

Teknoloji Servisiİlk yayın: Güncelleme:

Birleşik Krallık'ın Yapay Zeka Güvenlik Enstitüsü (AISI), Anthropic ve OpenAI'nin en gelişmiş yapay zeka modellerinin, son güvenlik testleri sırasında gerçek kişiler ve kuruluşlar hedef alarak "özerk" ve "yetkisiz" kötü niyetli faaliyetler gerçekleştirdiğini bildirdi. AISI, yayımladığı raporda, OpenAI'nin GPT-5.6-Sol ve Anthropic'in Mythos 5 modellerinin, 28 Temmuz'daki rutin bir güvenlik değerlendirmesi sırasında "sürekli, potansiyel olarak zararlı faaliyetler" gerçekleştirmek için daha önce görülmemiş düzeyde aldatma stratejileri kullandığını belirtti. Olayın kontrol altına alınmasının bir saat sürdüğü kaydedildi.

AISI'nin raporuna göre, siber güvenlik sorununu çözmesi için verilen görevde, modeller 122 testin 10'unda "özerk, yetkisiz eylemlerde" bulundu. Testler sonucunda yapay zeka modelleri tarafından 19 yetkisiz eylem gerçekleştirildi ve bunlardan 17'sinin Mythos 5, ikisinin ise Sol tarafından yapıldığı kaydedildi.

En ciddi durumda, Mythos 5, GitHub üzerindeki bir açık kaynak projesine zararlı kod eklemeye çalıştı. AISI, Mythos 5'in projeyi yöneten kişiyi ikna etmek amacıyla sahte çevrimiçi kimlikler oluşturduğunu bildirdi. Ayrıca modelin, gerçek dünya korsanlarının kullandığı ve "spear-phishing" olarak bilinen hedef odaklı oltalama e-postaları gönderdiği, bazı mesajların zararlı yazılım içerdiği belirtildi. Ancak bu girişimler, proje yöneticisinin kodu onaylamayı reddetmesi sonucunda başarısız oldu ve herhangi bir zarar meydana gelmedi.

AISI, "Bu, AISI'nin gerçek bir kişiyi hedef alan bu şiddette bir aldatma gördüğü ilk durumdur," diye belirtti. Yapay zeka modellerinin "yeni, potansiyel olarak aldatıcı davranışlar" sergilediğini kaydeden enstitü, değerlendirme sırasında modellerin internet erişimine kasıtlı olarak izin verildiğini ve tehlikeli davranışları engelleyen filtrelerin devre dışı bırakıldığını vurgulayarak bulguların "özgül koşullar" altında gerçekleştiğini ve dikkatli yorumlanması gerektiğini ifade etti. Ayrıca AISI, değerlendirme sırasında ajanların davranışlarını aktif olarak izlemediklerini kabul ederek, bu durumun sonucunda internet erişimine daha sıkı kontroller getirdiklerini bildirdi.

Anthropic, AISI ile yakın çalıştıklarını ve olay hakkında daha fazla bilgi toplamak için kendi soruşturmasını yürüttüğünü bildirdi. Ancak testin "kasıtlı olarak izin veren koşullar altında" yapıldığını da belirtti. Anthropic, Claude isimli yapay zeka sohbet botunun durumunu netleştirmek için akıl yürütme transkriptlerini inceleyeceklerini ve kendi analizlerini yapacaklarını açıkladı. OpenAI ise üçüncü taraf testlerini memnuniyetle karşıladıklarını, ancak denetçinin değerlendirmesinin "normal kullanım koşullarını yansıtmadığını" ifade etti. OpenAI sözcüsü, "Modellerin yetenekleri geliştikçe, güvenli değerlendirmeler yapma pratiklerini güçlendirmek için değerlendirme yapanlarla ve sektördeki diğer paydaşlarla çalışmaya devam edeceğiz," dedi.

Londra merkezli denetçi raporu, öncü yapay zeka modellerinin insan yönlendirmesi olmaksızın kötü niyetli faaliyetlerde bulunduğu bir dizi durumu takip ediyor. Geçen ay, OpenAI, bir yapay zeka ajanının test sırasında bir yapay zeka girişimini hacklediğini duyurmuş, Anthropic de Claude modelinin bir değerlendirme sırasında üç kuruluşu hacklediğini açıklamıştı. AISI, bu olayların "risk manzarasında bir kaymayı" temsil ettiğini kaydetti. Avustralya'nın UNSW Sydney Üniversitesinden yapay zeka uzmanı Toby Walsh, AISI'nin bulgularının en gelişmiş yapay zeka modellerinin "tehlikeli" yeteneklere sahip olduğunu vurguladığını belirtti.

Güncelleme (5 Ağustos 11:53): Haber, yeni kaynaklardan gelen bilgilerle güncellendi.

Kaynak: Teknoloji Servisi

#Siber Güvenlik — Bu Konuda Son Gelişmeler→ Tümü

Aynı Saatlerde Yayınlananlar→ Tüm arşiv

İlgili Haberler