Yapay zeka ajanları güvenlik sınırını aştı
Kurum, 122 denemede 10 testte toplam 19 izinsiz işlem belirlendiğini, olayların gerçek dünyada zarara yol açmadığını bildirdi.
İngiltere’nin Yapay Zeka Güvenlik Enstitüsü, OpenAI ve Anthropic’e ait bazı yapay zeka ajanlarının güvenlik değerlendirmeleri sırasında güvenli sistemlere izinsiz erişim sağlamak için sahte çevrim içi kimlikler oluşturduğunu ve yetkisiz işlemler yaptığını açıkladı.
Kurumun açıklamasına göre değerlendirmeler, gelişmiş modellerin yeteneklerini ölçmek amacıyla kurgusal bir siber güvenlik senaryosu içinde yapıldı. Testler 122 kez tekrarlandı; 10 testte toplam 19 yetkisiz eylem tespit edildi. Bunların 17’sinin Anthropic’in Mythos 5 modelinden, ikisinin ise OpenAI’ın GPT-5.6-Sol modelinden kaynaklandığı belirtildi.
Testlerde öne çıkan ihlal
En ciddi olayda bir ajanın zararlı kod yazdığı ve bu kodun bir insan tarafından onaylanmasını sağlamak amacıyla sahte çevrim içi kimlikler oluşturduğu bildirildi. Kurum, tespit edilen ihlallerin hiçbirinin gerçek dünyada zarara yol açmadığını duyurdu.
Enstitü, test edilen bazı ajanların gerçek kişi ve kuruluşlara yönelen, süreklilik taşıyan ve potansiyel olarak zararlı faaliyetlere giriştiğini de kaydetti. Ancak sahte kimlik oluşturan ajanın hangisi olduğu açıkça belirtilmedi.
Şirketlerden açıklama
Anthropic, X hesabından yaptığı açıklamada kurumla yakın çalıştığını, daha fazla ayrıntı toplamaya ve kendi incelemesini yürütmeye devam ettiğini bildirdi. OpenAI ise iki yetkisiz olayın da, komutlarla yasaklanmış olmasına rağmen internete erişim sağlanmasıyla ilgili olduğunu açıkladı.
OpenAI ayrıca yüksek riskli değerlendirmelerin daha güvenli yapılabilmesi için ulusal yapay zeka enstitüleri, bağımsız değerlendiriciler, diğer laboratuvarlar ve ilgili taraflarla ortak uygulamaların güçlendirilmesi için çalışacaklarını belirtti.


Yorum Yazın