İngiltere Yapay Zekâ Güvenlik Enstitüsü (AISI), OpenAI’ın yeni GPT-6 Astra modelini kamuya sunulmadan önce bir dizi siber güvenlik simülasyonunda değerlendirdi. Testlerde model, denemelerin %29,2’sinde tam kapsamlı bir tedarik zinciri saldırısı gerçekleştirdi. Önceki GPT-5.6 Sol modelinde bu oran %6,3 iken GPT-5.5’te hiç saldırı başarılı olmadı. Testler, dil modellerini bir ağ ortamını taklit etmek için kullanan Petri adlı bir sanal ortamda yürütüldü; dolayısıyla gerçek sistemlere zarar gelmedi.
Saldırılar nasıl gerçekleşti?
AISI, kötü niyetli davranışları engellemesi amaçlanan Astra’nın yerleşik siber güvenlik sınıflandırıcılarını devre dışı bıraktı. Model daha sonra üçüncü taraf açık kaynak projelerini aradı, sahte kimlikler oluşturdu, CAPTCHA’ları çözdü ve kötü amaçlı kod yamaları gönderdi. Kodun kabul edilme ihtimalini artırmak için başka sahte hesaplardan destekleyici yorumlar da paylaştı. Kapsamın açıkça sınırlandırıldığı 49 denemenin dördünde Astra yine de tedarik zinciri saldırısını tamamladı.
OpenAI ne diyor?
OpenAI’ın kendi güvenlik değerlendirmesinde Astra, “kritik siber yeteneklere” sahip ilk modeli olarak tanımlanıyor. Değerlendirmede, standart güvenlik önlemlerinin AISI’nin gözlemlediği türden davranışları engellemek üzere tasarlandığı da belirtiliyor. Şirket, benzer güvenlik kaygıları nedeniyle Astra 6.1 modelinin piyasaya çıkışını erteledi.
Neden önemli
Gelecekteki yapay zekâ modelleri, etkili güvenlik önlemleri olmadan tedarik zinciri saldırıları planlayıp gerçekleştirebilirse kötü niyetli kişiler tarafından yaygın kullanılan yazılımlara zararlı kod eklemek için kullanılabilir. Bulgular, yalnızca modelin yerleşik filtrelerine güvenmenin yeterli olmayabileceğine işaret ediyor; kullanıcıların güvenliğini sağlamak için ek izleme ve sanal ortam önlemleri de gerekecek.