· 1 dk okuma
Yeni model, yapay zekâ jailbreak saldırılarının çabayla nasıl ölçeklendiğini tahmin ediyor
Marco Biroli liderliğindeki araştırmacılar, saldırganlar daha fazla istem denedikçe jailbreak girişimlerinin ne sıklıkta başarılı olacağını tahmin etmek için basit bir formül sunan makaleyi 29 Eylül 2026’da yayımladı.
Oossa · Oossa Hakkında
Bilgisayar bilimci Marco Biroli, 29 Eylül 2026’da arXiv’de “Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking” başlıklı bir makale yayımladı. Çalışma, saldırganın iki değişkeni artırmasıyla jailbreak saldırılarının başarı oranının nasıl değiştiğini açıklayan basit bir “bariyer modeli” ortaya koyuyor: istem varyantlarının sayısı (N) ve her varyant başına yanıt sayısı (M). Model, güvenlik mekanizmalarıyla ilişkili yalnızca dört sayı kullanıyor; buna rağmen şimdiye kadar test edilenlerden çok daha büyük ölçekli saldırıların sonuçlarını tahmin edebiliyor.
Yeni model ne yapıyor?
Model, her istemin temel bir güvenlik düzeyi olduğunu varsayıyor ve buna saldırganın yeterince farklı seçenek denemesiyle aşılabilecek rastgele bir “bariyer” ekliyor. Yazarlar, dört sayıyı beş farklı dil modelinden elde edilen verilere uydurarak beş modelin de aynı ölçeklendirme eğrisi üzerinde birleştiğini gösteriyor. Böylece önceki çalışmaların güvenilir biçimde yapamadığı bir şekilde, 100’e kadar istem varyantıyla gerçekleştirilen deneylerden 10.000 varyantlı senaryolara ilişkin tahminler üretebiliyorlar.
Makale ayrıca üretim sıcaklığının (yapay zekâ çıktılarındaki rastgeleliği kontrol eden ayar) saldırı başarısını nasıl etkilediğini de inceliyor. Yazarlar, aynı dört sayıyı kullanarak daha önce hiç test etmedikleri sıcaklık değerlerindeki başarı oranlarını tahmin edebiliyor.
Yapay zekâ güvenliği açısından neden önemli?
Modelin tahminleri doğrulanırsa güvenlik mühendisleri, jailbreak’in olası hâle gelmesi için saldırganın kaç farklı istem denemesi gerekeceğini hesaplayabilir. Bu da herkese açık API’lerde ne kadar isteme izin verileceğine gerçekçi sınırlar koymaya veya şüpheli kalıpları daha sıkı izlemeye yardımcı olur.
Çalışma, saldırı başarısının N ile basit bir kuvvet yasası ilişkisi izlediğini öne süren önceki iddialara da meydan okuyor. Sıcaklığa bağlı, daha incelikli bir eğri ortaya koyarak savunmaların yalnızca deneme sayısını değil, birden fazla etkeni göz önünde bulundurması gerektiğine işaret ediyor.
Neden önemli
Model, yapay zekâ geliştiricilerine saldırganların güvenlik önlemlerini aşmasının ne kadar zor olduğunu hızla değerlendirme olanağı sunuyor; bu da API sınırlarının ve izleme araçlarının belirlenmesine yardımcı olabilir. Ayrıca yalnızca deneme sayısı gibi tek bir ölçüte güvenmenin, jailbreak’leri kolaylaştıran diğer etkenleri gözden kaçırabileceği uyarısında bulunuyor.
Kaynaklar ve referanslar
| # | Kaynak | Yayın | Tarih | Ana fikir |
|---|---|---|---|---|
| 1 | Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗ | arXiv | 29 Eyl 2026 | arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ |
1 kaynak
Son güncelleme:
Oossa · Bülten
Yapay zekâda hafta, anlaşılır dille
Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.