OossaYapay zekâ hızla gelişiyor. Biz basitçe anlatıyoruz.

Anthropic testi: Yeni modeller kod yürütmesini ele geçirebiliyor

Kırmızı takım testlerinde GLM-5.3 ve Claude Mythos Preview, az sayıda görevde kontrol akışını ele geçirmeyi başardı; bu, önceki modellere kıyasla bir ilerleme.

Oossa1 dk okuma

Anthropic testi: Yeni modeller kod yürütmesini ele geçirebiliyor
Photo by Mohammad Rahmani on Unsplash

Anthropic’in kurum içi kırmızı takımı, 29 Eylül 2026’da Frontier testine ilişkin kısa bir rapor yayımladı. Ekip, şirketin en yeni modellerinden GLM-5.3 ve Claude Mythos Preview’a karşı rastgele seçilmiş 100 ikili istismar testi gerçekleştirdi. GLM-5.3 denemelerin %4’ünde kontrol akışını tamamen ele geçirirken Claude Mythos Preview %6’sında başarılı oldu. Claude Opus 4.6 ve GLM-5.2 gibi önceki sürümler aynı testte kontrol akışını hiç ele geçiremedi.

Rakamlar ne anlama geliyor?

Kontrol akışını ele geçirme, bir programın saldırganın seçtiği kodu çalıştırmaya kandırılmasıdır. Güvenlik alanında bu, bir sistemin kontrolünü ele geçirmenin klasik yollarından biridir. Modellerin az sayıdaki denemede bu tür açıkları kullanabilmesi, işe yarar saldırı yükleri oluşturacak kadar düşük seviyeli kod bilgisi edindiklerini gösteriyor. Kırmızı takım, modellerinden herhangi birinin bu eşiği ilk kez aştığını belirtiyor.

Gündelik kullanıcılar için neden önemli?

Çoğu kişi ikili istismar testleriyle hiç karşılaşmayacak; ancak bu sonuç, gelecekteki yapay zekâ asistanlarının kötüye kullanılmaları hâlinde daha güçlü ve potansiyel olarak zararlı betikler yazabileceğine işaret ediyor. Ayrıca güvenlik ekiplerinin yapay zekâ tarafından üretilen kodlara, insanlar tarafından yazılan kodlar kadar temkinli yaklaşması gerekecek. Şimdilik bu yetenek sınırlı; vakaların yalnızca birkaç yüzdesinde görülüyor. Yine de güvenlik çalışmaları açısından yeni bir alanın ortaya çıktığını gösteriyor.

Neden önemli

Bu bulgular, günümüzün büyük dil modellerinin programların kontrolünü gerçekten ele geçiren kodlar üretebildiğini ve bunun Anthropic’in modellerinde daha önce görülmemiş bir yetenek olduğunu gösteriyor. Başarı oranı hâlâ düşük olsa da yapay zekâ araçları yazılım geliştirmek veya kod incelemek için kullanıldığında daha güçlü güvenlik önlemlerine ihtiyaç duyulabileceğine işaret ediyor.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.

Kaynaklar ve referanslar

#KaynakYayınTarihAna fikir
1Quoting Anthropic Frontier Red Team ↗Simon Willison29 Eyl 2026<blockquote cite="https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities"><p>We evaluate several models on

1 kaynak

Son güncelleme: ·Markdown·llms.txt