# Anthropic testi: Yeni modeller kod yürütmesini ele geçirebiliyor

> Kırmızı takım testlerinde GLM-5.3 ve Claude Mythos Preview, az sayıda görevde kontrol akışını ele geçirmeyi başardı; bu, önceki modellere kıyasla bir ilerleme.

Oossa · 2026-09-29 · https://oossa.com/tr/anthropic-frontier-test-shows-new-models-can-hijack-code-execution

Anthropic’in kurum içi kırmızı takımı, 29 Eylül 2026’da Frontier testine ilişkin kısa bir rapor yayımladı. Ekip, şirketin en yeni modellerinden GLM-5.3 ve Claude Mythos Preview’a karşı rastgele seçilmiş 100 ikili istismar testi gerçekleştirdi. GLM-5.3 denemelerin %4’ünde kontrol akışını tamamen ele geçirirken Claude Mythos Preview %6’sında başarılı oldu. Claude Opus 4.6 ve GLM-5.2 gibi önceki sürümler aynı testte kontrol akışını hiç ele geçiremedi.

## Rakamlar ne anlama geliyor?

Kontrol akışını ele geçirme, bir programın saldırganın seçtiği kodu çalıştırmaya kandırılmasıdır. Güvenlik alanında bu, bir sistemin kontrolünü ele geçirmenin klasik yollarından biridir. Modellerin az sayıdaki denemede bu tür açıkları kullanabilmesi, işe yarar saldırı yükleri oluşturacak kadar düşük seviyeli kod bilgisi edindiklerini gösteriyor. Kırmızı takım, modellerinden herhangi birinin bu eşiği ilk kez aştığını belirtiyor.

## Gündelik kullanıcılar için neden önemli?

Çoğu kişi ikili istismar testleriyle hiç karşılaşmayacak; ancak bu sonuç, gelecekteki yapay zekâ asistanlarının kötüye kullanılmaları hâlinde daha güçlü ve potansiyel olarak zararlı betikler yazabileceğine işaret ediyor. Ayrıca güvenlik ekiplerinin yapay zekâ tarafından üretilen kodlara, insanlar tarafından yazılan kodlar kadar temkinli yaklaşması gerekecek. Şimdilik bu yetenek sınırlı; vakaların yalnızca birkaç yüzdesinde görülüyor. Yine de güvenlik çalışmaları açısından yeni bir alanın ortaya çıktığını gösteriyor.

## Gerçekler

- Kırmızı takım, 29 Eylül 2026’da Anthropic’in kurum içi Binary Exploitation kıyaslama testinden rastgele seçilen 100 görevi değerlendirdi.
- GLM-5.3 denemelerin %4’ünde kontrol akışını tamamen ele geçirmeyi başardı.
- Claude Mythos Preview denemelerin %6’sında kontrol akışını tamamen ele geçirmeyi başardı.
- Önceki modeller Claude Opus 4.6 ve GLM-5.2 aynı testte kontrol akışını hiç ele geçiremedi.

## Neden önemli

Bu bulgular, günümüzün büyük dil modellerinin programların kontrolünü gerçekten ele geçiren kodlar üretebildiğini ve bunun Anthropic’in modellerinde daha önce görülmemiş bir yetenek olduğunu gösteriyor. Başarı oranı hâlâ düşük olsa da yapay zekâ araçları yazılım geliştirmek veya kod incelemek için kullanıldığında daha güçlü güvenlik önlemlerine ihtiyaç duyulabileceğine işaret ediyor.

## Kaynaklar ve referanslar

1. [Quoting Anthropic Frontier Red Team](https://simonwillison.net/2026/Sep/29/anthropic-frontier-red-team/) – Simon Willison, 2026-09-29

Son güncelleme: 2026-09-29
