Google, yapay zekâ modellerine yönelik Android geliştirme benchmark’ının güncellenmiş sürümü Android Bench 2.0’ı yayımladı. Yeni sürüm, bir mühendisin günlerce, hatta bir hafta boyunca çalışmasını gerektirebilecek uzun soluklu görevler ekliyor ve yalnızca kod parçacıklarını değil, ajanları da değerlendiriyor. Artık basit bir geçti/kaldı değerlendirmesi yerine işlevsellik, görsel doğruluk ve talimatlara uyumu ölçen kademeli bir puanlama sistemi kullanılıyor. Panoda, en zor görevlerde %32 geçme oranıyla Claude Opus 5.5 lider görünüyor.
Neden önemli
Geliştiriciler, karmaşık Android projelerinde hangi yapay zekâ asistanlarının daha güvenilir olduğunu görmek için bu benchmark’tan yararlanabilir.