Oossa

Google, uzun süreli görevler ve yeni puanlamayla Android Bench 2.0’ı tanıttı

Güncellenen benchmark; birkaç güne yayılan geliştirme görevleri, ajan tabanlı değerlendirme ve yapay zekâ asistanlarının Android kodlama becerilerini ölçen dereceli bir puanlama sistemi sunuyor.

Kısa haberYazan: Oossa yayın tarihi: 1 dk okuma

Google, yapay zekâ modellerine yönelik Android geliştirme benchmark’ının güncellenmiş sürümü Android Bench 2.0’ı yayımladı. Yeni sürüm, bir mühendisin günlerce, hatta bir hafta boyunca çalışmasını gerektirebilecek uzun soluklu görevler ekliyor ve yalnızca kod parçacıklarını değil, ajanları da değerlendiriyor. Artık basit bir geçti/kaldı değerlendirmesi yerine işlevsellik, görsel doğruluk ve talimatlara uyumu ölçen kademeli bir puanlama sistemi kullanılıyor. Panoda, en zor görevlerde %32 geçme oranıyla Claude Opus 5.5 lider görünüyor.

Neden önemli

Geliştiriciler, karmaşık Android projelerinde hangi yapay zekâ asistanlarının daha güvenilir olduğunu görmek için bu benchmark’tan yararlanabilir.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.