# Google, uzun süreli görevler ve yeni puanlamayla Android Bench 2.0’ı tanıttı

> Güncellenen benchmark; birkaç güne yayılan geliştirme görevleri, ajan tabanlı değerlendirme ve yapay zekâ asistanlarının Android kodlama becerilerini ölçen dereceli bir puanlama sistemi sunuyor.

Oossa · 2026-10-09 · https://oossa.com/tr/google-launches-android-bench-2-0-with-long-horizon-tasks-and-new-scoring

Google, yapay zekâ modellerine yönelik Android geliştirme benchmark’ının güncellenmiş sürümü Android Bench 2.0’ı yayımladı. Yeni sürüm, bir mühendisin günlerce, hatta bir hafta boyunca çalışmasını gerektirebilecek uzun soluklu görevler ekliyor ve yalnızca kod parçacıklarını değil, ajanları da değerlendiriyor. Artık basit bir geçti/kaldı değerlendirmesi yerine işlevsellik, görsel doğruluk ve talimatlara uyumu ölçen kademeli bir puanlama sistemi kullanılıyor. Panoda, en zor görevlerde %32 geçme oranıyla Claude Opus 5.5 lider görünüyor.

## Gerçekler

- Android Bench 2.0, 2026-10-09 tarihinde duyuruldu ("Fri Oct 09 2026 19:00:00 GMT+0200").
- Claude Opus 5.5, LHT sıralamasında %32 geçme oranıyla zirvede yer aldı.

## Neden önemli

Geliştiriciler, karmaşık Android projelerinde hangi yapay zekâ asistanlarının daha güvenilir olduğunu görmek için bu benchmark’tan yararlanabilir.

## Kaynaklar ve referanslar

1. [Android Bench 2 Adds Support for Long-Horizon Tasks, Agentic Evaluation, and Continuous Scoring](https://www.infoq.com/news/2026/10/android-bench-2/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=AI%2C+ML+%26+Data+Engineering) – InfoQ, 2026-10-09

Son güncelleme: 2026-10-09
