Exa AI, web aramasından yararlanan yapay zekâ ajanlarının doğruluğunu ve sonuçları ne ölçüde eksiksiz bulduğunu ölçen ATLAS’ı duyurdu. Test, anonimleştirilmiş arama taleplerinden derlenen gerçek dünyaya ait 547 araştırma görevini kullanıyor. Sonuçlar, en pahalı ajanların bile doğru sonuçların yaklaşık üçte birini kaçırdığını ve görev başına maliyeti $1’ın altında olan hiçbir sistemin 0.5’in üzerinde satır F1 puanına ulaşamadığını gösteriyor.
Neden önemli
Geliştiriciler ATLAS’ı kullanarak hangi arama altyapılarının ve ajan yapılandırmalarının maliyetine göre en iyi sonucu verdiğini belirleyebilir; böylece daha güvenilir, yapay zekâ destekli araştırma araçları geliştirebilir.