Exa AI har presenterat ATLAS, ett test som mäter hur korrekta och fullständiga resultat AI-agenter som använder webbsökning hittar. Testet omfattar 547 verklighetsbaserade researchuppgifter hämtade från anonymiserad sökefterfrågan. Det visar att även de dyraste agenterna missar ungefär en tredjedel av de korrekta resultaten, och att inget system som kostar under $1 per uppgift når ett row F1-värde över 0.5.
Varför det spelar roll
Utvecklare kan använda ATLAS för att ta reda på vilka sökbackends och agentkonfigurationer som ger mest för pengarna, och därmed skapa mer tillförlitliga AI-drivna researchverktyg.