Exa AI heeft ATLAS aangekondigd, een benchmark die de nauwkeurigheid en volledigheid meet van AI-agents die op webzoekopdrachten vertrouwen. De benchmark omvat 547 onderzoekstaken uit de praktijk, gebaseerd op geanonimiseerde zoekvragen. Hieruit blijkt dat zelfs de duurste agents ongeveer een derde van de juiste resultaten missen en dat geen enkel systeem dat minder dan $1 per taak kost een row F1-score boven de 0.5 haalt.
Waarom het ertoe doet
Ontwikkelaars kunnen ATLAS gebruiken om te bepalen welke zoekbackends en agentconfiguraties de meeste waar voor hun geld bieden. Zo kunnen ze betrouwbaardere AI-tools voor onderzoek bouwen.