Exa AI hat ATLAS vorgestellt, einen Benchmark, der die Genauigkeit und Vollständigkeit von KI-Agenten misst, die auf Websuche angewiesen sind. Er umfasst 547 praxisnahe Rechercheaufgaben, die aus anonymisierten Suchanfragen abgeleitet wurden. Der Benchmark zeigt, dass selbst die teuersten Agenten etwa ein Drittel der richtigen Ergebnisse übersehen und kein System, das weniger als $1 pro Aufgabe kostet, einen Row-F1-Wert von über 0.5 erreicht.
Warum es wichtig ist
Entwickler können mit ATLAS herausfinden, welche Such-Backends und Agentenkonfigurationen das beste Preis-Leistungs-Verhältnis bieten. So lassen sich zuverlässigere KI-gestützte Recherchetools entwickeln.