Oossa

Exa bringt ATLAS-Benchmark für agentische Websuche heraus

Der neue ATLAS-Benchmark bewertet, wie vollständig und präzise KI-Agenten bei realen Websuchen Informationen finden, und macht aktuelle Kosten- und Leistungslücken sichtbar.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Exa AI hat ATLAS vorgestellt, einen Benchmark, der die Genauigkeit und Vollständigkeit von KI-Agenten misst, die auf Websuche angewiesen sind. Er umfasst 547 praxisnahe Rechercheaufgaben, die aus anonymisierten Suchanfragen abgeleitet wurden. Der Benchmark zeigt, dass selbst die teuersten Agenten etwa ein Drittel der richtigen Ergebnisse übersehen und kein System, das weniger als $1 pro Aufgabe kostet, einen Row-F1-Wert von über 0.5 erreicht.

Warum es wichtig ist

Entwickler können mit ATLAS herausfinden, welche Such-Backends und Agentenkonfigurationen das beste Preis-Leistungs-Verhältnis bieten. So lassen sich zuverlässigere KI-gestützte Recherchetools entwickeln.

Quellen und Referenzen

1 Quellen
  1. ExaOriginalquelle lesen

Markdown

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.