Exa AI از ATLAS رونمایی کرد؛ بنچمارکی برای سنجش دقت و کاملبودن نتایج عاملهای هوش مصنوعی که به جستوجوی وب متکیاند. این بنچمارک از 547 مأموریت پژوهشی واقعی استفاده میکند که از تقاضاهای جستوجوی ناشناسسازیشده استخراج شدهاند. نتایج نشان میدهد حتی گرانترین عاملها هم حدود یکسوم نتایج درست را از دست میدهند و هیچ سامانهای که هزینهاش برای هر مأموریت کمتر از $1 باشد، به امتیاز F1 سطری بالاتر از 0.5 نمیرسد.
چرا مهم است
توسعهدهندگان میتوانند از ATLAS برای شناسایی بهترین ترکیبِ موتورهای جستوجو و پیکربندی عاملها از نظر بازده هزینه استفاده کنند و ابزارهای پژوهشیِ مبتنی بر هوش مصنوعیِ قابلاعتمادتری بسازند.