Oossa

Sakana AI’nin yapay zekâsı iddia hatalarının %73’ünü yakaladı

Şirketin Claude tabanlı üç ajanlı yeni inceleme sistemi, temel iddialardaki hataların %73,43’ünü buldu. Önceki en iyi sonuç %14,81’di.

Yazan: Oossa yayın tarihi: 1 dk okuma

Andreea Avramescu · Unsplash

Sakana AI, Transactions on Machine Learning Research’te (TMLR) büyük dil modelleri için geliştirdiği yeni bir hakem değerlendirme sistemini anlatan bir makale yayımladı. Sistem, araştırma iddialarındaki hataları bulmak için birlikte çalışan, Claude tabanlı üç ajan kullanıyor. Bilinen 1.164 çelişkinin yer aldığı bir kıyaslama testinde sistem, temel iddialardaki hataların %73,43’ünü işaretledi. Daha önceki en iyi sistem ise aynı hataların yalnızca %14,81’ini yakalamıştı.

Test nasıl düzenlendi?

Contradiction Benchmark (Çelişki Kıyaslaması) adı verilen test, bir makalenin temel iddiasının kendi bulgularıyla çeliştiği 1.164 örnek içeriyor. Sakana AI, Multi-Layered Review (MLR) ajanlarını bu testte çalıştırdı ve her sistemin kaç hatayı tespit ettiğini kaydetti. Açıklanan rakamlar, Sakana AI’nin kendi değerlendirmesine dayanıyor.

Neden önemli

Hakem değerlendirme araçları iddia hatalarının çoğunu bulabilirse, araştırmacılar yayımdan önce daha hızlı geri bildirim alabilir. Okurlar açısından bu, gizli çelişkiler içeren makalelerin azalması anlamına gelebilir. Sonuçların bağımsız olarak doğrulanması gerekiyor.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.