Sakana AI, Transactions on Machine Learning Research’te (TMLR) büyük dil modelleri için geliştirdiği yeni bir hakem değerlendirme sistemini anlatan bir makale yayımladı. Sistem, araştırma iddialarındaki hataları bulmak için birlikte çalışan, Claude tabanlı üç ajan kullanıyor. Bilinen 1.164 çelişkinin yer aldığı bir kıyaslama testinde sistem, temel iddialardaki hataların %73,43’ünü işaretledi. Daha önceki en iyi sistem ise aynı hataların yalnızca %14,81’ini yakalamıştı.
Test nasıl düzenlendi?
Contradiction Benchmark (Çelişki Kıyaslaması) adı verilen test, bir makalenin temel iddiasının kendi bulgularıyla çeliştiği 1.164 örnek içeriyor. Sakana AI, Multi-Layered Review (MLR) ajanlarını bu testte çalıştırdı ve her sistemin kaç hatayı tespit ettiğini kaydetti. Açıklanan rakamlar, Sakana AI’nin kendi değerlendirmesine dayanıyor.
Neden önemli
Hakem değerlendirme araçları iddia hatalarının çoğunu bulabilirse, araştırmacılar yayımdan önce daha hızlı geri bildirim alabilir. Okurlar açısından bu, gizli çelişkiler içeren makalelerin azalması anlamına gelebilir. Sonuçların bağımsız olarak doğrulanması gerekiyor.