Oossa

Sakana AIs Prüf-KI erkennt 73 % der Fehler in Studienbehauptungen

Der neue Prüfer des Unternehmens mit drei Claude-basierten Agenten fand 73,43 % der Fehler in zentralen Behauptungen – deutlich mehr als der bisherige Spitzenwert von 14,81 %.

Von Von Oossa veröffentlicht: 1 Min. Lesezeit

Andreea Avramescu · Unsplash

Sakana AI hat in der Fachzeitschrift Transactions on Machine Learning Research (TMLR) eine Arbeit über ein neues Peer-Review-System für große Sprachmodelle veröffentlicht. Das System nutzt drei Claude-basierte Agenten, die gemeinsam Fehler in Forschungsbehauptungen aufspüren. In einem Benchmark mit 1.164 bekannten Widersprüchen erkannte das System 73,43 % der Fehler in zentralen Behauptungen. Das zuvor beste System fand nur 14,81 % derselben Fehler.

So wurde der Test durchgeführt

Der Contradiction Benchmark umfasst 1.164 Fälle, in denen die Hauptaussage einer wissenschaftlichen Arbeit den darin vorgelegten Belegen widerspricht. Sakana AI ließ seine Agenten für das Multi-Layered Review (MLR) den Benchmark prüfen und erfasste, wie viele Fehler die einzelnen Systeme erkannten. Die veröffentlichten Zahlen stammen aus einer eigenen Auswertung von Sakana AI.

Warum es wichtig ist

Wenn Peer-Review-Tools die meisten Fehler in Behauptungen aufspüren können, erhalten Forschende möglicherweise schneller Rückmeldung, bevor sie ihre Arbeit veröffentlichen. Für Leser könnte das weniger Arbeiten mit versteckten Widersprüchen bedeuten. Die Ergebnisse müssen noch unabhängig überprüft werden.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.