Oossa

L’IA de Sakana détecte 73 % des erreurs dans les affirmations

Le nouveau système de relecture de l’entreprise, fondé sur Claude et composé de trois agents, a détecté 73,43 % des erreurs dans les affirmations centrales, contre 14,81 % pour le précédent meilleur résultat.

Par Publié par Oossa: 1 min de lecture

Andreea Avramescu · Unsplash

Sakana AI a publié dans Transactions on Machine Learning Research (TMLR) un article présentant un nouveau système d’évaluation par les pairs pour les grands modèles de langage. Le système fait appel à trois agents fondés sur Claude qui travaillent ensemble pour repérer les erreurs dans les affirmations de recherche. Lors d’un test portant sur 1 164 contradictions connues, le système a signalé 73,43 % des erreurs dans les affirmations centrales. Le meilleur système précédent n’en avait détecté que 14,81 %.

Comment le test a été mené

Le benchmark, appelé Contradiction Benchmark, contient 1 164 cas où l’affirmation principale d’un article contredit les éléments de preuve qu’il présente. Sakana AI a soumis ses agents Multi-Layered Review (MLR) au benchmark et a comptabilisé le nombre d’erreurs détectées par chaque système. Les chiffres publiés proviennent de l’évaluation réalisée par Sakana AI.

Pourquoi c'est important

Si les outils d’évaluation par les pairs peuvent repérer la plupart des erreurs dans les affirmations, les chercheurs pourraient obtenir des retours plus rapidement avant publication. Pour les lecteurs, cela pourrait se traduire par moins d’articles contenant des contradictions cachées. Ces résultats doivent encore être vérifiés de manière indépendante.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.