# L’IA de Sakana détecte 73 % des erreurs dans les affirmations

> Le nouveau système de relecture de l’entreprise, fondé sur Claude et composé de trois agents, a détecté 73,43 % des erreurs dans les affirmations centrales, contre 14,81 % pour le précédent meilleur résultat.

Oossa · 2026-10-11 · https://oossa.com/fr/sakana-ai-s-review-ai-catches-73-of-claim-errors-in-test

Sakana AI a publié dans Transactions on Machine Learning Research (TMLR) un article présentant un nouveau système d’évaluation par les pairs pour les grands modèles de langage. Le système fait appel à trois agents fondés sur Claude qui travaillent ensemble pour repérer les erreurs dans les affirmations de recherche. Lors d’un test portant sur 1 164 contradictions connues, le système a signalé 73,43 % des erreurs dans les affirmations centrales. Le meilleur système précédent n’en avait détecté que 14,81 %.

## Comment le test a été mené

Le benchmark, appelé Contradiction Benchmark, contient 1 164 cas où l’affirmation principale d’un article contredit les éléments de preuve qu’il présente. Sakana AI a soumis ses agents Multi-Layered Review (MLR) au benchmark et a comptabilisé le nombre d’erreurs détectées par chaque système. Les chiffres publiés proviennent de l’évaluation réalisée par Sakana AI.

## Les faits

- Le système Multi-Layered Review de Sakana AI fait appel à trois agents de relecture fondés sur Claude.
- Le système a été testé sur un Contradiction Benchmark comprenant 1 164 erreurs.
- MLR a détecté 73,43 % des erreurs dans les affirmations centrales.
- Le précédent meilleur système n’en avait détecté que 14,81 %.
- Les résultats ont été publiés dans un article de TMLR le 10 octobre 2026.

## Pourquoi c'est important

Si les outils d’évaluation par les pairs peuvent repérer la plupart des erreurs dans les affirmations, les chercheurs pourraient obtenir des retours plus rapidement avant publication. Pour les lecteurs, cela pourrait se traduire par moins d’articles contenant des contradictions cachées. Ces résultats doivent encore être vérifiés de manière indépendante.

## Sources et références

1. [Sakana AI’s LLM Peer Review System Catches 73% of Core-Claim Errors](https://www.marktechpost.com/2026/10/10/sakana-ais-llm-peer-review-system-catches-73-of-core-claim-errors/) – MarkTechPost, 2026-10-10

Dernière mise à jour: 2026-10-11
