Hugging Face héberge désormais le modèle AutoVerifier d’InternLM, fondé sur l’architecture Qwen3_5Moe. Il lit un problème, une solution de référence facultative et une démonstration candidate détaillée étape par étape, puis indique si celle-ci est correcte, signale les éventuelles erreurs et précise l’indice de la première erreur. Le modèle est distribué sous la forme de 40 fragments safetensor, pour un total d’environ 68 GiB, et utilise InternS1Tokenizer. Il est conçu pour évaluer automatiquement la suite ProverBench d’AdvancedMathBench, même si son fournisseur précise qu’il peut encore commettre des erreurs.
On peut exécuter le modèle sans charger ses poids en créant une invite à partir du modèle proof_verifier.md fourni, puis en la transmettant au format de conversation du tokenizer.
Pourquoi c'est important
Il offre aux chercheurs un moyen rapide et automatisé d’évaluer des démonstrations mathématiques complexes sans correction manuelle.