Hugging Face ospita ora il modello AutoVerifier di InternLM, basato sull’architettura Qwen3_5Moe. Il modello legge un problema, un’eventuale soluzione di riferimento e una dimostrazione candidata articolata passaggio per passaggio; restituisce quindi un giudizio sulla correttezza della dimostrazione, gli eventuali errori e l’indice del primo errore. Il modello è distribuito in 40 shard safetensor, per un totale di circa 68 GiB, e usa InternS1Tokenizer. È pensato come valutatore automatico per la suite ProverBench di AdvancedMathBench, anche se il fornitore avverte che può ancora commettere errori.
È possibile usare il modello senza caricarne i pesi: basta creare un prompt con il template proof_verifier.md fornito e poi passarlo al tokenizer nel formato chat.
Perché conta
Offre ai ricercatori un modo rapido e automatico per valutare dimostrazioni matematiche complesse senza doverle correggere manualmente.