Hugging Faceで、Qwen3_5MoeアーキテクチャをベースにしたInternLMのモデル「AutoVerifier」が公開された。問題文と任意の参照解答、ステップごとに記述した証明案を読み取り、証明が正しいかどうか、誤りの有無、最初に間違えた箇所のインデックスを返す。モデルは40個のsafetensorシャードに分割され、合計サイズは約68 GiB。InternS1Tokenizerを使用する。AdvancedMathBenchのProverBenchスイート向けの自動採点ツールとして設計されているが、提供元は誤判定する可能性もあると注意を促している。
提供されているproof_verifier.mdテンプレートでプロンプトを作成し、トークナイザーのチャット形式に入力すれば、重みを読み込まずにモデルを実行できる。
なぜ重要か
研究者は複雑な数学の証明を手作業で採点することなく、迅速かつ自動で評価できる。