Oossa

InternLM、数学証明を採点するモデル「AutoVerifier」をHugging Faceで公開

新モデルは自然言語による証明を検証し、誤りを指摘して最初に間違えたステップを特定する。AdvancedMathBenchへの提出物の評価を支援する。

短信Oossa1 分で読める

Hugging Faceで、Qwen3_5MoeアーキテクチャをベースにしたInternLMのモデル「AutoVerifier」が公開された。問題文と任意の参照解答、ステップごとに記述した証明案を読み取り、証明が正しいかどうか、誤りの有無、最初に間違えた箇所のインデックスを返す。モデルは40個のsafetensorシャードに分割され、合計サイズは約68 GiB。InternS1Tokenizerを使用する。AdvancedMathBenchのProverBenchスイート向けの自動採点ツールとして設計されているが、提供元は誤判定する可能性もあると注意を促している。

提供されているproof_verifier.mdテンプレートでプロンプトを作成し、トークナイザーのチャット形式に入力すれば、重みを読み込まずにモデルを実行できる。

なぜ重要か

研究者は複雑な数学の証明を手作業で採点することなく、迅速かつ自動で評価できる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。

出典と参考資料

#出典媒体日付要点
1New model on Hugging Face: internlm/AdvancedMathBench-AutoVerifier (image-text-to-text) ↗InternLM2026/09/29Organisation internlm published internlm/AdvancedMathBench-AutoVerifier.

1 件の出典

最終更新: ·Markdown·llms.txt