Oossa

InternLM 在 Hugging Face 发布 AutoVerifier 数学证明评分模型

这款新模型可检查自然语言形式的证明、指出错误并标记最早出错的步骤,帮助评估 AdvancedMathBench 提交内容。

简讯Oossa1 分钟阅读

Hugging Face 现已上线 InternLM 的 AutoVerifier 模型,该模型基于 Qwen3_5Moe 架构。它会读取题目、可选的参考解答以及逐步展开的待评证明,并返回证明是否正确、存在何种错误,以及最早出错步骤的序号。该模型以 40 个 safetensor 分片的形式打包,总大小约为 68 GiB,并使用 InternS1Tokenizer。它旨在充当 AdvancedMathBench ProverBench 套件的自动评分器,但发布方也提醒,该模型仍可能出错。

无需加载权重即可运行该模型:使用提供的 proof_verifier.md 模板构造提示词,再将其输入 tokenizer 的聊天格式即可。

为什么重要

它为研究人员提供了一种快速、自动评估复杂数学证明的方法,无需人工评分。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。

来源与参考

#来源发布方日期要点
1New model on Hugging Face: internlm/AdvancedMathBench-AutoVerifier (image-text-to-text) ↗InternLM2026年9月29日Organisation internlm published internlm/AdvancedMathBench-AutoVerifier.

1 个来源

最后更新: ·Markdown·llms.txt