Auf Hugging Face ist jetzt InternLMs AutoVerifier-Modell verfügbar, das auf der Architektur Qwen3_5Moe basiert. Es verarbeitet eine Aufgabe, eine optionale Musterlösung und einen schrittweisen Beweisvorschlag. Anschließend gibt es an, ob der Beweis korrekt ist, welche Fehler vorliegen und an welcher Stelle der erste Fehler auftritt. Das Modell umfasst 40 Safetensor-Dateien mit insgesamt rund 68 GiB und verwendet den InternS1Tokenizer. Es ist als automatischer Bewerter für die AdvancedMathBench-Suite ProverBench gedacht. Der Anbieter weist jedoch darauf hin, dass das Modell weiterhin Fehler machen kann.
Das Modell lässt sich auch ohne Laden der Gewichte ausführen: Dazu wird mithilfe der bereitgestellten Vorlage proof_verifier.md ein Prompt erstellt und anschließend im Chat-Format des Tokenizers verarbeitet.
Warum es wichtig ist
Das Modell ermöglicht es Forschenden, komplexe mathematische Beweise schnell und automatisiert zu bewerten, ohne sie manuell benoten zu müssen.