Oossa

未解決の数学・物理問題を評価する「OpenProblemBench」公開

未解決問題82件を収録した新ベンチマークで、GPT-6-Astraは14%を解決。他のモデルを大きく上回った。

短信著者: Oossa公開日: 1 分で読める

数学と理論物理学の未解決問題82件を集めた評価セット「OpenProblemBench」が研究者らによって公開された。各問題には研究の背景と、解答を判定する明確な基準が添えられている。提出された解答は、正解例を参照せずに4つの評価モデルが採点し、正確さと進展度を評価する。テストでは、GPT-6-Astraの平均解決率は14.0%だった一方、他のフルサイズのオープンモデルは5.5~6.7%、Flashモデルは2.4~3.7%だった。

なぜ重要か

最新の大規模言語モデルが、実際の研究課題で測定可能な進展を挙げられることを示しており、理論科学におけるAIの役割が広がりつつあることをうかがわせる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。