Oossa

OpenProblemBench avalia IA em problemas abertos de matemática e física

O novo conjunto OpenProblemBench reúne 82 problemas em aberto. O GPT-6-Astra resolveu 14% deles, bem mais do que outros modelos.

NotaPor Publicado pelo Oossa: 1 min de leitura

Pesquisadores lançaram o OpenProblemBench, uma bateria de testes com 82 problemas ainda sem solução em matemática e física teórica. Para cada problema, o benchmark apresenta o contexto da pesquisa e critérios claros para verificar uma solução. Quatro modelos avaliadores analisam as respostas quanto à correção e ao progresso, sem consultar respostas de referência. Nos testes, o GPT-6-Astra alcançou uma taxa média de resolução de 14,0%, enquanto outros modelos abertos de grande porte ficaram entre 5,5% e 6,7%, e os modelos Flash, entre 2,4% e 3,7%.

Por que importa

O resultado mostra que o mais recente modelo de linguagem de grande porte consegue fazer avanços mensuráveis em questões reais de pesquisa, sinalizando o papel crescente da IA na ciência teórica.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.