Pesquisadores lançaram o OpenProblemBench, uma bateria de testes com 82 problemas ainda sem solução em matemática e física teórica. Para cada problema, o benchmark apresenta o contexto da pesquisa e critérios claros para verificar uma solução. Quatro modelos avaliadores analisam as respostas quanto à correção e ao progresso, sem consultar respostas de referência. Nos testes, o GPT-6-Astra alcançou uma taxa média de resolução de 14,0%, enquanto outros modelos abertos de grande porte ficaram entre 5,5% e 6,7%, e os modelos Flash, entre 2,4% e 3,7%.
Por que importa
O resultado mostra que o mais recente modelo de linguagem de grande porte consegue fazer avanços mensuráveis em questões reais de pesquisa, sinalizando o papel crescente da IA na ciência teórica.