# OpenProblemBench avalia IA em problemas abertos de matemática e física

> O novo conjunto OpenProblemBench reúne 82 problemas em aberto. O GPT-6-Astra resolveu 14% deles, bem mais do que outros modelos.

Oossa · 2026-10-09 · https://oossa.com/pt/openproblembench-benchmark-released-for-ai-on-unsolved-math-and-physics-question

Pesquisadores lançaram o OpenProblemBench, uma bateria de testes com 82 problemas ainda sem solução em matemática e física teórica. Para cada problema, o benchmark apresenta o contexto da pesquisa e critérios claros para verificar uma solução. Quatro modelos avaliadores analisam as respostas quanto à correção e ao progresso, sem consultar respostas de referência. Nos testes, o GPT-6-Astra alcançou uma taxa média de resolução de 14,0%, enquanto outros modelos abertos de grande porte ficaram entre 5,5% e 6,7%, e os modelos Flash, entre 2,4% e 3,7%.

## Os fatos

- 82 problemas em aberto no benchmark
- Taxa média de resolução do GPT-6-Astra: 14,0%

## Por que importa

O resultado mostra que o mais recente modelo de linguagem de grande porte consegue fazer avanços mensuráveis em questões reais de pesquisa, sinalizando o papel crescente da IA na ciência teórica.

## Fontes e referências

1. [OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences](https://arxiv.org/abs/2610.11118) – arXiv, 2026-10-09

Última atualização: 2026-10-09
