# OpenProblemBench: un test per i problemi irrisolti di matematica e fisica

> Il nuovo benchmark raccoglie 82 problemi aperti. GPT-6-Astra ne ha risolto il 14%, superando nettamente gli altri modelli.

Oossa · 2026-10-09 · https://oossa.com/it/openproblembench-benchmark-released-for-ai-on-unsolved-math-and-physics-question

I ricercatori hanno presentato OpenProblemBench, una raccolta di test basata su 82 problemi irrisolti di matematica e fisica teorica. Per ciascun problema, il benchmark fornisce il contesto della ricerca e criteri chiari per verificare una soluzione. Quattro modelli valutatori giudicano le risposte in base alla correttezza e ai progressi compiuti, senza disporre di soluzioni di riferimento. Nei test, GPT-6-Astra ha raggiunto un tasso medio di risoluzione del 14.0%; gli altri modelli open di dimensioni complete si sono attestati tra il 5.5% e il 6.7%, mentre i modelli Flash hanno ottenuto dal 2.4% al 3.7%.

## I fatti

- 82 problemi aperti nel benchmark
- Tasso medio di risoluzione di GPT-6-Astra: 14.0%

## Perché conta

Dimostra che il più recente modello linguistico di grandi dimensioni può compiere progressi misurabili su autentici quesiti di ricerca, indicando il ruolo crescente dell’IA nelle scienze teoriche.

## Fonti e riferimenti

1. [OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences](https://arxiv.org/abs/2610.11118) – arXiv, 2026-10-09

Ultimo aggiornamento: 2026-10-09
