Un equipo de investigadores publicó OpenProblemBench, una batería de pruebas con 82 problemas sin resolver de matemáticas y física teórica. El benchmark aporta el contexto de investigación de cada problema y criterios claros para comprobar las soluciones. Cuatro modelos evaluadores califican las respuestas según su corrección y los avances que logran, sin recurrir a soluciones de referencia. En las pruebas, GPT-6-Astra obtuvo una tasa media de resolución del 14,0 %, mientras que otros modelos abiertos de tamaño completo alcanzaron entre el 5,5 % y el 6,7 %, y los modelos Flash, entre el 2,4 % y el 3,7 %.
Por qué importa
Muestra que el modelo de lenguaje grande más reciente puede lograr avances medibles en problemas de investigación reales, lo que apunta al papel cada vez mayor de la IA en las ciencias teóricas.