# OpenProblemBench evalúa a la IA con problemas de matemáticas y física sin resolver

> El nuevo conjunto OpenProblemBench reúne 82 problemas abiertos. GPT-6-Astra resolvió el 14 %, muy por encima de otros modelos.

Oossa · 2026-10-09 · https://oossa.com/es/openproblembench-benchmark-released-for-ai-on-unsolved-math-and-physics-question

Un equipo de investigadores publicó OpenProblemBench, una batería de pruebas con 82 problemas sin resolver de matemáticas y física teórica. El benchmark aporta el contexto de investigación de cada problema y criterios claros para comprobar las soluciones. Cuatro modelos evaluadores califican las respuestas según su corrección y los avances que logran, sin recurrir a soluciones de referencia. En las pruebas, GPT-6-Astra obtuvo una tasa media de resolución del 14,0 %, mientras que otros modelos abiertos de tamaño completo alcanzaron entre el 5,5 % y el 6,7 %, y los modelos Flash, entre el 2,4 % y el 3,7 %.

## Los hechos

- 82 problemas abiertos en el benchmark
- Tasa media de resolución de GPT-6-Astra: 14,0 %

## Por qué importa

Muestra que el modelo de lenguaje grande más reciente puede lograr avances medibles en problemas de investigación reales, lo que apunta al papel cada vez mayor de la IA en las ciencias teóricas.

## Fuentes y referencias

1. [OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences](https://arxiv.org/abs/2610.11118) – arXiv, 2026-10-09

Última actualización: 2026-10-09
