# 미해결 수학·물리 문제 AI 벤치마크 OpenProblemBench 공개

> 새로운 OpenProblemBench에는 미해결 문제 82개가 담겼다. GPT-6-Astra는 이 중 14%를 풀어 다른 모델을 크게 앞섰다.

Oossa · 2026-10-09 · https://oossa.com/ko/openproblembench-benchmark-released-for-ai-on-unsolved-math-and-physics-question

연구진이 수학과 이론물리학의 미해결 문제 82개로 구성된 테스트 세트 OpenProblemBench를 공개했다. 각 문제에는 연구 배경과 해답을 검증할 명확한 기준이 제시된다. 정답 예시를 참고하지 않고 제출물을 채점하는 평가 모델 4개는 답의 정확성과 연구 진전 정도를 평가한다. 테스트에서 GPT-6-Astra의 평균 문제 해결률은 14.0%였으며, 다른 대형 오픈 모델은 5.5~6.7%, Flash 모델은 2.4~3.7%를 기록했다.

## 팩트

- 벤치마크에 미해결 문제 82개 포함
- GPT-6-Astra 평균 문제 해결률: 14.0%

## 왜 중요한가

최신 대형 언어 모델이 실제 연구 문제에서 측정 가능한 진전을 이룰 수 있음을 보여준다. 이는 이론 과학에서 AI의 역할이 커지고 있음을 시사한다.

## 출처 및 참고 자료

1. [OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences](https://arxiv.org/abs/2610.11118) – arXiv, 2026-10-09

최종 업데이트: 2026-10-09
