Allen Institute for AI(Ai2)가 예산 할당과 계층형 공정 할당을 바탕으로 연구 작업의 실행 순서를 정하는 새로운 GPU 클러스터 스케줄러를 도입했다. 시스템은 각 프로젝트에 GPU 사용 시간의 고정 비율을 배정한다. 예를 들어 Project A1은 전체 용량의 35%를 할당받는다. 예산이 뒷받침되는 작업만 선점으로부터 보호된다. 또한 스케줄러는 최소 실행 시간 계약을 요구하며, 이 시간이 지나면 다른 작업에 자원을 다시 배정할 수 있다. 엔지니어들은 이번 변화로 실제 활용 가능한 컴퓨팅 자원이 30% 늘어난 듯한 효과가 있었고, 수동으로 복구 작업을 하는 일은 74% 줄었다고 말했다.
왜 중요한가
연구자들은 GPU 사용 시간을 예측 가능하게 배정받고, 온콜 담당자들은 장시간 실행되는 작업을 수동으로 종료하는 데 훨씬 적은 시간을 쓰게 된다.