Allen Institute for AI(Ai2)は、予算配分と階層型の公平配分に基づいて研究ジョブの実行順を決める、新たなGPUクラスター用スケジューラーを導入した。このシステムでは、各プロジェクトにGPU時間の固定枠が割り当てられる。たとえばProject A1には全体の容量の35%が割り当てられる。予算が確保されたジョブだけがプリエンプション(実行の中断)の対象外となる。また、スケジューラーでは最低実行時間の契約が必要で、その時間が経過すると、ほかのジョブのためにリソースを回収できる。エンジニアによると、この変更により利用可能な計算能力が30%向上したように感じられ、手作業による修復作業も74%減ったという。
なぜ重要か
研究者はGPU時間を予測可能な形で割り当てられるようになり、オンコール担当者が長時間実行中のジョブを手動で停止する作業も大幅に減る。