Oossa

Allen Institute、予算配分型のGPUスケジューラーを導入

AI Infrastructureチームは優先順位制を予算ベースの公平配分スケジューラーに置き換えた。研究者がGPU時間の割り当てを確保できるようになり、オンコール対応での修復作業は74%減少した。

短信著者: Oossa公開日: 1 分で読める

Allen Institute for AI(Ai2)は、予算配分と階層型の公平配分に基づいて研究ジョブの実行順を決める、新たなGPUクラスター用スケジューラーを導入した。このシステムでは、各プロジェクトにGPU時間の固定枠が割り当てられる。たとえばProject A1には全体の容量の35%が割り当てられる。予算が確保されたジョブだけがプリエンプション(実行の中断)の対象外となる。また、スケジューラーでは最低実行時間の契約が必要で、その時間が経過すると、ほかのジョブのためにリソースを回収できる。エンジニアによると、この変更により利用可能な計算能力が30%向上したように感じられ、手作業による修復作業も74%減ったという。

なぜ重要か

研究者はGPU時間を予測可能な形で割り当てられるようになり、オンコール担当者が長時間実行中のジョブを手動で停止する作業も大幅に減る。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。