Allen Institute for AI (Ai2)推出了一款新的GPU集群调度器,根据预算分配和分层公平共享机制,决定运行哪些研究任务。系统为每个项目分配固定比例的GPU时长,例如,Project A1可获得总算力的35%;只有有预算支持的任务才能避免被抢占。调度器还要求任务承诺至少运行一段时间,达到这一时长后,系统便可回收资源供其他任务使用。工程师表示,这项变化带来的实际可用算力提升相当于30%,人工修复工作也减少了74%。
为什么重要
研究人员如今可以获得可预测的GPU使用份额,值班人员手动终止长时间运行任务所花的时间也大幅减少。