Allen Institute for AI (Ai2) представил новый планировщик для GPU-кластера. Он распределяет исследовательские задачи по бюджетам и принципу иерархического равного доступа. Каждый проект получает фиксированную долю GPU-часов — например, Project A1 выделено 35% общей мощности. От вытеснения защищены только задачи, обеспеченные бюджетом. Кроме того, планировщик требует указать минимальное время выполнения: по его истечении ресурсы можно передать другим задачам. По словам инженеров, благодаря изменениям полезная вычислительная мощность выросла примерно на 30%, а объём ручной работы по устранению сбоев сократился на 74%.
Почему это важно
Теперь исследователи получают предсказуемую долю времени GPU, а дежурным сотрудникам приходится гораздо реже вручную останавливать задачи, которые выполняются слишком долго.