L’Allen Institute for AI (Ai2) a lancé un nouvel ordonnanceur pour ses clusters GPU. Il s’appuie sur des budgets et un partage équitable hiérarchisé pour déterminer quels travaux de recherche sont exécutés. Chaque projet reçoit une part fixe des heures GPU — par exemple, Project A1 obtient 35 % de la capacité totale — et seuls les travaux financés par un budget sont protégés contre la préemption. L’ordonnanceur impose également une durée minimale d’exécution, au terme de laquelle il peut récupérer les ressources pour d’autres travaux. Selon les ingénieurs, ce changement équivaut à une hausse de 30 % de la puissance de calcul utilisable et a réduit de 74 % le travail de réparation manuelle.
Pourquoi c'est important
Les chercheurs disposent désormais d’une part prévisible du temps GPU, et le personnel d’astreinte passe beaucoup moins de temps à arrêter manuellement les travaux de longue durée.