Das Allen Institute for AI (Ai2) hat einen neuen Scheduler für GPU-Cluster eingeführt, der mithilfe von Budgetzuweisungen und hierarchischer Fair-Share-Verteilung entscheidet, welche Forschungsaufträge ausgeführt werden. Jedes Projekt erhält einen festen Anteil der GPU-Stunden – etwa 35 Prozent der Gesamtkapazität für Project A1. Nur Aufträge mit zugewiesenem Budget sind vor einer vorzeitigen Beendigung geschützt. Außerdem gilt eine Mindestlaufzeit: Danach kann der Scheduler Ressourcen für andere Aufträge freigeben. Laut den Ingenieuren fühlt sich die Änderung wie 30 Prozent mehr nutzbare Rechenleistung an und hat den manuellen Reparaturaufwand um 74 Prozent reduziert.
Warum es wichtig ist
Forschende erhalten nun einen verlässlichen Anteil der GPU-Zeit, und der Bereitschaftsdienst muss deutlich seltener lang laufende Aufträge manuell beenden.