Allen Institute for AI (Ai2) presentó un nuevo planificador para clústeres de GPU que decide qué trabajos de investigación se ejecutan mediante asignaciones presupuestarias y un reparto equitativo jerárquico. El sistema asigna a cada proyecto una cuota fija de horas de GPU; por ejemplo, Project A1 recibe el 35% de la capacidad total. Solo los trabajos respaldados por un presupuesto están protegidos frente a la interrupción. Además, el planificador exige un tiempo mínimo de ejecución acordado, tras el cual puede recuperar recursos para otros trabajos. Según los ingenieros, el cambio se percibe como un aumento del 30% en la capacidad de cómputo aprovechable y redujo un 74% el trabajo de reparación manual.
Por qué importa
Ahora los investigadores tienen una cuota previsible de tiempo de GPU, y el personal de guardia dedica mucho menos tiempo a detener manualmente trabajos de larga duración.