O Allen Institute for AI (Ai2) apresentou um novo agendador para seu cluster de GPUs, que usa a distribuição de orçamentos e o compartilhamento hierárquico justo para decidir quais trabalhos de pesquisa serão executados. O sistema reserva uma parcela fixa das horas de GPU para cada projeto — por exemplo, o Project A1 recebe 35% da capacidade total — e só protege da interrupção os trabalhos cobertos por um orçamento. O agendador também exige um tempo mínimo de execução, após o qual pode recuperar os recursos para outros trabalhos. Segundo os engenheiros, a mudança equivale a um aumento de 30% na capacidade computacional utilizável e reduziu em 74% o trabalho de reparo manual.
Por que importa
Agora, os pesquisadores têm uma parcela previsível do tempo de GPU, e a equipe de plantão passa muito menos tempo encerrando manualmente trabalhos de longa duração.