O projeto vLLM lançou a versão 0.31.0 em 5 de outubro de 2026. O destaque é um novo comando de pré-carregamento que inicia um daemon de cache de pesos, permitindo que os pesos pós-quantizados dos modelos permaneçam na memória da GPU quando o servidor é reiniciado. O recurso é compatível com paralelismo de dados e inclui um endpoint de verificação de integridade. A versão também reúne 717 commits de 307 colaboradores.
Por que importa
Os desenvolvedores podem atualizar ou reiniciar serviços de LLM sem carregar os modelos grandes novamente, reduzindo o tempo de indisponibilidade dos aplicativos que dependem do vLLM.