# vLLM 0.31.0 acelera reinicializações com cache de pesos na GPU

> A biblioteca de código aberto vLLM 0.31.0 traz um comando de pré-carregamento que mantém pesos pós-quantizados na memória da GPU durante as reinicializações do mecanismo.

Oossa · 2026-10-05 · https://oossa.com/pt/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

O projeto vLLM lançou a versão 0.31.0 em 5 de outubro de 2026. O destaque é um novo comando de pré-carregamento que inicia um daemon de cache de pesos, permitindo que os pesos pós-quantizados dos modelos permaneçam na memória da GPU quando o servidor é reiniciado. O recurso é compatível com paralelismo de dados e inclui um endpoint de verificação de integridade. A versão também reúne 717 commits de 307 colaboradores.

## Os fatos

- Versão 0.31.0 lançada em 2026-10-05
- 717 commits de 307 colaboradores

## Por que importa

Os desenvolvedores podem atualizar ou reiniciar serviços de LLM sem carregar os modelos grandes novamente, reduzindo o tempo de indisponibilidade dos aplicativos que dependem do vLLM.

## Fontes e referências

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

Última atualização: 2026-10-05
