# vLLM 0.31.0 accélère les redémarrages grâce au cache GPU

> La bibliothèque open source vLLM 0.31.0 ajoute une commande de préchargement qui conserve en mémoire GPU les poids post-quantifiés lors des redémarrages du moteur.

Oossa · 2026-10-05 · https://oossa.com/fr/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

Le projet vLLM a publié la version 0.31.0 le 5 octobre 2026. La principale nouveauté est une commande de préchargement qui lance un démon de cache des poids, afin que les poids post-quantifiés des modèles restent en mémoire GPU lorsque le serveur redémarre. Cette fonctionnalité est compatible avec le parallélisme des données et ajoute un point de terminaison de vérification de l’état de santé. La version comprend également 717 commits de 307 contributeurs.

## Les faits

- Version 0.31.0 publiée le 2026-10-05
- 717 commits de 307 contributeurs

## Pourquoi c'est important

Les développeurs peuvent mettre à jour ou redémarrer leurs services LLM sans recharger les modèles volumineux, ce qui réduit les interruptions pour les applications qui reposent sur vLLM.

## Sources et références

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

Dernière mise à jour: 2026-10-05
