Le projet vLLM a publié la version 0.31.0 le 5 octobre 2026. La principale nouveauté est une commande de préchargement qui lance un démon de cache des poids, afin que les poids post-quantifiés des modèles restent en mémoire GPU lorsque le serveur redémarre. Cette fonctionnalité est compatible avec le parallélisme des données et ajoute un point de terminaison de vérification de l’état de santé. La version comprend également 717 commits de 307 contributeurs.
Pourquoi c'est important
Les développeurs peuvent mettre à jour ou redémarrer leurs services LLM sans recharger les modèles volumineux, ce qui réduit les interruptions pour les applications qui reposent sur vLLM.