Oossa

vLLM 0.31.0 accélère les redémarrages grâce au cache GPU

La bibliothèque open source vLLM 0.31.0 ajoute une commande de préchargement qui conserve en mémoire GPU les poids post-quantifiés lors des redémarrages du moteur.

BrèvePar Publié par Oossa: 1 min de lecture

Le projet vLLM a publié la version 0.31.0 le 5 octobre 2026. La principale nouveauté est une commande de préchargement qui lance un démon de cache des poids, afin que les poids post-quantifiés des modèles restent en mémoire GPU lorsque le serveur redémarre. Cette fonctionnalité est compatible avec le parallélisme des données et ajoute un point de terminaison de vérification de l’état de santé. La version comprend également 717 commits de 307 contributeurs.

Pourquoi c'est important

Les développeurs peuvent mettre à jour ou redémarrer leurs services LLM sans recharger les modèles volumineux, ce qui réduit les interruptions pour les applications qui reposent sur vLLM.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.