vLLM projesi, 0.31.0 sürümünü 5 Ekim 2026'da yayımladı. Öne çıkan yenilik, ağırlık önbelleği arka plan sürecini başlatan yeni bir preload komutu. Bu sayede kuantizasyon sonrası model ağırlıkları sunucu yeniden başlatıldığında GPU belleğinde kalıyor. Özellik, veri paralelliğiyle çalışıyor ve bir sağlık kontrolü uç noktası ekliyor. Sürüm ayrıca 307 katkıcının 717 commit'ini içeriyor.
Neden önemli
Geliştiriciler büyük modelleri yeniden yüklemeden LLM hizmetlerini güncelleyebilir veya yeniden başlatabilir; böylece vLLM'e dayanan uygulamalardaki kesinti süresi kısalır.