Oossa

vLLM 0.31.0, GPU sunucuları için hızlı yeniden başlatma önbelleği ekliyor

Açık kaynaklı LLM sunum kütüphanesi vLLM 0.31.0, motor yeniden başlatıldığında kuantizasyon sonrası ağırlıkları GPU belleğinde tutan bir ön yükleme komutu sunuyor.

Kısa haberYazan: Oossa yayın tarihi: 1 dk okuma

vLLM projesi, 0.31.0 sürümünü 5 Ekim 2026'da yayımladı. Öne çıkan yenilik, ağırlık önbelleği arka plan sürecini başlatan yeni bir preload komutu. Bu sayede kuantizasyon sonrası model ağırlıkları sunucu yeniden başlatıldığında GPU belleğinde kalıyor. Özellik, veri paralelliğiyle çalışıyor ve bir sağlık kontrolü uç noktası ekliyor. Sürüm ayrıca 307 katkıcının 717 commit'ini içeriyor.

Neden önemli

Geliştiriciler büyük modelleri yeniden yüklemeden LLM hizmetlerini güncelleyebilir veya yeniden başlatabilir; böylece vLLM'e dayanan uygulamalardaki kesinti süresi kısalır.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.