# vLLM 0.31.0, GPU sunucuları için hızlı yeniden başlatma önbelleği ekliyor

> Açık kaynaklı LLM sunum kütüphanesi vLLM 0.31.0, motor yeniden başlatıldığında kuantizasyon sonrası ağırlıkları GPU belleğinde tutan bir ön yükleme komutu sunuyor.

Oossa · 2026-10-05 · https://oossa.com/tr/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

vLLM projesi, 0.31.0 sürümünü 5 Ekim 2026'da yayımladı. Öne çıkan yenilik, ağırlık önbelleği arka plan sürecini başlatan yeni bir preload komutu. Bu sayede kuantizasyon sonrası model ağırlıkları sunucu yeniden başlatıldığında GPU belleğinde kalıyor. Özellik, veri paralelliğiyle çalışıyor ve bir sağlık kontrolü uç noktası ekliyor. Sürüm ayrıca 307 katkıcının 717 commit'ini içeriyor.

## Gerçekler

- 0.31.0 sürümü 2026-10-05'te yayımlandı
- 307 katkıcıdan 717 commit

## Neden önemli

Geliştiriciler büyük modelleri yeniden yüklemeden LLM hizmetlerini güncelleyebilir veya yeniden başlatabilir; böylece vLLM'e dayanan uygulamalardaki kesinti süresi kısalır.

## Kaynaklar ve referanslar

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

Son güncelleme: 2026-10-05
