vLLMプロジェクトは2026年10月5日、バージョン0.31.0をリリースした。目玉は新しいプリロードコマンドで、重みキャッシュのデーモンを起動し、サーバー再起動後も事後量子化したモデルの重みをGPUメモリに保持できる。この機能はデータ並列処理に対応し、ヘルスチェック用エンドポイントも追加する。今回のリリースには、307人のコントリビューターによる717件のコミットも含まれる。
なぜ重要か
大規模モデルを再読み込みせずにLLMサービスを更新・再起動できるため、vLLMを利用するアプリケーションの停止時間を短縮できる。