# vLLM 0.31.0、GPU推論サーバーの高速再起動を実現する重みキャッシュを追加

> オープンソースのLLM推論ライブラリvLLM 0.31.0では、事後量子化した重みをエンジンの再起動後もGPUメモリに保持するプリロード用CLIが導入された。

Oossa · 2026-10-05 · https://oossa.com/ja/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

vLLMプロジェクトは2026年10月5日、バージョン0.31.0をリリースした。目玉は新しいプリロードコマンドで、重みキャッシュのデーモンを起動し、サーバー再起動後も事後量子化したモデルの重みをGPUメモリに保持できる。この機能はデータ並列処理に対応し、ヘルスチェック用エンドポイントも追加する。今回のリリースには、307人のコントリビューターによる717件のコミットも含まれる。

## 事実

- バージョン0.31.0は2026-10-05にリリース
- 307人のコントリビューターによる717件のコミット

## なぜ重要か

大規模モデルを再読み込みせずにLLMサービスを更新・再起動できるため、vLLMを利用するアプリケーションの停止時間を短縮できる。

## 出典と参考資料

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

最終更新: 2026-10-05
