Oossa

vLLM 0.31.0、GPU推論サーバーの高速再起動を実現する重みキャッシュを追加

オープンソースのLLM推論ライブラリvLLM 0.31.0では、事後量子化した重みをエンジンの再起動後もGPUメモリに保持するプリロード用CLIが導入された。

短信著者: Oossa公開日: 1 分で読める

vLLMプロジェクトは2026年10月5日、バージョン0.31.0をリリースした。目玉は新しいプリロードコマンドで、重みキャッシュのデーモンを起動し、サーバー再起動後も事後量子化したモデルの重みをGPUメモリに保持できる。この機能はデータ並列処理に対応し、ヘルスチェック用エンドポイントも追加する。今回のリリースには、307人のコントリビューターによる717件のコミットも含まれる。

なぜ重要か

大規模モデルを再読み込みせずにLLMサービスを更新・再起動できるため、vLLMを利用するアプリケーションの停止時間を短縮できる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。