# vLLM 0.31.0 推出 GPU 服务快速重启权重缓存

> 开源大语言模型服务库 vLLM 0.31.0 新增预加载命令，可让后量化权重在引擎重启期间继续驻留在 GPU 内存中。

Oossa · 2026-10-05 · https://oossa.com/zh/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

vLLM 项目于 2026 年 10 月 5 日发布 0.31.0 版本。此次更新的亮点是新增预加载命令，可启动权重缓存守护进程，让后量化模型权重在服务器重启时继续保存在 GPU 内存中。该功能支持数据并行，并新增健康检查端点。本次版本还包含来自 307 位贡献者的 717 次提交。

## 事实

- 0.31.0 版本于 2026-10-05 发布
- 来自 307 位贡献者的 717 次提交

## 为什么重要

开发者可以更新或重启大语言模型服务，而不必重新加载大型模型，从而减少依赖 vLLM 的应用停机时间。

## 来源与参考

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

最后更新: 2026-10-05
