Oossa

vLLM 0.31.0 推出 GPU 服务快速重启权重缓存

开源大语言模型服务库 vLLM 0.31.0 新增预加载命令,可让后量化权重在引擎重启期间继续驻留在 GPU 内存中。

简讯作者: Oossa 发布日期: 1 分钟阅读

vLLM 项目于 2026 年 10 月 5 日发布 0.31.0 版本。此次更新的亮点是新增预加载命令,可启动权重缓存守护进程,让后量化模型权重在服务器重启时继续保存在 GPU 内存中。该功能支持数据并行,并新增健康检查端点。本次版本还包含来自 307 位贡献者的 717 次提交。

为什么重要

开发者可以更新或重启大语言模型服务,而不必重新加载大型模型,从而减少依赖 vLLM 的应用停机时间。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。