vLLM 项目于 2026 年 10 月 5 日发布 0.31.0 版本。此次更新的亮点是新增预加载命令,可启动权重缓存守护进程,让后量化模型权重在服务器重启时继续保存在 GPU 内存中。该功能支持数据并行,并新增健康检查端点。本次版本还包含来自 307 位贡献者的 717 次提交。
为什么重要
开发者可以更新或重启大语言模型服务,而不必重新加载大型模型,从而减少依赖 vLLM 的应用停机时间。
开源大语言模型服务库 vLLM 0.31.0 新增预加载命令,可让后量化权重在引擎重启期间继续驻留在 GPU 内存中。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
vLLM 项目于 2026 年 10 月 5 日发布 0.31.0 版本。此次更新的亮点是新增预加载命令,可启动权重缓存守护进程,让后量化模型权重在服务器重启时继续保存在 GPU 内存中。该功能支持数据并行,并新增健康检查端点。本次版本还包含来自 307 位贡献者的 717 次提交。
开发者可以更新或重启大语言模型服务,而不必重新加载大型模型,从而减少依赖 vLLM 的应用停机时间。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。