# vLLM 0.31.0 сохраняет веса в GPU при перезапуске

> В библиотеке vLLM 0.31.0 появилась команда предварительной загрузки: после квантования веса остаются в памяти GPU при перезапуске движка.

Oossa · 2026-10-05 · https://oossa.com/ru/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

Проект vLLM выпустил версию 0.31.0 5 октября 2026 года. Главное нововведение — команда предварительной загрузки, запускающая демон кэширования весов. Благодаря ей квантованные веса модели остаются в памяти GPU при перезапуске сервера. Функция поддерживает параллелизм по данным и добавляет конечную точку для проверки работоспособности. В релиз также вошли 717 коммитов от 307 участников.

## Факты

- Версия 0.31.0 выпущена 2026‑10‑05
- 717 коммитов от 307 участников

## Почему это важно

Разработчики смогут обновлять и перезапускать сервисы на базе LLM, не загружая большие модели заново, что сократит простой приложений, использующих vLLM.

## Источники и ссылки

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

Обновлено: 2026-10-05
