Oossa

vLLM 0.31.0 сохраняет веса в GPU при перезапуске

В библиотеке vLLM 0.31.0 появилась команда предварительной загрузки: после квантования веса остаются в памяти GPU при перезапуске движка.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Проект vLLM выпустил версию 0.31.0 5 октября 2026 года. Главное нововведение — команда предварительной загрузки, запускающая демон кэширования весов. Благодаря ей квантованные веса модели остаются в памяти GPU при перезапуске сервера. Функция поддерживает параллелизм по данным и добавляет конечную точку для проверки работоспособности. В релиз также вошли 717 коммитов от 307 участников.

Почему это важно

Разработчики смогут обновлять и перезапускать сервисы на базе LLM, не загружая большие модели заново, что сократит простой приложений, использующих vLLM.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.