Проект vLLM выпустил версию 0.31.0 5 октября 2026 года. Главное нововведение — команда предварительной загрузки, запускающая демон кэширования весов. Благодаря ей квантованные веса модели остаются в памяти GPU при перезапуске сервера. Функция поддерживает параллелизм по данным и добавляет конечную точку для проверки работоспособности. В релиз также вошли 717 коммитов от 307 участников.
Почему это важно
Разработчики смогут обновлять и перезапускать сервисы на базе LLM, не загружая большие модели заново, что сократит простой приложений, использующих vLLM.