vLLM 프로젝트가 2026년 10월 5일 버전 0.31.0을 출시했다. 이번 버전의 핵심은 가중치 캐시 데몬을 시작하는 새 프리로드 명령어다. 서버를 재시작해도 사후 양자화된 모델 가중치를 GPU 메모리에 유지할 수 있다. 이 기능은 데이터 병렬 처리를 지원하며 상태 확인 엔드포인트도 추가한다. 이번 릴리스에는 기여자 307명이 작성한 커밋 717개도 포함됐다.
왜 중요한가
개발자는 대규모 모델을 다시 로드하지 않고도 LLM 서비스를 업데이트하거나 재시작할 수 있어, vLLM을 사용하는 애플리케이션의 서비스 중단 시간을 줄일 수 있다.