# vLLM 0.31.0, GPU 서빙용 빠른 재시작 가중치 캐시 추가

> 오픈소스 LLM 서빙 라이브러리 vLLM 0.31.0에 사후 양자화된 가중치를 엔진 재시작 후에도 GPU 메모리에 유지하는 프리로드 CLI가 도입됐다.

Oossa · 2026-10-05 · https://oossa.com/ko/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

vLLM 프로젝트가 2026년 10월 5일 버전 0.31.0을 출시했다. 이번 버전의 핵심은 가중치 캐시 데몬을 시작하는 새 프리로드 명령어다. 서버를 재시작해도 사후 양자화된 모델 가중치를 GPU 메모리에 유지할 수 있다. 이 기능은 데이터 병렬 처리를 지원하며 상태 확인 엔드포인트도 추가한다. 이번 릴리스에는 기여자 307명이 작성한 커밋 717개도 포함됐다.

## 팩트

- 버전 0.31.0, 2026‑10‑05 출시
- 기여자 307명이 작성한 커밋 717개

## 왜 중요한가

개발자는 대규모 모델을 다시 로드하지 않고도 LLM 서비스를 업데이트하거나 재시작할 수 있어, vLLM을 사용하는 애플리케이션의 서비스 중단 시간을 줄일 수 있다.

## 출처 및 참고 자료

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

최종 업데이트: 2026-10-05
