پروژه vLLM در 5 اکتبر 2026 نسخه 0.31.0 را منتشر کرد. مهمترین قابلیت این نسخه، فرمان جدیدی برای بارگذاری اولیه است که یک سرویس پسزمینه حافظه نهان وزن را اجرا میکند و باعث میشود وزنهای مدل پس از کوانتیزهسازی هنگام راهاندازی مجدد سرور در حافظه GPU باقی بمانند. این قابلیت با موازیسازی دادهای سازگار است و یک نقطه پایانی برای بررسی سلامت سرویس هم اضافه میکند. این نسخه همچنین شامل 717 تغییر ثبتشده از سوی 307 مشارکتکننده است.
چرا مهم است
توسعهدهندگان میتوانند سرویسهای مدل زبانی بزرگ را بهروزرسانی یا راهاندازی مجدد کنند، بیآنکه مدلهای حجیم را دوباره بارگذاری کنند؛ در نتیجه، زمان قطعی برنامههایی که به vLLM متکیاند کاهش مییابد.