# vLLM 0.31.0 برای راه‌اندازی مجدد سریع‌تر، حافظه نهان وزن GPU را اضافه کرد

> کتابخانه متن‌باز vLLM برای ارائه سرویس مدل‌های زبانی بزرگ، در نسخه 0.31.0 فرمانی برای بارگذاری اولیه معرفی کرده که وزن‌های پس از کوانتیزه‌سازی را هنگام راه‌اندازی مجدد موتور در حافظه GPU نگه می‌دارد.

Oossa · 2026-10-05 · https://oossa.com/fa/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

پروژه vLLM در 5 اکتبر 2026 نسخه 0.31.0 را منتشر کرد. مهم‌ترین قابلیت این نسخه، فرمان جدیدی برای بارگذاری اولیه است که یک سرویس پس‌زمینه حافظه نهان وزن را اجرا می‌کند و باعث می‌شود وزن‌های مدل پس از کوانتیزه‌سازی هنگام راه‌اندازی مجدد سرور در حافظه GPU باقی بمانند. این قابلیت با موازی‌سازی داده‌ای سازگار است و یک نقطه پایانی برای بررسی سلامت سرویس هم اضافه می‌کند. این نسخه همچنین شامل 717 تغییر ثبت‌شده از سوی 307 مشارکت‌کننده است.

## حقایق

- نسخه 0.31.0 در 2026-10-05 منتشر شد
- 717 تغییر ثبت‌شده از سوی 307 مشارکت‌کننده

## چرا مهم است

توسعه‌دهندگان می‌توانند سرویس‌های مدل زبانی بزرگ را به‌روزرسانی یا راه‌اندازی مجدد کنند، بی‌آنکه مدل‌های حجیم را دوباره بارگذاری کنند؛ در نتیجه، زمان قطعی برنامه‌هایی که به vLLM متکی‌اند کاهش می‌یابد.

## منابع و ارجاع‌ها

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

آخرین به‌روزرسانی: 2026-10-05
