Oossa

vLLM 0.31.0 برای راه‌اندازی مجدد سریع‌تر، حافظه نهان وزن GPU را اضافه کرد

کتابخانه متن‌باز vLLM برای ارائه سرویس مدل‌های زبانی بزرگ، در نسخه 0.31.0 فرمانی برای بارگذاری اولیه معرفی کرده که وزن‌های پس از کوانتیزه‌سازی را هنگام راه‌اندازی مجدد موتور در حافظه GPU نگه می‌دارد.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

پروژه vLLM در 5 اکتبر 2026 نسخه 0.31.0 را منتشر کرد. مهم‌ترین قابلیت این نسخه، فرمان جدیدی برای بارگذاری اولیه است که یک سرویس پس‌زمینه حافظه نهان وزن را اجرا می‌کند و باعث می‌شود وزن‌های مدل پس از کوانتیزه‌سازی هنگام راه‌اندازی مجدد سرور در حافظه GPU باقی بمانند. این قابلیت با موازی‌سازی داده‌ای سازگار است و یک نقطه پایانی برای بررسی سلامت سرویس هم اضافه می‌کند. این نسخه همچنین شامل 717 تغییر ثبت‌شده از سوی 307 مشارکت‌کننده است.

چرا مهم است

توسعه‌دهندگان می‌توانند سرویس‌های مدل زبانی بزرگ را به‌روزرسانی یا راه‌اندازی مجدد کنند، بی‌آنکه مدل‌های حجیم را دوباره بارگذاری کنند؛ در نتیجه، زمان قطعی برنامه‌هایی که به vLLM متکی‌اند کاهش می‌یابد.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.