Oossa

افزایش سرعت استنتاج در vLLM با بک‌اند خطی Helion

vLLM اکنون بک‌اند خطی مبتنی بر Helion را دارد که کرنل‌های ضرب ماتریسی را به‌طور خودکار بهینه می‌کند و روی پردازنده‌های گرافیکی Hopper تا 10% گذردهی بیشتری ارائه می‌دهد.

خبر کوتاهOossaمنتشرشده توسط Oossa: 1 دقیقه مطالعه

چارچوب استنتاج vLLM، زبان توصیف کرنل بومی PyTorch به نام Helion را به بک‌اند خطی خود افزوده است. Helion امکان می‌دهد یک کرنل GEMM چندین گونه الگوریتمی را پوشش دهد و سریع‌ترین پیکربندی را برای هر شکل به‌طور خودکار انتخاب کند. روی پردازنده‌های گرافیکی NVIDIA Hopper، بک‌اند جدید از کرنل‌های پیش‌فرض CUTLASS و DeepGEMM در vLLM سریع‌تر است و به‌طور پیوسته سرعت اجرای سرتاسری را افزایش می‌دهد؛ همچنین در برخی مدل‌ها گذردهی را بیش از 10% بالا می‌برد.

چرا مهم است

توسعه‌دهندگانی که مدل‌های زبانی بزرگ را روی پردازنده‌های گرافیکی Hopper اجرا می‌کنند، می‌توانند بدون نوشتن کرنل‌های سفارشی، به استنتاج سریع‌تری دست پیدا کنند.

منابع و ارجاع‌ها

1 منبع
  1. PyTorchخواندن منبع اصلی

آخرین به‌روزرسانی: ·Markdown

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.