چارچوب استنتاج vLLM، زبان توصیف کرنل بومی PyTorch به نام Helion را به بکاند خطی خود افزوده است. Helion امکان میدهد یک کرنل GEMM چندین گونه الگوریتمی را پوشش دهد و سریعترین پیکربندی را برای هر شکل بهطور خودکار انتخاب کند. روی پردازندههای گرافیکی NVIDIA Hopper، بکاند جدید از کرنلهای پیشفرض CUTLASS و DeepGEMM در vLLM سریعتر است و بهطور پیوسته سرعت اجرای سرتاسری را افزایش میدهد؛ همچنین در برخی مدلها گذردهی را بیش از 10% بالا میبرد.
چرا مهم است
توسعهدهندگانی که مدلهای زبانی بزرگ را روی پردازندههای گرافیکی Hopper اجرا میکنند، میتوانند بدون نوشتن کرنلهای سفارشی، به استنتاج سریعتری دست پیدا کنند.