vLLM inference framework ने PyTorch-native kernel DSL Helion को अपने linear backend में शामिल किया है। Helion एक ही GEMM kernel से कई algorithm variants चलाने और हर shape के लिए सबसे तेज़ configuration अपने-आप चुनने की सुविधा देता है। NVIDIA Hopper GPUs पर नया backend vLLM के डिफ़ॉल्ट CUTLASS और DeepGEMM kernels से बेहतर प्रदर्शन करता है। इससे end-to-end गति में लगातार सुधार होता है और कुछ models में throughput 10% से अधिक बढ़ जाता है।
यह क्यों मायने रखता है
Hopper GPUs पर बड़े language models चलाने वाले developers custom kernels लिखे बिना तेज़ inference पा सकते हैं।