Oossa

Helion kernel से vLLM के linear backend को तेज़ी

vLLM में अब Helion-आधारित linear backend शामिल है, जो matrix multiplication kernels को अपने-आप ट्यून करता है। Hopper GPUs पर इससे throughput 10% तक बढ़ सकता है।

संक्षिप्तOossaOossa द्वारा प्रकाशित: 1 मिनट पढ़ना

vLLM inference framework ने PyTorch-native kernel DSL Helion को अपने linear backend में शामिल किया है। Helion एक ही GEMM kernel से कई algorithm variants चलाने और हर shape के लिए सबसे तेज़ configuration अपने-आप चुनने की सुविधा देता है। NVIDIA Hopper GPUs पर नया backend vLLM के डिफ़ॉल्ट CUTLASS और DeepGEMM kernels से बेहतर प्रदर्शन करता है। इससे end-to-end गति में लगातार सुधार होता है और कुछ models में throughput 10% से अधिक बढ़ जाता है।

यह क्यों मायने रखता है

Hopper GPUs पर बड़े language models चलाने वाले developers custom kernels लिखे बिना तेज़ inference पा सकते हैं।

स्रोत और संदर्भ

1 स्रोत
  1. PyTorchमूल स्रोत पढ़ें

अंतिम अपडेट: ·Markdown

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।