# Helion kernel से vLLM के linear backend को तेज़ी

> vLLM में अब Helion-आधारित linear backend शामिल है, जो matrix multiplication kernels को अपने-आप ट्यून करता है। Hopper GPUs पर इससे throughput 10% तक बढ़ सकता है।

Oossa · 2026-10-02 · https://oossa.com/hi/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

vLLM inference framework ने PyTorch-native kernel DSL Helion को अपने linear backend में शामिल किया है। Helion एक ही GEMM kernel से कई algorithm variants चलाने और हर shape के लिए सबसे तेज़ configuration अपने-आप चुनने की सुविधा देता है। NVIDIA Hopper GPUs पर नया backend vLLM के डिफ़ॉल्ट CUTLASS और DeepGEMM kernels से बेहतर प्रदर्शन करता है। इससे end-to-end गति में लगातार सुधार होता है और कुछ models में throughput 10% से अधिक बढ़ जाता है।

## तथ्य

- Hopper GPUs पर Helion backend, CUTLASS और DeepGEMM से बेहतर प्रदर्शन करता है; कुछ workloads में throughput 10% से अधिक बढ़ता है।
- Hybrid dispatch 32 तक token counts के लिए Helion का इस्तेमाल करता है और इससे बड़े shapes पर डिफ़ॉल्ट kernels पर लौट जाता है।

## यह क्यों मायने रखता है

Hopper GPUs पर बड़े language models चलाने वाले developers custom kernels लिखे बिना तेज़ inference पा सकते हैं।

## स्रोत और संदर्भ

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

अंतिम अपडेट: 2026-10-02
