# Helion ускоряет линейные операции в vLLM

> В vLLM появился линейный бэкенд на базе Helion: он автоматически подбирает ядра умножения матриц и повышает пропускную способность на Hopper GPU до 10%.

Oossa · 2026-10-02 · https://oossa.com/ru/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

Фреймворк для инференса vLLM интегрировал Helion — встроенный в PyTorch DSL для ядер — в свой линейный бэкенд. Helion позволяет использовать одно ядро GEMM для нескольких вариантов алгоритма и автоматически выбирает самую быструю конфигурацию для каждого размера матриц. На GPU NVIDIA Hopper новый бэкенд превосходит стандартные ядра CUTLASS и DeepGEMM в vLLM: он стабильно ускоряет работу от начала до конца, а на некоторых моделях повышает пропускную способность более чем на 10%.

## Факты

- На GPU Hopper бэкенд Helion превосходит CUTLASS и DeepGEMM, повышая пропускную способность более чем на 10% для некоторых задач.
- В гибридной схеме Helion используется при количестве токенов до 32, а для матриц большего размера применяются стандартные ядра.

## Почему это важно

Разработчики, запускающие большие языковые модели на GPU Hopper, могут ускорить инференс без написания собственных ядер.

## Источники и ссылки

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

Обновлено: 2026-10-02
