# Helion acelera o backend linear do vLLM em até 10%

> O vLLM agora conta com um backend linear baseado no Helion, que ajusta automaticamente kernels de multiplicação de matrizes e aumenta a vazão em até 10% nas GPUs Hopper.

Oossa · 2026-10-02 · https://oossa.com/pt/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

O framework de inferência vLLM integrou o Helion, uma DSL de kernels nativa do PyTorch, ao seu backend linear. O Helion permite que um único kernel GEMM abranja várias variantes de algoritmo e seleciona automaticamente a configuração mais rápida para cada formato. Nas GPUs NVIDIA Hopper, o novo backend supera os kernels padrão CUTLASS e DeepGEMM do vLLM, proporcionando ganhos consistentes de desempenho de ponta a ponta e um aumento de mais de 10% na vazão em alguns modelos.

## Os fatos

- O backend Helion supera CUTLASS e DeepGEMM nas GPUs Hopper, com aumento de mais de 10% na vazão em determinadas cargas de trabalho.
- O despacho híbrido usa Helion para contagens de tokens de até 32 e recorre aos kernels padrão para formatos maiores.

## Por que importa

Desenvolvedores que executam grandes modelos de linguagem em GPUs Hopper podem obter inferência mais rápida sem escrever kernels personalizados.

## Fontes e referências

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

Última atualização: 2026-10-02
