# Helion acelera la inferencia en vLLM

> vLLM incorpora un backend lineal basado en Helion que ajusta automáticamente los kernels de multiplicación de matrices y aumenta el rendimiento hasta un 10% en GPU Hopper.

Oossa · 2026-10-02 · https://oossa.com/es/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

El framework de inferencia vLLM ha integrado Helion, un DSL de kernels nativo de PyTorch, en su backend lineal. Helion permite que un único kernel GEMM abarque distintas variantes de algoritmo y elige automáticamente la configuración más rápida para cada forma. En las GPU NVIDIA Hopper, el nuevo backend supera a los kernels predeterminados CUTLASS y DeepGEMM de vLLM, con mejoras constantes en la velocidad de principio a fin y un aumento del rendimiento superior al 10% en algunos modelos.

## Los hechos

- El backend de Helion supera a CUTLASS y DeepGEMM en las GPU Hopper, con una mejora del rendimiento superior al 10% en determinadas cargas de trabajo.
- El sistema híbrido de selección usa Helion con recuentos de tokens de hasta 32 y recurre a los kernels predeterminados para formas mayores.

## Por qué importa

Los desarrolladores que ejecutan modelos de lenguaje grandes en GPU Hopper pueden obtener inferencias más rápidas sin tener que escribir kernels personalizados.

## Fuentes y referencias

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

Última actualización: 2026-10-02
