El framework de inferencia vLLM ha integrado Helion, un DSL de kernels nativo de PyTorch, en su backend lineal. Helion permite que un único kernel GEMM abarque distintas variantes de algoritmo y elige automáticamente la configuración más rápida para cada forma. En las GPU NVIDIA Hopper, el nuevo backend supera a los kernels predeterminados CUTLASS y DeepGEMM de vLLM, con mejoras constantes en la velocidad de principio a fin y un aumento del rendimiento superior al 10% en algunos modelos.
Por qué importa
Los desarrolladores que ejecutan modelos de lenguaje grandes en GPU Hopper pueden obtener inferencias más rápidas sin tener que escribir kernels personalizados.