Oossa

Helion acelera la inferencia en vLLM

vLLM incorpora un backend lineal basado en Helion que ajusta automáticamente los kernels de multiplicación de matrices y aumenta el rendimiento hasta un 10% en GPU Hopper.

BreveOossaPublicado por Oossa: 1 min de lectura

El framework de inferencia vLLM ha integrado Helion, un DSL de kernels nativo de PyTorch, en su backend lineal. Helion permite que un único kernel GEMM abarque distintas variantes de algoritmo y elige automáticamente la configuración más rápida para cada forma. En las GPU NVIDIA Hopper, el nuevo backend supera a los kernels predeterminados CUTLASS y DeepGEMM de vLLM, con mejoras constantes en la velocidad de principio a fin y un aumento del rendimiento superior al 10% en algunos modelos.

Por qué importa

Los desarrolladores que ejecutan modelos de lenguaje grandes en GPU Hopper pueden obtener inferencias más rápidas sin tener que escribir kernels personalizados.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.