O framework de inferência vLLM integrou o Helion, uma DSL de kernels nativa do PyTorch, ao seu backend linear. O Helion permite que um único kernel GEMM abranja várias variantes de algoritmo e seleciona automaticamente a configuração mais rápida para cada formato. Nas GPUs NVIDIA Hopper, o novo backend supera os kernels padrão CUTLASS e DeepGEMM do vLLM, proporcionando ganhos consistentes de desempenho de ponta a ponta e um aumento de mais de 10% na vazão em alguns modelos.
Por que importa
Desenvolvedores que executam grandes modelos de linguagem em GPUs Hopper podem obter inferência mais rápida sem escrever kernels personalizados.