Oossa

Helion acelera o backend linear do vLLM em até 10%

O vLLM agora conta com um backend linear baseado no Helion, que ajusta automaticamente kernels de multiplicação de matrizes e aumenta a vazão em até 10% nas GPUs Hopper.

NotaOossaPublicado pelo Oossa: 1 min de leitura

O framework de inferência vLLM integrou o Helion, uma DSL de kernels nativa do PyTorch, ao seu backend linear. O Helion permite que um único kernel GEMM abranja várias variantes de algoritmo e seleciona automaticamente a configuração mais rápida para cada formato. Nas GPUs NVIDIA Hopper, o novo backend supera os kernels padrão CUTLASS e DeepGEMM do vLLM, proporcionando ganhos consistentes de desempenho de ponta a ponta e um aumento de mais de 10% na vazão em alguns modelos.

Por que importa

Desenvolvedores que executam grandes modelos de linguagem em GPUs Hopper podem obter inferência mais rápida sem escrever kernels personalizados.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.