# Helion ger vLLM snabbare inferens på Hopper-GPU:er

> vLLM har nu en Helion-baserad linjär backend som autotunar matrismultiplikationskärnor och ger upp till 10 % högre genomströmning på Hopper-GPU:er.

Oossa · 2026-10-02 · https://oossa.com/sv/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

Inferensramverket vLLM har integrerat Helion, ett PyTorch-anpassat DSL för kärnor, i sin linjära backend. Helion låter en och samma GEMM-kärna täcka flera algoritmvarianter och väljer automatiskt den snabbaste konfigurationen för varje form. På NVIDIA Hopper-GPU:er presterar den nya backendlösningen bättre än vLLM:s standardkärnor CUTLASS och DeepGEMM, med jämnt högre hastighet från början till slut och mer än 10 % högre genomströmning för vissa modeller.

## Fakta

- Helion-backendlösningen presterar bättre än CUTLASS och DeepGEMM på Hopper-GPU:er, med över 10 % högre genomströmning för vissa arbetsbelastningar.
- Den hybrida styrningen använder Helion vid tokenantal på upp till 32 och växlar till standardkärnorna för större former.

## Varför det spelar roll

Utvecklare som kör stora språkmodeller på Hopper-GPU:er kan få snabbare inferens utan att behöva skriva egna kärnor.

## Källor och referenser

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

Senast uppdaterad: 2026-10-02
