# Helion 커널, vLLM 선형 백엔드에 추가돼 추론 속도 향상

> vLLM에 행렬 곱셈 커널을 자동 튜닝하는 Helion 기반 선형 백엔드가 추가돼, Hopper GPU에서 처리량이 최대 10% 높아집니다.

Oossa · 2026-10-02 · https://oossa.com/ko/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

추론 프레임워크 vLLM이 PyTorch 네이티브 커널 DSL인 Helion을 선형 백엔드에 통합했습니다. Helion은 하나의 GEMM 커널로 여러 알고리즘 변형을 지원하고, 각 입력 형태에 가장 빠른 구성을 자동으로 선택합니다. NVIDIA Hopper GPU에서 새 백엔드는 vLLM의 기본 CUTLASS 및 DeepGEMM 커널보다 뛰어난 성능을 내며, 일관된 종단 간 속도 향상과 일부 모델에서 10%가 넘는 처리량 증가를 제공합니다.

## 팩트

- Helion 백엔드는 Hopper GPU에서 CUTLASS와 DeepGEMM보다 뛰어난 성능을 내며, 특정 작업에서 처리량을 10% 이상 높입니다.
- 하이브리드 디스패치는 토큰 수가 32 이하일 때 Helion을 사용하고, 더 큰 입력 형태에서는 기본 커널로 전환합니다.

## 왜 중요한가

Hopper GPU에서 대규모 언어 모델을 실행하는 개발자는 맞춤형 커널을 작성하지 않고도 추론 속도를 높일 수 있습니다.

## 출처 및 참고 자료

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

최종 업데이트: 2026-10-02
