추론 프레임워크 vLLM이 PyTorch 네이티브 커널 DSL인 Helion을 선형 백엔드에 통합했습니다. Helion은 하나의 GEMM 커널로 여러 알고리즘 변형을 지원하고, 각 입력 형태에 가장 빠른 구성을 자동으로 선택합니다. NVIDIA Hopper GPU에서 새 백엔드는 vLLM의 기본 CUTLASS 및 DeepGEMM 커널보다 뛰어난 성능을 내며, 일관된 종단 간 속도 향상과 일부 모델에서 10%가 넘는 처리량 증가를 제공합니다.
왜 중요한가
Hopper GPU에서 대규모 언어 모델을 실행하는 개발자는 맞춤형 커널을 작성하지 않고도 추론 속도를 높일 수 있습니다.