Oossa

Helion 커널, vLLM 선형 백엔드에 추가돼 추론 속도 향상

vLLM에 행렬 곱셈 커널을 자동 튜닝하는 Helion 기반 선형 백엔드가 추가돼, Hopper GPU에서 처리량이 최대 10% 높아집니다.

짧은 소식OossaOossa 게시일: 1 분 읽기

추론 프레임워크 vLLM이 PyTorch 네이티브 커널 DSL인 Helion을 선형 백엔드에 통합했습니다. Helion은 하나의 GEMM 커널로 여러 알고리즘 변형을 지원하고, 각 입력 형태에 가장 빠른 구성을 자동으로 선택합니다. NVIDIA Hopper GPU에서 새 백엔드는 vLLM의 기본 CUTLASS 및 DeepGEMM 커널보다 뛰어난 성능을 내며, 일관된 종단 간 속도 향상과 일부 모델에서 10%가 넘는 처리량 증가를 제공합니다.

왜 중요한가

Hopper GPU에서 대규모 언어 모델을 실행하는 개발자는 맞춤형 커널을 작성하지 않고도 추론 속도를 높일 수 있습니다.

출처 및 참고 자료

1 개 출처
  1. PyTorch원본 출처 읽기

최종 업데이트: ·Markdown

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.