推理框架 vLLM 已将 PyTorch 原生内核 DSL Helion 集成到线性后端中。Helion 可让单个 GEMM 内核覆盖多种算法变体,并针对每种形状自动选择速度最快的配置。在 NVIDIA Hopper GPU 上,这一新后端的表现优于 vLLM 默认采用的 CUTLASS 和 DeepGEMM 内核,能够稳定提升端到端速度,并让部分模型的吞吐量提高 10% 以上。
为什么重要
在 Hopper GPU 上运行大语言模型的开发者,无需编写自定义内核,也能加快推理速度。
vLLM 现已加入基于 Helion 的线性后端,可自动调优矩阵乘法内核,在 Hopper GPU 上将吞吐量提升最高 10%。
简讯OossaOossa 发布日期: 1 分钟阅读
推理框架 vLLM 已将 PyTorch 原生内核 DSL Helion 集成到线性后端中。Helion 可让单个 GEMM 内核覆盖多种算法变体,并针对每种形状自动选择速度最快的配置。在 NVIDIA Hopper GPU 上,这一新后端的表现优于 vLLM 默认采用的 CUTLASS 和 DeepGEMM 内核,能够稳定提升端到端速度,并让部分模型的吞吐量提高 10% 以上。
在 Hopper GPU 上运行大语言模型的开发者,无需编写自定义内核,也能加快推理速度。
最后更新: ·Markdown
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。