Oossa

Helion 内核加入 vLLM 线性后端,加快推理

vLLM 现已加入基于 Helion 的线性后端,可自动调优矩阵乘法内核,在 Hopper GPU 上将吞吐量提升最高 10%。

简讯OossaOossa 发布日期: 1 分钟阅读

推理框架 vLLM 已将 PyTorch 原生内核 DSL Helion 集成到线性后端中。Helion 可让单个 GEMM 内核覆盖多种算法变体,并针对每种形状自动选择速度最快的配置。在 NVIDIA Hopper GPU 上,这一新后端的表现优于 vLLM 默认采用的 CUTLASS 和 DeepGEMM 内核,能够稳定提升端到端速度,并让部分模型的吞吐量提高 10% 以上。

为什么重要

在 Hopper GPU 上运行大语言模型的开发者,无需编写自定义内核,也能加快推理速度。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。