# Helion 内核加入 vLLM 线性后端，加快推理

> vLLM 现已加入基于 Helion 的线性后端，可自动调优矩阵乘法内核，在 Hopper GPU 上将吞吐量提升最高 10%。

Oossa · 2026-10-02 · https://oossa.com/zh/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

推理框架 vLLM 已将 PyTorch 原生内核 DSL Helion 集成到线性后端中。Helion 可让单个 GEMM 内核覆盖多种算法变体，并针对每种形状自动选择速度最快的配置。在 NVIDIA Hopper GPU 上，这一新后端的表现优于 vLLM 默认采用的 CUTLASS 和 DeepGEMM 内核，能够稳定提升端到端速度，并让部分模型的吞吐量提高 10% 以上。

## 事实

- 在 Hopper GPU 上，Helion 后端的性能优于 CUTLASS 和 DeepGEMM，部分工作负载的吞吐量提升超过 10%。
- 混合调度策略在 token 数量不超过 32 时使用 Helion，处理更大的形状时则回退到默认内核。

## 为什么重要

在 Hopper GPU 上运行大语言模型的开发者，无需编写自定义内核，也能加快推理速度。

## 来源与参考

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

最后更新: 2026-10-02
