推論フレームワークのvLLMは、PyTorchネイティブのカーネルDSLであるHelionを線形バックエンドに統合しました。Helionでは、1つのGEMMカーネルで複数のアルゴリズムのバリエーションに対応でき、各形状に最適な設定を自動で選びます。NVIDIA Hopper GPUでは、新しいバックエンドがvLLMのデフォルトであるCUTLASSやDeepGEMMのカーネルを上回り、エンドツーエンドで安定した速度向上を実現。一部のモデルではスループットが10%を超えて向上します。
なぜ重要か
Hopper GPUで大規模言語モデルを動かす開発者は、カスタムカーネルを書かなくても推論を高速化できます。