Oossa

HelionカーネルをvLLMに統合、推論を高速化

vLLMにHelionベースの線形バックエンドが加わり、行列乗算カーネルを自動調整。Hopper GPUでスループットが最大10%向上します。

短信OossaOossa公開日: 1 分で読める

推論フレームワークのvLLMは、PyTorchネイティブのカーネルDSLであるHelionを線形バックエンドに統合しました。Helionでは、1つのGEMMカーネルで複数のアルゴリズムのバリエーションに対応でき、各形状に最適な設定を自動で選びます。NVIDIA Hopper GPUでは、新しいバックエンドがvLLMのデフォルトであるCUTLASSやDeepGEMMのカーネルを上回り、エンドツーエンドで安定した速度向上を実現。一部のモデルではスループットが10%を超えて向上します。

なぜ重要か

Hopper GPUで大規模言語モデルを動かす開発者は、カスタムカーネルを書かなくても推論を高速化できます。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。