Oossa

llama.cpp b11494、CUDAのwarp最適化を追加

オープンソースのLlama.cppライブラリが、CUDAの各warpでGDNのstate列を4列使うようになり、GPUの性能向上が見込めます。

短信著者: Oossa公開日: 1 分で読める

ggml‑orgチームがllama.cppのバージョンb11494をリリースしました。このアップデートではCUDAバックエンドが変更され、各warpに割り当てるGDNのstate列が2列から4列になりました。これが新たなデフォルト設定です。macOS(Apple SiliconおよびIntel)、iOS、複数のUbuntuビルド向けのバイナリをダウンロードできます。

なぜ重要か

NVIDIA GPUでllama.cppを使う開発者は、コードを変更せずに推論速度の向上を期待できます。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。