ggml‑orgチームがllama.cppのバージョンb11494をリリースしました。このアップデートではCUDAバックエンドが変更され、各warpに割り当てるGDNのstate列が2列から4列になりました。これが新たなデフォルト設定です。macOS(Apple SiliconおよびIntel)、iOS、複数のUbuntuビルド向けのバイナリをダウンロードできます。
なぜ重要か
NVIDIA GPUでllama.cppを使う開発者は、コードを変更せずに推論速度の向上を期待できます。
オープンソースのLlama.cppライブラリが、CUDAの各warpでGDNのstate列を4列使うようになり、GPUの性能向上が見込めます。
短信著者: OossaOossa公開日: 1 分で読める
ggml‑orgチームがllama.cppのバージョンb11494をリリースしました。このアップデートではCUDAバックエンドが変更され、各warpに割り当てるGDNのstate列が2列から4列になりました。これが新たなデフォルト設定です。macOS(Apple SiliconおよびIntel)、iOS、複数のUbuntuビルド向けのバイナリをダウンロードできます。
NVIDIA GPUでllama.cppを使う開発者は、コードを変更せずに推論速度の向上を期待できます。
Oossa · ニュースレター
今週のAIを、わかりやすく
毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。