ggml-orgチームは、llama.cppのバージョンb11293をリリースしました。CPUとCUDAの両方で、BF16(半精度数値形式)の単項演算、GLU演算、二項演算、スケール演算が追加されています。また、BF16のビルド時の問題を修正するため、CUDAカーネルも更新されました。このアップデートは、macOS、Windows、Linux、Androidなど、多くのプラットフォームで利用できます。
なぜ重要か
開発者は、新しいGPUなどBF16に対応したハードウェアで、llama.cppのモデルをより高速に実行できるようになります。