ggml‑orgチームはllama.cppのバージョンb11398をリリースした。x86プラットフォームのtinyBLAS CPUバックエンドで、BF16、FP16、FP32の端数処理に対応した。これらの処理もベクトル化され、計算が高速化される。macOS(Apple SiliconおよびIntel)、iOS、複数のUbuntuアーキテクチャ向けに、ビルド済みバイナリが提供されている。また、参照実装を使った比較の精度を確保するため、テストにも調整が加えられた。
なぜ重要か
GPUを使わなくても、一般的なCPUでLLM推論をより高速に実行できるようになる。