Oossa

llama.cpp、x86 CPU向けtinyBLASでBF16/FP16に対応

オープンソースのllama.cppライブラリがtinyBLASバックエンドでBF16、FP16、FP32の端数処理をベクトル化し、CPU推論の高速化を図った。

短信OossaOossa公開日: 1 分で読める

ggml‑orgチームはllama.cppのバージョンb11398をリリースした。x86プラットフォームのtinyBLAS CPUバックエンドで、BF16、FP16、FP32の端数処理に対応した。これらの処理もベクトル化され、計算が高速化される。macOS(Apple SiliconおよびIntel)、iOS、複数のUbuntuアーキテクチャ向けに、ビルド済みバイナリが提供されている。また、参照実装を使った比較の精度を確保するため、テストにも調整が加えられた。

なぜ重要か

GPUを使わなくても、一般的なCPUでLLM推論をより高速に実行できるようになる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。