Oossa

llama.cpp、Q6_Kの重みの復元を高速化

バージョンb11489では、Q6_Kの重みの復元が高速化し、ループ展開も拡大。macOS、iOS、Linux向けの新しいバイナリも公開されました。

短信著者: Oossa公開日: 1 分で読める

ggml‑orgチームがllama.cppのバージョンb11489をリリースしました。リリースノートによると、今回の更新では、圧縮されたモデルの重みを利用可能な数値に戻す処理であるQ6_Kの重みの復元を高速化し、ループ展開の係数を2倍にしました。Apple Silicon、Intel搭載Mac、iOSに加え、Vulkan版やCUDA版を含む複数のUbuntu環境向けに、ビルド済みバイナリが公開されています。

なぜ重要か

重みの復元が速くなることで、同じハードウェア上でLLMをより低いレイテンシで実行できます。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。