ggml-orgチームは2026年10月8日、llama.cppのリリースb11499を公開した。今回の更新では、CUDAバックエンドのroll処理にバイト単位のストライドを使うよう変更し、GPUで非連続データを正しく扱えるようにした。また、Apple Silicon、Intel搭載Mac、iOS、および複数のUbuntu向けビルド(CPU、Vulkan、CUDA 12)を新たに同梱している。すべてのファイルはGitHubのリリースページからダウンロードできる。
なぜ重要か
開発者は、より多くのGPU環境でエラーを避けてllama.cppを実行できるようになり、デスクトップやサーバーでローカルLLMを活用しやすくなる。