ggml-orgチームは2026年10月8日、llama.cppのバージョンb11510を公開しました。CUDA向けにループ処理を行うPADカーネルを追加し、65,000行を超えるテンソルやスライスを処理できるようになりました。このリリースには、Apple Silicon、Intel搭載Mac、iOS、およびUbuntu向けの複数のビルド(CPU、Vulkan、CUDA 12.8)のコンパイル済みバイナリも含まれています。コードとアテステーションはGitHubページから確認できます。
なぜ重要か
開発者は、従来の行数上限に阻まれることなく、NVIDIA GPUでより大規模な言語モデルを実行できるようになります。